CNCF: Goodput metrika otkriva gotovo 10× lošiju p95 latenciju kod throughput-optimiziranog LLM servinga
Akamas inženjer Graziano Casto na CNCF blogu pokazuje da je goodput, dovršeni zahtjevi u sekundi unutar ciljane latencije, bolja metrika za LLM serving od sirovog throughputa. Benchmark na Qwen2.5-7B i NVIDIA A10G GPU-u pokazuje da konfiguracija s 50% većim throughputom može imati p95 latenciju gotovo 10× veću, s 50 na 494 milisekundi.
Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.
Što je goodput i zašto se razlikuje od throughputa?
Goodput mjeri broj dovršenih zahtjeva u sekundi koji zadovoljavaju unaprijed zadanu ciljanu latenciju, dok throughput broji sve obrađene zahtjeve bez obzira jesu li dovoljno brzi. Akamas inženjer Graziano Casto u CNCF blogu pokazuje da veći throughput ne znači nužno bolju uslugu — konfiguracija može ukupno obraditi više zahtjeva, ali dio njih uz neprihvatljivo dugu latenciju za krajnjeg korisnika.
Benchmark: 50% veći throughput uz gotovo 10× lošiju latenciju
Test na modelu Qwen2.5-7B, na jednom NVIDIA A10G GPU-u unutar EKS klastera (Amazon Elastic Kubernetes Service), uz vLLM serving engine i GuideLLM alat za simulaciju opterećenja, pokazao je da konfiguracija s 50% većim kombiniranim throughputom može imati p95 time-per-output-token — latenciju ispod koje pada 95% zahtjeva — gotovo 10× veći, s otprilike 50 milisekundi na oko 494 milisekunde. Testirana su tri tipa opterećenja: chatbot sa strogim zahtjevom na TTFT (time-to-first-token, vrijeme do prvog tokena), reasoning s izlazom od oko 4.000 tokena te agentic s kratkim lančanim pozivima.
Preporuka: automatizirano pretraživanje parametara
Casto preporučuje automatizirano pretraživanje parametara poput gpu_memory_utilization, max_num_batched_tokens i max_num_seqs kako bi se serving konfiguracija optimizirala izravno za goodput, a ne za sirovi throughput. Pristup zahtijeva zasebno testiranje po tipu opterećenja jer chatbot, reasoning i agentic scenariji imaju različite ciljane latencije i tolerancije, pa jedna univerzalna konfiguracija ne pokriva sve slučajeve podjednako dobro.
Ručno pretraživanje kombinacija parametara na svakoj kombinaciji modela i GPU-a nije praktično zbog velikog broja mogućih postavki, pa Casto zagovara automatizirani proces koji sustavno testira konfiguracije i bira onu s najboljim goodputom za ciljani tip opterećenja. Timovi koji serviraju LLM u produkciji tako dobivaju konkretnu metodu za izbjegavanje zamke optimiziranja isključivo za throughput, koja u benchmarku vodi do gotovo desetorostruko lošije p95 latencije za krajnjeg korisnika.
Česta pitanja
- Što je goodput i po čemu se razlikuje od throughputa?
- Goodput broji samo dovršene zahtjeve u sekundi koji zadovoljavaju ciljanu latenciju, dok throughput broji sve obrađene zahtjeve bez obzira na to koliko su brzi, pa veći throughput može sakrivati lošu latenciju dijela zahtjeva.
- Koliko se p95 latencija razlikovala u CNCF benchmarku?
- Konfiguracija s 50% većim kombiniranim throughputom na Qwen2.5-7B modelu i NVIDIA A10G GPU-u imala je p95 time-per-output-token gotovo 10× veći, s oko 50 milisekundi kod goodput-svjesne konfiguracije na oko 494 milisekunde.
- Koje parametre Akamas preporučuje za optimizaciju goodputa?
- Preporučuje automatizirano pretraživanje parametara gpu_memory_utilization, max_num_batched_tokens i max_num_seqs, testirano zasebno za chatbot, reasoning i agentic tipove opterećenja.
📬 AI vijesti u tvoj inbox
Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.
Povezane vijesti
arXiv:2607.16122: CRAFT metoda klasterira kriterije ocjenjivanja i otkriva slabosti kod jezičnih modela
Anthropic: Claude Code v2.1.215 i v2.1.216 popravljaju performanse, OAuth grešku i worktree izolaciju agenta
GitHub: Code Quality dostiže Generally Available status uz CodeQL analizu i Copilot Autofix popravke