🟡 🏥 U praksi Objavljeno: · 2 min čitanja ·

CNCF: Goodput metrika otkriva gotovo 10× lošiju p95 latenciju kod throughput-optimiziranog LLM servinga

Graf latencije i propusnosti LLM servera koji uspoređuje throughput i goodput metrike

Akamas inženjer Graziano Casto na CNCF blogu pokazuje da je goodput, dovršeni zahtjevi u sekundi unutar ciljane latencije, bolja metrika za LLM serving od sirovog throughputa. Benchmark na Qwen2.5-7B i NVIDIA A10G GPU-u pokazuje da konfiguracija s 50% većim throughputom može imati p95 latenciju gotovo 10× veću, s 50 na 494 milisekundi.

🤖

Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.

Što je goodput i zašto se razlikuje od throughputa?

Goodput mjeri broj dovršenih zahtjeva u sekundi koji zadovoljavaju unaprijed zadanu ciljanu latenciju, dok throughput broji sve obrađene zahtjeve bez obzira jesu li dovoljno brzi. Akamas inženjer Graziano Casto u CNCF blogu pokazuje da veći throughput ne znači nužno bolju uslugu — konfiguracija može ukupno obraditi više zahtjeva, ali dio njih uz neprihvatljivo dugu latenciju za krajnjeg korisnika.

Benchmark: 50% veći throughput uz gotovo 10× lošiju latenciju

Test na modelu Qwen2.5-7B, na jednom NVIDIA A10G GPU-u unutar EKS klastera (Amazon Elastic Kubernetes Service), uz vLLM serving engine i GuideLLM alat za simulaciju opterećenja, pokazao je da konfiguracija s 50% većim kombiniranim throughputom može imati p95 time-per-output-token — latenciju ispod koje pada 95% zahtjeva — gotovo 10× veći, s otprilike 50 milisekundi na oko 494 milisekunde. Testirana su tri tipa opterećenja: chatbot sa strogim zahtjevom na TTFT (time-to-first-token, vrijeme do prvog tokena), reasoning s izlazom od oko 4.000 tokena te agentic s kratkim lančanim pozivima.

Preporuka: automatizirano pretraživanje parametara

Casto preporučuje automatizirano pretraživanje parametara poput gpu_memory_utilization, max_num_batched_tokens i max_num_seqs kako bi se serving konfiguracija optimizirala izravno za goodput, a ne za sirovi throughput. Pristup zahtijeva zasebno testiranje po tipu opterećenja jer chatbot, reasoning i agentic scenariji imaju različite ciljane latencije i tolerancije, pa jedna univerzalna konfiguracija ne pokriva sve slučajeve podjednako dobro.

Ručno pretraživanje kombinacija parametara na svakoj kombinaciji modela i GPU-a nije praktično zbog velikog broja mogućih postavki, pa Casto zagovara automatizirani proces koji sustavno testira konfiguracije i bira onu s najboljim goodputom za ciljani tip opterećenja. Timovi koji serviraju LLM u produkciji tako dobivaju konkretnu metodu za izbjegavanje zamke optimiziranja isključivo za throughput, koja u benchmarku vodi do gotovo desetorostruko lošije p95 latencije za krajnjeg korisnika.

Česta pitanja

Što je goodput i po čemu se razlikuje od throughputa?
Goodput broji samo dovršene zahtjeve u sekundi koji zadovoljavaju ciljanu latenciju, dok throughput broji sve obrađene zahtjeve bez obzira na to koliko su brzi, pa veći throughput može sakrivati lošu latenciju dijela zahtjeva.
Koliko se p95 latencija razlikovala u CNCF benchmarku?
Konfiguracija s 50% većim kombiniranim throughputom na Qwen2.5-7B modelu i NVIDIA A10G GPU-u imala je p95 time-per-output-token gotovo 10× veći, s oko 50 milisekundi kod goodput-svjesne konfiguracije na oko 494 milisekunde.
Koje parametre Akamas preporučuje za optimizaciju goodputa?
Preporučuje automatizirano pretraživanje parametara gpu_memory_utilization, max_num_batched_tokens i max_num_seqs, testirano zasebno za chatbot, reasoning i agentic tipove opterećenja.

📬 AI vijesti u tvoj inbox

Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.