🟡 🔧 Hardware Objavljeno: · 2 min čitanja ·

AMD: GEAK v3 open-source agent ubrzava GPU kernele 3,02× na Instinct MI300X, MI355X i RDNA4 arhitekturi

Dijagram GPU kernela i agenta koji optimizira kod na AMD Instinct grafičkoj kartici

AMD je objavio GEAK v3, open-source agent (Apache 2.0, verzija AMD-AGI/GEAK v3.2.2) koji repository-level pristupom optimizira GPU kernele u HIP-u, Tritonu i FlyDSL-u na Instinct MI300X/MI355X i RDNA4 arhitekturi. Agent postiže geomean speedup 3,02× na 16 HIP i 2,22× na 17 Triton kernela; na dijeljenom podskupu Triton kernela GEAK v3 postiže 1,95× naspram 1,03× kod GEAK v2.

🤖

Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.

Što je GEAK v3 i po čemu se razlikuje od prethodnika?

GEAK v3 je AMD-ov open-source agent (Apache 2.0 licenca, verzija AMD-AGI/GEAK v3.2.2) za automatiziranu optimizaciju GPU kernela — niskorazinskih programa koji izvršavaju paralelne izračune izravno na grafičkom procesoru. Za razliku od prethodne verzije, koja je svaki kernel optimizirala izolirano, GEAK v3 prelazi na repository-level pristup: agent analizira cijeli repozitorij koda i optimizira kernele napisane u HIP-u, Tritonu i FlyDSL-u u kontekstu njihove stvarne upotrebe unutar projekta.

3,02× na HIP i 2,22× na Triton kernelima

Na 16 HIP kernela agent-driven optimizacija GEAK v3 postiže geomean speedup — geometrijsku sredinu ubrzanja preko cijelog skupa testiranih kernela — od 3,02×, a na 17 Triton kernela 2,22×. Izravna usporedba s prethodnom verzijom postoji na dijeljenom podskupu Triton kernela koje podržavaju obje generacije: ondje GEAK v3 postiže 1,95× naspram tek 1,03× kod GEAK v2, praktički zanemarivog poboljšanja naspram neizmijenjenog koda. Razlika pokazuje koliko repository-level kontekst pomaže agentu pronaći optimizacije koje izolirana analiza pojedinačnog kernela ne može otkriti.

Produkcijski dokazi na MI300X, MI355X i RDNA4

AMD navodi konkretne produkcijske primjere: attention kernel modela GPT-OSS 120B ubrzan je 8-10%, dok MLA (multi-head latent attention) kernel modela DeepSeek V4 na Instinct MI355X postiže 2,10× veći throughput i 3,71× kraći time-to-first-token, vrijeme do prvog generiranog tokena. Kernel za 3D rendering ubrzan je 36% uz očuvanu točnost izračuna. Testovi obuhvaćaju i RDNA4 arhitekturu, čip gfx1201 poznat i kao Navi48, što širi doseg alata izvan podatkovnih centara i na profesionalne grafičke kartice.

Rezultati pokazuju da agent-driven optimizacija nije ograničena samo na najveće Instinct akceleratore namijenjene treniranju velikih modela, nego funkcionira i na potrošačkoj RDNA4 arhitekturi koja pokreće gaming i profesionalne radne stanice. Dostupnost GEAK v3 pod Apache 2.0 licencom znači da razvojni timovi izvan AMD-a mogu preuzeti agent, prilagoditi ga vlastitom repozitoriju i ponoviti postupak optimizacije na svojim kernelima bez dodatnog licenciranja. To otvara put bržoj iteraciji na custom GPU kodu u zajednici koja razvija HIP, Triton i FlyDSL projekte.

Česta pitanja

Što je repository-level agent-driven optimizacija u GEAK v3?
To je pristup u kojem AI agent analizira cijeli repozitorij koda, a ne pojedinačni GPU kernel izolirano, te optimizira HIP, Triton i FlyDSL kernele u kontekstu njihove stvarne upotrebe unutar projekta.
Koliko je GEAK v3 brži od GEAK v2?
GEAK v3 postiže geomean speedup od 3,02× na 16 HIP kernela i 2,22× na 17 Triton kernela; na dijeljenom podskupu Triton kernela koje podržavaju obje verzije GEAK v3 postiže 1,95× naspram tek 1,03× kod GEAK v2.
Koje produkcijske modele GEAK v3 već ubrzava?
Attention kernel modela GPT-OSS 120B ubrzan je 8-10%, MLA kernel modela DeepSeek V4 na MI355X postiže 2,10× veći throughput i 3,71× kraći time-to-first-token, a kernel za 3D rendering ubrzan je 36% uz očuvanu točnost.

📬 AI vijesti u tvoj inbox

Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.