AMD: MiniMax-M3 model od 428 milijardi parametara servira brže od NVIDIA B200 i B300 na Instinct MI355X GPU-ovima
AMD je demonstrirao serviranje MiniMax-M3 modela od 428 milijardi parametara na Instinct MI355X GPU-ovima koristeći ATOM i ATOMesh softver. Sparse attention smanjuje potrošnju računanja po tokenu na dvadesetinu prethodnika, a rezultati nadmašuju NVIDIA B200 na jednom čvoru te NVIDIA B300 u multi-node konfiguraciji.
Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.
Što je MiniMax-M3 i kako ga AMD servira?
MiniMax-M3 je veliki MoE (mixture-of-experts) model sa 428 milijardi parametara, od kojih je samo 22 milijarde aktivno po pojedinom tokenu, s nativnom podrškom za tekst, sliku i video u istom modelu. AMD je demonstrirao serviranje ovog modela na Instinct MI355X GPU-ovima koristeći ATOM, single-node engine za serviranje na jednom čvoru, i ATOMesh, sloj za orkestraciju serviranja preko više čvorova istovremeno.
Koliko sparse attention smanjuje potrošnju računanja?
MiniMax Sparse Attention, tehnika koja modelu dopušta da obrađuje samo relevantne dijelove ulaznog konteksta umjesto svih tokena podjednako, smanjuje potrebno računanje po tokenu na jednu dvadesetinu (1/20) prethodne generacije kod konteksta od milijun tokena.
Rezultati nadmašuju NVIDIA B200 i B300
Na jednom čvoru (ATOM EAGLE3 FP4) sustav radi u dvije radne točke. Pri visokoj interaktivnosti od 340 do 370 tokena u sekundi po korisniku postiže oko 0,6 tisuća tokena/s po GPU-u, naspram približno 0,2 tisuće kod NVIDIA B200. Pri visokoj propusnosti (17 do 135 tokena/s po korisniku) doseže 3.600 do 8.500 tokena/s po GPU-u, dok NVIDIA B200 ostvaruje 2.500 do 7.700. U multi-node konfiguraciji, ATOMesh uz Mooncake nadmašuje čak i NVIDIA B300, AMD-ov izravno konkurentski GPU segment.
Česta pitanja
- Što je MiniMax-M3?
- MiniMax-M3 je veliki MoE (mixture-of-experts) model sa 428 milijardi parametara, od čega je 22 milijarde aktivno po tokenu, s nativnom podrškom za tekst, sliku i video.
- Što su ATOM i ATOMesh?
- ATOM je AMD-ov single-node engine za serviranje AI modela na jednom čvoru s GPU-ovima, dok je ATOMesh sloj za orkestraciju serviranja modela preko više čvorova istovremeno.
- Koliko je MiniMax-M3 brži uz sparse attention?
- MiniMax Sparse Attention smanjuje potrebno računanje po tokenu na jednu dvadesetinu (1/20) prethodne generacije kod konteksta od milijun tokena, a serviranje na AMD Instinct MI355X GPU-ovima nadmašuje rezultate NVIDIA B200 i B300 GPU-ova.
Izvori
📬 AI vijesti u tvoj inbox
Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.
Povezane vijesti
NVIDIA: Spectrum-6 Ethernet switch donosi 102,4 Tb/s i dvostruko veću propusnost za gigascale AI tvornice
AMD: GEAK v3 open-source agent ubrzava GPU kernele 3,02× na Instinct MI300X, MI355X i RDNA4 arhitekturi
NVIDIA: Vera Rubin platforma trenira najveće AI modele s četvrtinom GPU-a Blackwell generacije zahvaljujući codesignu