🟢 🔧 Hardware Objavljeno: · 1 min čitanja ·

AMD: MiniMax-M3 model od 428 milijardi parametara servira brže od NVIDIA B200 i B300 na Instinct MI355X GPU-ovima

AMD Instinct MI355X GPU poslužitelj koji servira veliki MiniMax-M3 AI model

AMD je demonstrirao serviranje MiniMax-M3 modela od 428 milijardi parametara na Instinct MI355X GPU-ovima koristeći ATOM i ATOMesh softver. Sparse attention smanjuje potrošnju računanja po tokenu na dvadesetinu prethodnika, a rezultati nadmašuju NVIDIA B200 na jednom čvoru te NVIDIA B300 u multi-node konfiguraciji.

🤖

Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.

Što je MiniMax-M3 i kako ga AMD servira?

MiniMax-M3 je veliki MoE (mixture-of-experts) model sa 428 milijardi parametara, od kojih je samo 22 milijarde aktivno po pojedinom tokenu, s nativnom podrškom za tekst, sliku i video u istom modelu. AMD je demonstrirao serviranje ovog modela na Instinct MI355X GPU-ovima koristeći ATOM, single-node engine za serviranje na jednom čvoru, i ATOMesh, sloj za orkestraciju serviranja preko više čvorova istovremeno.

Koliko sparse attention smanjuje potrošnju računanja?

MiniMax Sparse Attention, tehnika koja modelu dopušta da obrađuje samo relevantne dijelove ulaznog konteksta umjesto svih tokena podjednako, smanjuje potrebno računanje po tokenu na jednu dvadesetinu (1/20) prethodne generacije kod konteksta od milijun tokena.

Rezultati nadmašuju NVIDIA B200 i B300

Na jednom čvoru (ATOM EAGLE3 FP4) sustav radi u dvije radne točke. Pri visokoj interaktivnosti od 340 do 370 tokena u sekundi po korisniku postiže oko 0,6 tisuća tokena/s po GPU-u, naspram približno 0,2 tisuće kod NVIDIA B200. Pri visokoj propusnosti (17 do 135 tokena/s po korisniku) doseže 3.600 do 8.500 tokena/s po GPU-u, dok NVIDIA B200 ostvaruje 2.500 do 7.700. U multi-node konfiguraciji, ATOMesh uz Mooncake nadmašuje čak i NVIDIA B300, AMD-ov izravno konkurentski GPU segment.

Česta pitanja

Što je MiniMax-M3?
MiniMax-M3 je veliki MoE (mixture-of-experts) model sa 428 milijardi parametara, od čega je 22 milijarde aktivno po tokenu, s nativnom podrškom za tekst, sliku i video.
Što su ATOM i ATOMesh?
ATOM je AMD-ov single-node engine za serviranje AI modela na jednom čvoru s GPU-ovima, dok je ATOMesh sloj za orkestraciju serviranja modela preko više čvorova istovremeno.
Koliko je MiniMax-M3 brži uz sparse attention?
MiniMax Sparse Attention smanjuje potrebno računanje po tokenu na jednu dvadesetinu (1/20) prethodne generacije kod konteksta od milijun tokena, a serviranje na AMD Instinct MI355X GPU-ovima nadmašuje rezultate NVIDIA B200 i B300 GPU-ova.

📬 AI vijesti u tvoj inbox

Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.