AMD: MiniMax-M3-Modell mit 428 Milliarden Parametern bedient schneller als NVIDIA B200 und B300 auf Instinct-MI355X-GPUs
AMD hat gezeigt, wie das MiniMax-M3-Modell mit 428 Milliarden Parametern auf Instinct-MI355X-GPUs mithilfe der Software ATOM und ATOMesh bedient wird. Sparse Attention senkt den Rechenaufwand pro Token auf ein Zwanzigstel des Vorgängers, die Ergebnisse übertreffen NVIDIA B200 auf einem einzelnen Knoten und NVIDIA B300 in einer Multi-Node-Konfiguration.
Dieser Artikel wurde mithilfe von künstlicher Intelligenz aus Primärquellen erstellt.
Was ist MiniMax-M3 und wie bedient AMD es?
MiniMax-M3 ist ein großes MoE-Modell (Mixture-of-Experts) mit 428 Milliarden Parametern, von denen nur 22 Milliarden pro einzelnem Token aktiv sind, mit nativer Unterstützung für Text, Bild und Video im selben Modell. AMD hat gezeigt, wie dieses Modell auf Instinct-MI355X-GPUs mithilfe von ATOM, einer Single-Node-Engine zur Bereitstellung auf einem einzelnen Knoten, und ATOMesh, einer Schicht zur Orchestrierung der Bereitstellung über mehrere Knoten gleichzeitig, bedient wird.
Um wie viel senkt Sparse Attention den Rechenaufwand?
MiniMax Sparse Attention, eine Technik, die es dem Modell erlaubt, nur die relevanten Teile des Eingabekontexts statt aller Token gleichermaßen zu verarbeiten, senkt den benötigten Rechenaufwand pro Token bei einem Kontext von einer Million Token auf ein Zwanzigstel (1/20) der vorherigen Generation.
Ergebnisse übertreffen NVIDIA B200 und B300
Auf einem einzelnen Knoten (ATOM EAGLE3 FP4) arbeitet das System an zwei Betriebspunkten. Bei hoher Interaktivität von 340 bis 370 Token pro Sekunde pro Nutzer erreicht es rund 0,6 Tausend Token/s pro GPU, gegenüber etwa 0,2 Tausend bei NVIDIA B200. Bei hohem Durchsatz (17 bis 135 Token/s pro Nutzer) erreicht es 3.600 bis 8.500 Token/s pro GPU, während NVIDIA B200 2.500 bis 7.700 erzielt. In einer Multi-Node-Konfiguration übertrifft ATOMesh zusammen mit Mooncake sogar NVIDIA B300, AMDs direkt konkurrierendes GPU-Segment.
Häufig gestellte Fragen
- Was ist MiniMax-M3?
- MiniMax-M3 ist ein großes MoE-Modell (Mixture-of-Experts) mit 428 Milliarden Parametern, von denen 22 Milliarden pro Token aktiv sind, mit nativer Unterstützung für Text, Bild und Video.
- Was sind ATOM und ATOMesh?
- ATOM ist AMDs Single-Node-Engine zur Bereitstellung von KI-Modellen auf einem einzelnen Knoten mit GPUs, während ATOMesh eine Schicht zur Orchestrierung der Modellbereitstellung über mehrere Knoten gleichzeitig ist.
- Um wie viel schneller ist MiniMax-M3 mit Sparse Attention?
- MiniMax Sparse Attention senkt den benötigten Rechenaufwand pro Token bei einem Kontext von einer Million Token auf ein Zwanzigstel (1/20) der vorherigen Generation, und die Bereitstellung auf AMD-Instinct-MI355X-GPUs übertrifft die Ergebnisse von NVIDIA-B200- und B300-GPUs.
Quellen
📬 KI-News in dein Postfach
Ein täglicher Digest nach deinen Regeln — Themen, Quellen und Rhythmus wählbar. Abmeldung mit einem Klick.
Verwandte Nachrichten
NVIDIA: Spectrum-6-Ethernet-Switch liefert 102,4 Tb/s und doppelten Durchsatz für Gigascale-KI-Fabriken
AMD: Open-Source-Agent GEAK v3 beschleunigt GPU-Kernel um 3,02× auf Instinct MI300X, MI355X und RDNA4
NVIDIA: Vera-Rubin-Plattform trainiert die größten KI-Modelle mit einem Viertel der Blackwell-GPUs dank Codesign