🟢 🔧 ハードウェア 公開日: · 2 分で読めます ·

AMD、4280億パラメータのMiniMax-M3モデルがInstinct MI355X GPUでNVIDIA B200・B300を上回る速度でサービング

大規模なMiniMax-M3 AIモデルをサービングするAMD Instinct MI355X GPUサーバー

AMDは、ATOMとATOMeshソフトウェアを用いてInstinct MI355X GPU上で4280億パラメータのMiniMax-M3モデルをサービングするデモを行いました。スパースアテンションによりトークンあたりの計算量が前世代の20分の1に削減され、シングルノードではNVIDIA B200を、マルチノード構成ではNVIDIA B300を上回る結果を示しています。

🤖

この記事はAIにより一次情報源から生成されました。

MiniMax-M3とは何か、AMDはどのようにサービングしているのか?

MiniMax-M3は4280億パラメータを持つ大規模なMoE(mixture-of-experts)モデルで、そのうちトークンごとにアクティブになるのはわずか220億パラメータであり、同一モデル内でテキスト・画像・動画にネイティブ対応しています。AMDは、単一ノードでのサービングを行うシングルノードエンジンATOMと、複数ノードにわたる同時サービングをオーケストレーションするレイヤーATOMeshを用いて、このモデルをInstinct MI355X GPUでサービングするデモを行いました。

スパースアテンションによって計算量はどれだけ削減されるのか?

MiniMax Sparse Attentionは、モデルがすべてのトークンを均等に処理するのではなく、入力コンテキストの関連部分のみを処理できるようにする技術で、100万トークンのコンテキストにおいてトークンあたりの必要計算量を前世代の20分の1(1/20)に削減します。

結果はNVIDIA B200・B300を上回る

シングルノード(ATOM EAGLE3 FP4)では、システムは2つの動作点で稼働します。ユーザーあたり340〜370トークン/秒という高いインタラクティブ性では、GPUあたり約0.6千トークン/秒を達成し、NVIDIA B200の約0.2千を上回ります。ユーザーあたり17〜135トークン/秒という高スループットでは、GPUあたり3,600〜8,500トークン/秒に達し、NVIDIA B200の2,500〜7,700を上回ります。マルチノード構成では、MooncakeとATOMeshの組み合わせが、AMDの直接の競合であるNVIDIA B300さえも上回っています。

よくある質問

MiniMax-M3とは何ですか?
MiniMax-M3は4280億パラメータを持つ大規模なMoE(mixture-of-experts)モデルで、そのうち220億パラメータがトークンごとにアクティブになり、テキスト・画像・動画にネイティブ対応しています。
ATOMとATOMeshとは何ですか?
ATOMは、単一のGPUノード上でAIモデルをサービングするAMDのシングルノードエンジンであり、ATOMeshは複数のノードにわたって同時にモデルサービングをオーケストレーションするレイヤーです。
スパースアテンションによってMiniMax-M3はどれくらい高速になりますか?
MiniMax Sparse Attentionは、100万トークンのコンテキストにおいてトークンあたりの必要計算量を前世代の20分の1(1/20)に削減し、AMD Instinct MI355X GPUでのサービングはNVIDIA B200およびB300 GPUの結果を上回っています。

📬 AIニュースをあなたの受信箱へ

毎日のダイジェストを自分仕様に——トピック、ソース、頻度を選べます。ワンクリックで解除。