AMD:4280亿参数的MiniMax-M3模型在Instinct MI355X GPU上的服务速度超过NVIDIA B200和B300
AMD展示了在Instinct MI355X GPU上使用ATOM和ATOMesh软件服务4280亿参数MiniMax-M3模型的方案。稀疏注意力机制将每token计算量降至上一代的二十分之一,结果在单节点上超越NVIDIA B200,在多节点配置下超越NVIDIA B300。
本文由人工智能基于一手来源生成。
MiniMax-M3是什么,AMD如何服务它?
MiniMax-M3是一款拥有4280亿参数的大型MoE(混合专家)模型,其中每个token仅激活220亿参数,并在同一模型中原生支持文本、图像和视频。AMD展示了在Instinct MI355X GPU上服务该模型的方案,使用了ATOM——一个用于单节点服务的单节点引擎,以及ATOMesh——一个用于跨多个节点同时编排服务的层。
稀疏注意力机制能降低多少计算量?
MiniMax Sparse Attention是一种让模型只处理输入上下文中相关部分、而非对所有token一视同仁地处理的技术,它在百万token上下文的情况下,将每token所需计算量降至上一代的二十分之一(1/20)。
结果超越NVIDIA B200和B300
在单节点(ATOM EAGLE3 FP4)上,系统运行在两个工作点。在每用户340至370 token/秒的高交互性下,每GPU可达约0.6千token/秒,而NVIDIA B200约为0.2千。在17至135 token/秒每用户的高吞吐量场景下,可达每GPU 3,600至8,500 token/秒,而NVIDIA B200为2,500至7,700。在多节点配置下,搭配Mooncake的ATOMesh甚至超越了NVIDIA B300——AMD的直接竞争GPU对手。
常见问题
- MiniMax-M3是什么?
- MiniMax-M3是一款拥有4280亿参数的大型MoE(混合专家)模型,其中每个token激活220亿参数,原生支持文本、图像和视频。
- ATOM和ATOMesh是什么?
- ATOM是AMD用于在单个GPU节点上服务AI模型的单节点引擎,而ATOMesh是用于跨多个节点同时编排模型服务的层。
- 借助稀疏注意力机制,MiniMax-M3快了多少?
- 在百万token上下文下,MiniMax Sparse Attention将每token所需计算量降至上一代的二十分之一(1/20),而在AMD Instinct MI355X GPU上的服务表现超越了NVIDIA B200和B300 GPU的结果。
📬 AI 新闻直达您的邮箱
按您的方式定制每日摘要——自选主题、来源和频率,一键退订。