AMD, 4,280억 파라미터 MiniMax-M3 모델이 Instinct MI355X GPU에서 NVIDIA B200·B300보다 빠르게 서빙
AMD가 ATOM과 ATOMesh 소프트웨어를 사용해 Instinct MI355X GPU에서 4,280억 파라미터 MiniMax-M3 모델을 서빙하는 것을 시연했습니다. 스파스 어텐션이 토큰당 연산량을 이전 세대의 20분의 1로 줄였으며, 단일 노드에서는 NVIDIA B200을, 멀티 노드 구성에서는 NVIDIA B300을 능가하는 결과를 보였습니다.
이 기사는 AI가 1차 출처를 기반으로 생성했습니다.
MiniMax-M3란 무엇이며 AMD는 이를 어떻게 서빙하는가?
MiniMax-M3는 4,280억 개의 파라미터를 가진 대형 MoE(mixture-of-experts) 모델로, 이 중 개별 토큰당 활성화되는 것은 220억 개에 불과하며, 하나의 모델 안에서 텍스트, 이미지, 비디오를 네이티브로 지원합니다. AMD는 단일 노드 서빙을 위한 싱글 노드 엔진 ATOM과 여러 노드에 걸친 동시 서빙을 오케스트레이션하는 계층인 ATOMesh를 사용해, Instinct MI355X GPU에서 이 모델을 서빙하는 것을 시연했습니다.
스파스 어텐션은 연산량을 얼마나 줄이는가?
MiniMax Sparse Attention은 모델이 모든 토큰을 동일하게 처리하는 대신 입력 컨텍스트 중 관련 있는 부분만 처리할 수 있게 하는 기술로, 100만 토큰 컨텍스트에서 토큰당 필요한 연산량을 이전 세대의 20분의 1(1/20)로 줄입니다.
결과는 NVIDIA B200과 B300을 능가한다
단일 노드(ATOM EAGLE3 FP4)에서 시스템은 두 가지 작동 지점에서 구동됩니다. 사용자당 초당 340370토큰이라는 높은 상호작용성에서는 GPU당 약 0.6천 토큰/초를 달성하는데, 이는 NVIDIA B200의 약 0.2천에 비해 우수합니다. 사용자당 초당 17135토큰이라는 높은 처리량에서는 GPU당 3,6008,500토큰/초에 도달하는데, 이는 NVIDIA B200의 2,5007,700을 상회합니다. 멀티 노드 구성에서는 Mooncake와 결합한 ATOMesh가 AMD의 직접적인 경쟁 상대인 NVIDIA B300조차 능가합니다.
자주 묻는 질문
- MiniMax-M3란 무엇입니까?
- MiniMax-M3는 4,280억 개의 파라미터를 가진 대형 MoE(mixture-of-experts) 모델로, 이 중 220억 개가 토큰당 활성화되며 텍스트, 이미지, 비디오를 네이티브로 지원합니다.
- ATOM과 ATOMesh는 무엇입니까?
- ATOM은 단일 GPU 노드에서 AI 모델을 서빙하는 AMD의 싱글 노드 엔진이며, ATOMesh는 여러 노드에 걸쳐 모델 서빙을 동시에 오케스트레이션하는 계층입니다.
- 스파스 어텐션으로 MiniMax-M3는 얼마나 빨라집니까?
- MiniMax Sparse Attention은 100만 토큰 컨텍스트에서 토큰당 필요한 연산량을 이전 세대의 20분의 1(1/20)로 줄이며, AMD Instinct MI355X GPU에서의 서빙 성능은 NVIDIA B200 및 B300 GPU의 결과를 능가합니다.
📬 AI 뉴스를 받은편지함으로
나만의 방식으로 구성하는 일일 다이제스트 — 주제, 출처, 주기를 선택하세요. 원클릭 해지.