🟡 🔧 하드웨어 게시일: · 2 분 읽기 ·

AMD: GEAK v3 오픈소스 에이전트, Instinct MI300X·MI355X 및 RDNA4 아키텍처에서 GPU 커널 3.02배 가속

AMD Instinct 그래픽 카드에서 코드를 최적화하는 에이전트와 GPU 커널 다이어그램

AMD가 GEAK v3를 발표했습니다. 이는 Apache 2.0 라이선스의 오픈소스 에이전트(버전 AMD-AGI/GEAK v3.2.2)로, 저장소 단위(repository-level) 접근 방식을 통해 Instinct MI300X/MI355X 및 RDNA4 아키텍처에서 HIP, Triton, FlyDSL로 작성된 GPU 커널을 최적화합니다. 이 에이전트는 16개의 HIP 커널에서 기하평균 3.02배, 17개의 Triton 커널에서 2.22배의 가속을 달성했으며, 두 버전이 모두 지원하는 공통 Triton 커널 부분집합에서는 GEAK v3가 1.95배를 기록한 반면 GEAK v2는 1.03배에 그쳤습니다.

🤖

이 기사는 AI가 1차 출처를 기반으로 생성했습니다.

GEAK v3란 무엇이며 이전 버전과 어떻게 다른가?

GEAK v3는 AMD가 개발한 오픈소스 에이전트(Apache 2.0 라이선스, 버전 AMD-AGI/GEAK v3.2.2)로, GPU 커널—그래픽 프로세서에서 병렬 연산을 직접 수행하는 저수준 프로그램—을 자동으로 최적화합니다. 각 커널을 개별적으로 최적화했던 이전 버전과 달리, GEAK v3는 저장소 단위(repository-level) 접근 방식으로 전환했습니다. 에이전트는 전체 코드 저장소를 분석하여, 프로젝트 내 실제 사용 맥락에서 HIP, Triton, FlyDSL로 작성된 커널을 최적화합니다.

HIP 커널 3.02배, Triton 커널 2.22배

16개의 HIP 커널에서 GEAK v3의 agent-driven 최적화는 기하평균 가속—테스트된 전체 커널 집합에 대한 가속 비율의 기하평균—3.02배를 달성했으며, 17개의 Triton 커널에서는 2.22배를 달성했습니다. 두 세대가 모두 지원하는 공통 Triton 커널 부분집합에서는 이전 버전과의 직접 비교가 가능한데, 여기서 GEAK v3는 1.95배를 달성한 반면 GEAK v2는 겨우 1.03배—수정되지 않은 코드에 비해 거의 무시할 수준의 개선에 그쳤습니다. 이 차이는 저장소 단위 맥락이 개별 커널만을 분석해서는 발견할 수 없는 최적화를 에이전트가 찾아내는 데 얼마나 도움이 되는지를 보여줍니다.

MI300X, MI355X, RDNA4에서의 프로덕션 실증

AMD는 구체적인 프로덕션 사례를 제시합니다. GPT-OSS 120B 모델의 attention 커널은 8~10% 가속되었고, DeepSeek V4 모델의 MLA(multi-head latent attention) 커널은 Instinct MI355X에서 처리량이 2.10배, TTFT(time-to-first-token, 첫 토큰 생성까지의 시간)가 3.71배 단축되었습니다. 3D 렌더링용 커널은 연산 정확도를 유지하면서 36% 가속되었습니다. 테스트에는 RDNA4 아키텍처, 즉 코드명 gfx1201(Navi48로도 알려짐) 칩도 포함되어 있어, 이 도구의 적용 범위가 데이터센터를 넘어 전문가용 그래픽 카드로까지 확장되었습니다.

이 결과는 agent-driven 최적화가 대규모 모델 훈련을 위해 설계된 최상위 Instinct 가속기에만 국한되지 않고, 게이밍과 전문가용 워크스테이션을 구동하는 소비자용 RDNA4 아키텍처에서도 작동함을 보여줍니다. GEAK v3가 Apache 2.0 라이선스로 공개되었다는 것은 AMD 외부의 개발팀도 이 에이전트를 가져와 자체 저장소에 맞게 조정하고, 추가 라이선스 없이 자신들의 커널에서 최적화 과정을 반복할 수 있다는 의미입니다. 이는 HIP, Triton, FlyDSL 프로젝트를 개발하는 커뮤니티에서 커스텀 GPU 코드에 대한 더 빠른 반복 개발로 이어지는 길을 엽니다.

자주 묻는 질문

GEAK v3의 저장소 단위 agent-driven 최적화란 무엇인가요?
이는 AI 에이전트가 개별 GPU 커널을 따로 분석하는 대신 전체 코드 저장소를 분석하여, 프로젝트 내 실제 사용 맥락에서 HIP, Triton, FlyDSL 커널을 최적화하는 접근 방식입니다.
GEAK v3는 GEAK v2보다 얼마나 빠른가요?
GEAK v3는 16개의 HIP 커널에서 기하평균 3.02배, 17개의 Triton 커널에서 2.22배의 가속을 달성했습니다. 두 버전이 모두 지원하는 공통 Triton 커널 부분집합에서는 GEAK v3가 1.95배를 기록한 반면 GEAK v2는 겨우 1.03배였습니다.
GEAK v3는 어떤 프로덕션 모델을 이미 가속하고 있나요?
GPT-OSS 120B 모델의 attention 커널은 8~10% 가속되었고, DeepSeek V4 모델의 MLA 커널은 MI355X에서 처리량이 2.10배, TTFT(첫 토큰 생성 시간)가 3.71배 단축되었습니다. 3D 렌더링 커널은 정확도를 유지하면서 36% 가속되었습니다.

📬 AI 뉴스를 받은편지함으로

나만의 방식으로 구성하는 일일 다이제스트 — 주제, 출처, 주기를 선택하세요. 원클릭 해지.