🟡 🔧 ハードウェア 公開日: · 2 分で読めます ·

AMD:GEAK v3オープンソースエージェント、Instinct MI300X、MI355X、RDNA4アーキテクチャでGPUカーネルを3.02倍高速化

AMD Instinctグラフィックカード上でコードを最適化するエージェントとGPUカーネルの図

AMDはGEAK v3を発表しました。これはApache 2.0ライセンスのオープンソースエージェント(バージョンAMD-AGI/GEAK v3.2.2)で、リポジトリレベルのアプローチによりInstinct MI300X/MI355XおよびRDNA4アーキテクチャ上でHIP、Triton、FlyDSLで書かれたGPUカーネルを最適化します。このエージェントは16個のHIPカーネルで幾何平均3.02倍、17個のTritonカーネルで2.22倍の高速化を達成し、両バージョンが対応する共通のTritonカーネルの部分集合ではGEAK v3が1.95倍を達成したのに対し、GEAK v2は1.03倍にとどまりました。

🤖

この記事はAIにより一次情報源から生成されました。

GEAK v3とは何か、前バージョンとの違いは?

GEAK v3は、AMDが開発したオープンソースエージェント(Apache 2.0ライセンス、バージョンAMD-AGI/GEAK v3.2.2)で、GPUカーネル——グラフィックプロセッサ上で並列計算を直接実行する低レベルのプログラム——を自動的に最適化します。各カーネルを個別に最適化していた前バージョンとは異なり、GEAK v3はリポジトリレベルのアプローチへと移行しました。エージェントはコードリポジトリ全体を分析し、プロジェクト内での実際の使用状況の文脈でHIP、Triton、FlyDSLで書かれたカーネルを最適化します。

HIPカーネルで3.02倍、Tritonカーネルで2.22倍

16個のHIPカーネルにおいて、GEAK v3のagent-driven最適化は幾何平均高速化——テストされたカーネル集合全体における高速化率の幾何平均——3.02倍を達成し、17個のTritonカーネルでは2.22倍を達成しました。両世代が対応する共通のTritonカーネルの部分集合では前バージョンとの直接比較が可能で、そこではGEAK v3が1.95倍を達成したのに対し、GEAK v2はわずか1.03倍——未変更のコードと比べてほぼ無視できる改善にとどまりました。この差は、リポジトリレベルの文脈が、個々のカーネルを孤立して分析するだけでは発見できない最適化を、エージェントが見つけ出す助けになることを示しています。

MI300X、MI355X、RDNA4での本番実績

AMDは具体的な本番事例を挙げています。GPT-OSS 120Bモデルのattentionカーネルは8〜10%高速化され、DeepSeek V4モデルのMLA(マルチヘッド潜在アテンション)カーネルはInstinct MI355X上でスループットが2.10倍、TTFT(time-to-first-token、最初に生成されるトークンまでの時間)が3.71倍短縮されました。3Dレンダリング用カーネルは、計算精度を維持したまま36%高速化されています。テストにはRDNA4アーキテクチャ、コード名gfx1201(Navi48としても知られる)チップも含まれており、このツールの適用範囲はデータセンターを超えてプロフェッショナル向けグラフィックカードにも広がっています。

この結果は、agent-driven最適化が大規模モデルの学習向けに設計された最上位のInstinctアクセラレータだけに限定されず、ゲーミングやプロフェッショナルワークステーションを動かすコンシューマー向けRDNA4アーキテクチャでも機能することを示しています。GEAK v3がApache 2.0ライセンスの下で公開されていることは、AMD社外の開発チームがこのエージェントを取得し、自社のリポジトリに適応させ、追加のライセンスなしに自社のカーネルで最適化プロセスを繰り返せることを意味します。これにより、HIP、Triton、FlyDSLプロジェクトを開発するコミュニティにおいて、カスタムGPUコードのより速いイテレーションへの道が開かれます。

よくある質問

GEAK v3のリポジトリレベルのagent-driven最適化とは何ですか?
これは、AIエージェントが個々のGPUカーネルを単独で分析するのではなく、コードリポジトリ全体を分析し、プロジェクト内での実際の使用状況の文脈でHIP、Triton、FlyDSLカーネルを最適化するアプローチです。
GEAK v3はGEAK v2と比べてどれくらい高速ですか?
GEAK v3は16個のHIPカーネルで幾何平均3.02倍、17個のTritonカーネルで2.22倍の高速化を達成しています。両バージョンが対応する共通のTritonカーネルの部分集合では、GEAK v3が1.95倍に対し、GEAK v2はわずか1.03倍でした。
GEAK v3はすでにどの本番モデルを高速化していますか?
GPT-OSS 120Bモデルのattentionカーネルは8〜10%高速化され、DeepSeek V4モデルのMLAカーネルはMI355X上でスループットが2.10倍、TTFT(最初のトークン生成までの時間)が3.71倍短縮されました。3Dレンダリングカーネルは精度を維持したまま36%高速化されています。

📬 AIニュースをあなたの受信箱へ

毎日のダイジェストを自分仕様に——トピック、ソース、頻度を選べます。ワンクリックで解除。