🟡 🔧 硬件 发布于: · 2 分钟阅读 ·

AMD:GEAK v3开源智能体在Instinct MI300X、MI355X及RDNA4架构上将GPU内核加速3.02倍

GPU内核与在AMD Instinct显卡上优化代码的智能体示意图

AMD发布了GEAK v3,这是一个开源智能体(Apache 2.0协议,版本AMD-AGI/GEAK v3.2.2),采用repository-level方法在Instinct MI300X/MI355X及RDNA4架构上优化以HIP、Triton和FlyDSL编写的GPU内核。该智能体在16个HIP内核上实现几何平均加速3.02倍,在17个Triton内核上实现2.22倍;在两代共同支持的Triton内核子集上,GEAK v3达到1.95倍,而GEAK v2仅为1.03倍。

🤖

本文由人工智能基于一手来源生成。

GEAK v3是什么,与前代有何不同?

GEAK v3是AMD推出的开源智能体(Apache 2.0协议,版本AMD-AGI/GEAK v3.2.2),用于自动化优化GPU内核——直接在图形处理器上执行并行计算的底层程序。与逐一孤立优化每个内核的前代版本不同,GEAK v3转向了repository-level方法:智能体分析整个代码仓库,并在项目实际使用场景的上下文中优化以HIP、Triton和FlyDSL编写的内核。

HIP内核3.02倍,Triton内核2.22倍

在16个HIP内核上,GEAK v3的agent-driven优化实现了几何平均加速——即整个测试内核集合上加速比的几何平均值——达到3.02倍,在17个Triton内核上则为2.22倍。在两代版本共同支持的Triton内核子集上可以进行直接对比:GEAK v3在此达到1.95倍,而GEAK v2仅为1.03倍,相较未修改代码几乎可以忽略不计。这一差距表明,repository-level上下文能帮助智能体发现孤立分析单个内核所无法察觉的优化空间。

在MI300X、MI355X和RDNA4上的生产级验证

AMD给出了具体的生产实例:GPT-OSS 120B模型的attention内核加速了8-10%,而DeepSeek V4模型的MLA(多头潜在注意力)内核在Instinct MI355X上实现了2.10倍的吞吐量提升,以及3.71倍更短的首个token生成时间(time-to-first-token)。3D渲染内核在保持计算精度的同时加速了36%。测试还覆盖了RDNA4架构,即代号gfx1201、也称Navi48的芯片,这将该工具的应用范围从数据中心扩展到了专业级显卡。

结果表明,agent-driven优化并不局限于专为训练大模型设计的最高端Instinct加速器,同样适用于驱动游戏与专业工作站的消费级RDNA4架构。GEAK v3以Apache 2.0协议开源,意味着AMD以外的开发团队可以获取该智能体,将其应用于自己的代码仓库,并在自有内核上重复优化流程,无需额外授权。这为开发HIP、Triton和FlyDSL项目的社区在自有GPU代码上实现更快迭代打开了通路。

常见问题

GEAK v3中的repository-level agent-driven优化是什么?
这是一种AI智能体分析整个代码仓库、而非孤立地分析单个GPU内核的方法,能在项目实际使用场景的上下文中优化HIP、Triton和FlyDSL内核。
GEAK v3比GEAK v2快多少?
GEAK v3在16个HIP内核上实现3.02倍的几何平均加速,在17个Triton内核上实现2.22倍;在两个版本共同支持的Triton内核子集上,GEAK v3达到1.95倍,而GEAK v2仅为1.03倍。
GEAK v3已经加速了哪些生产级模型?
GPT-OSS 120B模型的attention内核加速了8-10%,DeepSeek V4模型的MLA内核在MI355X上实现2.10倍的吞吐量提升和3.71倍更短的首个token生成时间,3D渲染内核在保持精度的同时加速了36%。

📬 AI 新闻直达您的邮箱

按您的方式定制每日摘要——自选主题、来源和频率,一键退订。