🔧 硬件

60 条新闻

🟡 🔧 硬件 2026年7月17日 · 2 分钟阅读

NVIDIA:得益于协同设计,Vera Rubin平台以四分之一的Blackwell世代GPU数量训练最大规模的AI模型

以蓝色调呈现的服务器芯片与数据中心抽象图

NVIDIA称新的Vera Rubin平台凭借硬件与软件的端到端协同设计(codesign),仅用Blackwell世代四分之一数量的GPU即可训练出最大规模的AI模型。Nemotron 3 Ultra模型在SWE-bench Verified基准测试中取得71.7%的成绩,Vera CPU的吞吐量比x86替代方案高出约30%。

🟡 🔧 硬件 2026年7月16日 · 2 分钟阅读

AMD:AIMs 2.2带来面向Instinct、EPYC和Radeon的推理微服务

编辑插图:AMD ROCm标志,背景为Docker容器和GPU芯片

AMD发布AIMs 2.2——为Instinct GPU加速器、EPYC CPU和Radeon GPU提供自动配置的标准化Docker推理微服务,支持Gemma-4 31B、Llama-3.1 8B和Qwen3等模型。

🟢 🔧 硬件 2026年7月16日 · 1 分钟阅读

AMD:AI代码助手(Cursor + Claude Opus 4.7)将MI250 GPU内核加速28.3倍

AMD Instinct MI250上HIP内核加速图表,使用Cursor IDE和Claude Opus 4.7

AMD ROCm博客介绍了工程师如何在代理模式下使用Cursor IDE与Claude Opus 4.7优化AMD Instinct MI250上的双精度HIP内核。通过约45次实验分四个阶段,实现了28.3倍加速——运行时间从46.7秒降至1.65秒——且位完全相同,容差为1e-12。

🟢 🔧 硬件 2026年7月15日 · 2 分钟阅读

AMD:hipVS——面向Instinct的GPU向量检索库,兼容cuVS API,并附智能体RAG演示

hipVS向量检索架构图:AMD Instinct GPU上的四种算法与智能体RAG系统

AMD发布了hipVS,这是一个基于hipRAFT算法、面向AMD Instinct GPU的GPU加速向量检索库。该库与NVIDIA cuVS平台API兼容,支持四种检索算法,并附带智能体RAG系统演示——该系统将查询分解为3至5个子查询。

🟡 🔧 硬件 2026年7月14日 · 1 分钟阅读

NVIDIA:每瓦性能成为关键指标——Blackwell GB300效率最高达Hopper的25倍

编辑插图:NVIDIA Blackwell GB300 NVL72芯片,附与上一代Hopper的效率对比图

以DeepSeek V4 Pro模型测试,NVIDIA Blackwell GB300 NVL72的每瓦性能最高可达Hopper的25倍;仅靠软件优化,在一个月内实现最高5倍的效率提升。

🟡 🔧 硬件 2026年7月13日 · 1 分钟阅读

AMD:GEAK智能体自动优化DeepSeek-V4 MLA内核,MI355上实现最高9倍加速

编辑插图:AMD MI355 GPU加速器图示,显示GEAK智能体生成优化的Triton内核代码

AMD的GEAK GPU内核自动化优化智能体将DeepSeek-V4 MLA内核从PyTorch迁移到MI355加速器的Triton。结果显示预填充速度最高提升9.13倍,解码几何平均加速4.94倍,SGLang框架中端到端吞吐量提升2.10倍。

🟢 🔧 硬件 2026年7月10日 · 1 分钟阅读

AMD: ROCm上的SGLang Diffusion将图像生成与编辑带到Instinct GPU——来自LLM领域的推理框架向扩散模型扩展

创意插图:AMD GPU芯片,生成的图像透过扩散层从中涌现

AMD发布了在Instinct GPU上通过ROCm技术栈运行SGLang Diffusion的教程,支持图像生成与编辑扩散模型。SGLang最初因加速大型语言模型而流行,现在将支持范围扩展至图像扩散领域,从而增强AMD在NVIDIA生态之外的AI推理产品竞争力。

🟢 🔧 硬件 2026年7月9日 · 1 分钟阅读

AMD: FlyDSL——Python DSL 承诺以更少代码实现手写 HIP C++ GPU 核函数的性能

编辑插图:Python 蛇缠绕 GPU 芯片,芯片中流出优化的数据流

FlyDSL 是 AMD 的 Python 领域特定语言,用于编写 GPU 核函数,根据新的 ROCm 指南,其性能可媲美手动优化的 HIP C++ 代码,同时代码量更少。AMD 发布了移植现有 HIP 核函数的实用指南,将 FlyDSL 定位为 NVIDIA CUDA 工具链的 Python 优先替代方案。

🟢 🔧 硬件 2026年7月7日 · 3 分钟阅读

AMD详解MI355X的占用率数学:高占用率并非峰值吞吐量的必要条件

编辑插图:AMD CDNA4 MI355X GPU占用率数学与内核代码优化

AMD ROCm团队发布了CDNA4架构GPU占用率手动计算技术指南。核心发现:MI355X上的矩阵密集型内核在仅12%占用率时即可达到峰值吞吐量——对于来自CUDA生态系统的从业者而言,这是一个反直觉的结果。

🟢 🔧 硬件 2026年7月7日 · 2 分钟阅读

NVIDIA Vera:为何智能体AI需要更快的核心,而非更多核心

编辑插图:搭载Olympus核心的NVIDIA Vera CPU,针对AI智能体循环进行优化

搭载Olympus核心的NVIDIA Vera CPU比Grace处理器提升50% IPC,并提供3.4 TB/s核心间带宽。Perplexity在编码智能体工作流上测得1.5倍的任务完成速度提升。

🟢 🔧 硬件 2026年7月6日 · 3 分钟阅读

AMD Quark在Instinct MI350上以MXFP4量化FLUX.1-dev,实现1.92倍加速

编辑插图:AMD MI350 MXFP4量化加速扩散模型图像生成

AMD Quark 0.12通过Diffusers和xDiT框架,在Instinct MI350 GPU上实现了FLUX.1-dev图像生成模型的MXFP4量化。配合torch.compile,MXFP4 ASM比BF16 eager基线实现1.92倍加速,CLIP评分与参考值相同。

🟢 🔧 硬件 2026年7月6日 · 3 分钟阅读

AMD Primus Tuning Agent自动为MI355X集群寻找最优LLM配置

编辑插图:AMD Primus在MI355X上自动调优语言模型训练配置

AMD ROCm Primus Tuning Agent结合确定性种子规划器和LLM引导的探索循环,自动为AMD Instinct GPU上的LLM训练找到最优配置。在Mixtral 8×22B上,约30分钟的搜索实现了比AMD参考基准高27%的吞吐量。

🟢 🔧 硬件 2026年7月6日 · 3 分钟阅读

量子技术与AI:当下已成现实与仍属未来的边界

编辑插图:量子技术与AI在先进材料研究中的互补性

Multiverse Computing和东芝公司的行业专家为OECD.ai分析了量子技术在哪些方面已经改变AI,以及乐观预期在哪些方面缺乏证据支撑。张量网络将计算需求降低10至100倍;更广泛的量子机器学习应用在未来十年内无法实现。

🟡 🔧 硬件 2026年7月3日 · 2 分钟阅读

AMD AgentKernelArena:针对GPU内核优化的AI代理开放基准测试框架

编辑插图:用于AI代理内核代码优化基准测试的AMD MI355X GPU芯片

AMD Research于2026年7月3日发布了开放基准测试框架AgentKernelArena,用于衡量AI编程代理优化真实GPU内核的能力。在四个类别共214个任务中,AMD自研的GEAKv3(Claude Opus 4.6)以9.04倍加速在HIP内核上领先,Claude Code(Opus 4.6)以6.08倍位居第二。所有实验均在ROCm 7.1.1环境下的AMD Instinct MI300X上进行。

🟡 🔧 硬件 2026年7月3日 · 3 分钟阅读

AMD Eagle3与Quark FP8:推测性解码在MI355X上实现最高2.00倍吞吐量

编辑插图:AMD Eagle3推测性解码在AMD Instinct GPU上实现加速推理

AMD ROCm团队于2026年7月3日发布了Eagle3推测性解码在AMD硬件上的生产应用详情。Eagle3多层方法、vLLM后端和AMD Quark FP8量化的组合,在AMD Instinct MI355X上为Kimi-K2.5实现1.69倍至2.00倍的吞吐量提升,为MiniMax-M2.5实现1.38倍至1.79倍的提升,且输出质量无损失。

🟢 🔧 硬件 2026年7月3日 · 3 分钟阅读

AMD ROCm:GPU驻留YOLO26流水线将视频帧从解码到检测全程保留在VRAM中

编辑插图:AMD Radeon GPU使用YOLO26流水线进行视频目标检测

AMD发布了一种GPU驻留目标检测流水线,结合rocDecode、DLPack、PyTorch和MIGraphX,确保视频帧在最终检测结果出来之前始终保留在VRAM中。

🟢 🔧 硬件 2026年6月30日 · 2 分钟阅读

NVIDIA:Blackwell 软件堆栈在一个月内将 DeepSeek V4 的 token 成本降低五倍

编辑配图:NVIDIA Blackwell 推理软件堆栈将每 token 成本降低五倍

NVIDIA 详解了在 Blackwell 架构上叠加的软件优化——从 NVFP4 精度到推测性解码——如何在 DeepSeek V4 模型上实现高达 20 倍的吞吐量提升和五倍的 token 成本降低。

🟡 🔧 硬件 2026年6月29日 · 2 分钟阅读

AMD:ROCm低延迟GEMM内核在Instinct MI355X上将LLM推理提速最高1.79倍

编辑插图:ROCm低延迟GEMM内核在Instinct MI355X上将LLM推理提速最高1.79倍,无文字无人脸

AMD在AITER框架(AI Tensor Engine for ROCm)中发布了FlyDSL系统,可自动生成专用GEMM内核,用于AMD GPU上LLM解码阶段。结果:平均延迟降低1.64倍,针对M≤8 token的最关键场景加速1.79倍,在配备256个计算单元的Instinct MI355X上测试。

🟢 🔧 硬件 2026年6月28日 · 1 分钟阅读

AMD: Resource Manager 自动抢占空闲 GPU 工作负载,将资源归还集群共享池

编辑插图:数据中心内排列的 GPU 加速器及资源流示意,无文字无人脸

AMD Resource Manager 新增了自动抢占(pre-emption)功能:监控每个工作负载的 GPU 使用率,并在低于可配置阈值(如 10%)超过指定空闲计时器(如 15 分钟)后终止相应作业。提供两种策略——仅在 GPU 有压力时抢占或始终抢占——将被不活跃开发环境占用的资源归还共享池。

🟡 🔧 硬件 2026年6月27日 · 1 分钟阅读

AMD:MI355X上的MXFP4/MXFP6混合精度量化——吞吐量最高提升29%

编辑插图:AMD Instinct MI355X GPU加速器,附混合精度量化示意图和吞吐量对比图

AMD在Instinct MI355X加速器上展示了W_MXFP4_A_MXFP6混合精度量化技术,与BF16基准相比吞吐量最高提升29%,同时保持接近FP8标准的精度,使用vLLM框架进行生产推理。

🟡 🔧 硬件 2026年6月26日 · 1 分钟阅读

英伟达与AWS:搭载Blackwell GPU的EC2 G7实例带来4.6倍AI推理性能提升

编辑插图:AWS数据中心中带有蓝色光效的英伟达Blackwell GPU服务器机架

英伟达与AWS宣布搭载RTX PRO 4500 Blackwell GPU的EC2 G7实例,相比上一代G6提供4.6倍的AI推理性能,而cuVS库成为Amazon OpenSearch Serverless的默认选项,带来10倍更快的向量索引速度。

🔴 🔧 硬件 2026年6月25日 · 2 分钟阅读

OpenAI:Jalapeño — 减少对NVIDIA依赖的自研LLM推理ASIC芯片

编辑插图:标有Jalapeño的未来感AI推理芯片置于电路板上,绿色强调光效,无人脸或文字

OpenAI与博通联合宣布Jalapeño——专为LLM推理优化的定制ASIC芯片。这是OpenAI进入自研芯片领域的战略举措,与谷歌TPU、苹果神经引擎和AWS Trainium并列,同时减少对NVIDIA GPU的依赖。

🟢 🔧 硬件 2026年6月25日 · 1 分钟阅读

AMD: ATOM优化器 — MI355X上的DeepSeek-V4的DP注意力与双批次重叠

编辑插图:AMD MI355X GPU芯片与推理工作负载吞吐量优化图表

ATOM是AMD为MI355X GPU开发的开源推理引擎,针对DeepSeek-V4带来两项优化:PrefillDelayer消除了秩协调时的空闲损耗,Two-Batch Overlap通过重叠网络操作加速令牌负载均衡。

🟢 🔧 硬件 2026年6月24日 · 1 分钟阅读

AMD ROCm:EAGLE3推测解码在MI325X上将Kimi-K2.5加速33%

编辑插图:数据中心中的AMD Instinct MI325X GPU卡,背景显示文本生成速度提升图表

AMD ROCm团队在8×Instinct MI325X上演示了EAGLE3推测解码技术,使用Kimi-K2.5模型,输出吞吐量提升33%,中位令牌间延迟降低58%,GSM8K基准测试精度无损失。

🟡 🔧 硬件 2026年6月23日 · 2 分钟阅读

NVIDIA:JUPITER——欧洲首台 E 级超算在 ISC 2026 创下科学记录

编辑插图:欧洲数据中心,展示 NVIDIA Grace Hopper 芯片和蓝色 InfiniBand 线缆

JUPITER 是欧洲首台 E 级超级计算机,位于德国于利希研究中心。搭载 NVIDIA Grace Hopper 超级芯片和 Quantum-X800 InfiniBand 网络,JUPITER 已完成860亿神经元的完整映射,打破了50量子比特模拟的量子记录,并在气候模拟中创下世界纪录。

🟡 🔧 硬件 2026年6月23日 · 2 分钟阅读

NVIDIA:Vera CPU 落户洛斯阿拉莫斯——智能体 AI 性能提升7倍,三台新超算同步推进

编辑插图:NVIDIA Vera CPU 处理器芯片和研究实验室超算架构示意图

搭载 Olympus 核心的 NVIDIA Vera CPU 将进驻洛斯阿拉莫斯国家实验室,在 URSA 工作负载上较现有 Crossroads x86 处理器性能提升7倍,热传导蒙特卡洛模拟性能提升3倍。三台新超算 Mission、Vision 和 Veritas 计划于2027年投入运营。

🟢 🔧 硬件 2026年6月23日 · 1 分钟阅读

NVIDIA:CUDA-X 库 cuPhoton、DAQIRI 和 ALCHEMI 加速天文学、化学与材料研究

编辑插图:NVIDIA GPU 超算硬件驱动科学数据可视化,展示天文和分子图形

NVIDIA 发布了三个面向科学 AI 的新 CUDA-X 软件库:cuPhoton 为天文学带来高达14,900倍的加速,ALCHEMI 在 Lila Sciences 实现材料筛选50倍提速,DAQIRI 为物理探测器加速实时网络数据采集。

🟢 🔧 硬件 2026年6月20日 · 1 分钟阅读

AMD:ROCm优化Matrix3D框架,在Instinct GPU上将3D世界渲染速度提升最高54%

编辑插图:程序化生成的3D景观从GPU核心中浮现

AMD在ROCm博客上介绍了针对AMD Instinct GPU上可探索3D世界生成框架Matrix3D的优化工作。通过将CUDA专用组件替换为Triton内核,并使用gsplat库实现3DGS,MI250 GPU上的渲染速度提升了54%,MI300上提升了50%,渲染内核本身比CUDA版本快36%。

🟡 🔧 硬件 2026年6月19日 · 1 分钟阅读

AMD:大型语言模型训练中RoCE网络流量模式分析

编辑插图:大型语言模型训练中RoCE网络流量模式分析

AMD发布了一份比较分析报告,研究训练四款大型语言模型——GPT-4、Llama 3、DeepSeek-V2和Grok 4.0——时产生的RoCE网络流量模式,为在多GPU节点横向扩展集群中构建AI基础设施提供了实践指南。

🟢 🔧 硬件 2026年6月18日 · 1 分钟阅读

AMD:开源 Schola 在 ROCm 平台上连接 Unreal Engine 与强化学习,用于机器人手臂训练

编辑插图:在仿真环境中通过强化学习训练机器人手臂

AMD 推出了 Schola,这是一款用于 Unreal Engine 的开源插件,通过 Python 框架和 gRPC 实现与 Gymnasium 兼容的强化学习训练。示例中,协作机器人手臂 xArm6 在 Unreal Engine 5.7 中配合 MuJoCo 物理引擎、PPO 算法和 PyTorch 在 AMD ROCm GPU 加速栈上进行训练。教程展示了一个到达任务,机械臂末端移动至随机目标位置。

🟡 🔧 硬件 2026年6月17日 · 1 分钟阅读

AMD:Instinct MI355X在MLPerf Training v6.0中与NVIDIA差距缩至5%,性能比上代提升3.5倍

编辑配图:数据中心中的AMD Instinct MI355X加速器

AMD在MLPerf Training v6.0中展示了Instinct MI355X在LLM基准测试中与同级NVIDIA GPU性能差距约为5%。MI355X比去年的MI300X快3.5倍,比上一轮快13–19%。AMD首次引入MXFP4(FP4)训练配方和Primus统一框架,并完成了包含512块MI300X GPU、64个节点的多节点提交。

🟡 🔧 硬件 2026年6月17日 · 1 分钟阅读

NVIDIA Blackwell横扫MLPerf Training 6.0 — 7项基准全部第一,GB300速度提升最高1.6倍

编辑配图:NVIDIA Blackwell GPU集群用于AI模型训练

NVIDIA宣布其Blackwell平台在MLPerf Training 6.0全部七项测试中取得最佳成绩。GB300 NVL72训练速度比GB200 NVL72最高提升1.6倍,最大规模提交使用8192块Blackwell GPU训练拥有6710亿参数的DeepSeek-V3模型。CoreWeave用8192块GPU在2.02分钟内完成DeepSeek-V3 671B训练,微软Azure用7.07分钟完成Llama 3.1 405B训练。

🟡 🔧 硬件 2026年6月16日 · 1 分钟阅读

AMD:面向Instinct GPU的全新ATOM推理引擎提供OpenAI兼容API和MoE优化

编辑插图:用于AI模型服务的AMD Instinct GPU技术栈

AMD发布了ATOM推理引擎,专为Instinct GPU设计,提供OpenAI兼容API并协调KV缓存、调度和并行性。ATOM位于ROCm技术栈顶层,搭配AITER内核和MoRI RDMA通信,支持TP、DP和EP并行,针对DeepSeek V2至V4、Mixtral和Qwen3-MoE等MoE模型进行了优化。提供FP8、MXFP4、INT8和INT4量化,以及配备EAGLE提议器的MTP投机解码。

🟢 🔧 硬件 2026年6月12日 · 3 分钟阅读

退役 Pixel 手机变身数据中心:2,000台设备,碳足迹减少50%

编辑插图:Google 将2,000台退役 Pixel 手机改造为低碳数据中心

加州大学圣地亚哥分校研究人员在 Google 支持下,正在用2,000台退役 Pixel 智能手机构建一个数据中心。通过保留主板,可节省约50%的内嵌碳排放;由25至50台手机组成的集群,已能应对75门并行计算学生课程的峰值负载。

🟡 🔧 硬件 2026年6月4日 · 2 分钟阅读

Black Forest Labs:FLUX.2 [klein] 预装登陆 ASUS ProArt 笔记本

编辑插图:Black Forest Labs:FLUX.2 [klein] 预装登陆 ASUS ProArt 笔记本

Black Forest Labs 与 ASUS 及 NVIDIA 合作,将 FLUX.2 [klein] 预装于 ASUS ProArt 消费级笔记本。这是 FLUX 模型首次以预装形式出现在消费级硬件上。这款 40 亿参数的模型可在本地、无需依赖云端的情况下,在不到一秒内完成图像的生成与编辑。

🟡 🔧 硬件 2026年6月1日 · 1 分钟阅读

OpenAI:宣布在密歇根州建设 Stargate 数据中心

编辑插图:宣布在密歇根州建设 Stargate 数据中心

OpenAI 宣布将在美国密歇根州建设一座全新的 Stargate 数据中心。这是其算力基础设施项目 Stargate 的扩张,OpenAI 将其置于所谓 Intelligence Age 的语境之中。本次公告未详述容量和投资等细节,因此请参阅官方来源。

🟢 🔧 硬件 2026年6月1日 · 1 分钟阅读

AMD:阿里巴巴 ROLL 框架可在 Instinct GPU 上原生运行

编辑插图:阿里巴巴 ROLL 框架可在 Instinct GPU 上原生运行

AMD 宣布,阿里巴巴的开源强化学习框架 ROLL 现已可借助 ROCm 软件在 AMD Instinct GPU 上原生运行,无需修改代码、自定义补丁或非标准构建。此次合作包括 vLLM 兼容性、针对 Ray 的修复,以及对大语言模型分布式 RL 训练的支持。

🟢 🔧 硬件 2026年5月29日 · 1 分钟阅读

AMD:MI300X上的推测解码将推理加速4.3倍

编辑插图:MI300X上的推测解码将推理加速4.3倍

AMD在ROCm博客上介绍了在Instinct MI300X GPU上实现的推测解码。这种由较小draft模型预测token、较大模型进行验证的技术,相比经典自回归生成实现了最高4.3倍的吞吐量提升。

🟢 🔧 硬件 2026年5月27日 · 2 分钟阅读

AMD ROCm:4波交错优化FP8 GEMM内核,为Instinct MI355X(CDNA 4)每波提供512个向量寄存器

Urednička ilustracija: 4-valna interleave optimizacija FP8 GEMM kernela za Instinct MI355X (CDNA 4) udostručuje regist

AMD ROCm博客介绍了针对搭载CDNA 4架构的Instinct MI355X加速器的FP8 GEMM(混合精度矩阵乘法)内核的全新4波交错方法。该优化将布局从8波乒乓方案改为每波拥有完整512个VGPR寄存器的4波设计,通过基于XOR的swizzle消除LDS内存冲突,并通过精确交错MFMA指令与数据加载来隐藏内存延迟。

🟢 🔧 硬件 2026年5月27日 · 2 分钟阅读

PyTorch:TokenSpeed在NVIDIA Blackwell GPU上以Qwen3.5-397B-A17B实现580 token/s创纪录速度

Urednička ilustracija: TokenSpeed postiže rekordnih 580 token/s na Qwen3.5-397B-A17B s NVIDIA Blackwell GPU-ima

LightSeek Foundation的开源LLM推理引擎TokenSpeed(MIT许可证)使用八块NVIDIA Blackwell B200 GPU在TP8配置下,以Qwen3.5-397B-A17B模型实现了每秒580个令牌的速度。该记录在带前缀缓存和CPU-GPU执行重叠的智能体工作负载下实现,在100万令牌上下文下性能下降不足16%。

🟡 🔧 硬件 2026年5月25日 · 1 分钟阅读

AMD:Ryzen AI Max+ 395利用统一内存架构运行多达1220亿参数的LLM模型

Urednička ilustracija: Ryzen AI Max+ 395 pokreće LLM modele do 122 milijarde parametara uz zajedničku memoriju

AMD ROCm博客发布了关于Ryzen AI Max+ 395处理器上LLM推理的详细分析,该处理器采用UMA(统一内存架构)设计。配备128 GB LPDDR5X内存的系统在完整GPU卸载模式下,于Qwen3.5 35B MoE模型上实现42词元/秒的速度,并通过结合CPU与GPU内存支持多达1220亿参数的模型。

🟢 🔧 硬件 2026年5月23日 · 3 分钟阅读

AMD:Gluon块级模型在Instinct MI355上实现MXFP4 5.255 TFLOPS GEMM内核

编辑插图:带矩阵单元布局和流水线流的 GPU 加速器

AMD ROCm团队发布了在MI355 GPU上使用Gluon编程模型编写高性能GEMM内核的教程。经过优化的FP16内核达到1.489 TFLOPS,MFMA效率98.75%,扩展到BF8(3.257 TFLOPS)和MXFP4(5.255 TFLOPS)展示了对现代AI工作负载的适用性。教程包含将L2缓存未命中从530万减少到410万的工作组重映射与swizzle技术。

🟡 🔧 硬件 2026年5月21日 · 1 分钟阅读

AMD:ROCm 7.13带来MI350P GPU、多VF虚拟化与TheRock模块化打包

Editorial illustration: AMD ROCm 7.13搭载MI350P GPU、多VF虚拟化与TheRock模块化打包

AMD于2026年5月20日发布ROCm 7.13——其开源AI计算栈的新版本,引入MI350P GPU支持、每个MI300X加速器最多8个隔离vGPU虚拟化、用于透明性能分析的开源ROCprof Trace解码器,以及带有领域专用SDK的模块化TheRock打包方案。该版本已在Ubuntu 26.04和RHEL 9.6上完成验证,并包含MI350X和MI355X的VMware ESXi 9.1支持。

🟢 🔧 硬件 2026年5月16日 · 2 分钟阅读

AMD ROCm: BubbleFence通过视觉基础模型嵌入而非元数据启发式方法划分视频流

Editorial illustration: 视频帧在2D空间中带有嵌入气泡可视化。

BubbleFence是AMD ROCm于2026年5月15日发布的新AI工具,解决了将视频流语义划分为训练/验证/测试集而不产生语义泄漏的基本ML问题。与传统基于元数据的启发式方法不同,BubbleFence使用视觉基础模型嵌入(CLIP)和带LID加权的自适应气泡进行分区。在自动驾驶(Zenseact开放数据集)和Minecraft游戏场景中演示,无需更改配置。

🟢 🔧 硬件 2026年5月15日 · 2 分钟阅读

AMD ROCm: 通过 Quark + FlyDSL + AITER 推理栈在 MI325X 上实现 Kimi-K2.5 W4A8 与 W8A8 量化

编辑插图:带有 W4A8 量化层和推理加速图标的 AMD MI325X GPU 示意图。

AMD ROCm Kimi-K2.5 MI325X 量化方案是于 2026 年 5 月 14 日发布的新型推理加速蓝图。该方案结合 AMD Quark 量化工具包将 Kimi-K2.5 模型转换为 W4A8 和 W8A8 精度格式、FlyDSL 推理服务层以及 AITER 优化栈。这一方案为中国前沿模型提供了非 NVIDIA 推理路径,并展示了 AMD 将 MI325X 打造为 H100/H200 可行替代方案的策略。

🟡 🔧 硬件 2026年5月12日 · 1 分钟阅读

AMD:Instinct MI355X 在三项 ComfyUI 工作流中超越 NVIDIA B200,ROCm 7.2.0 PyTorch 优化加持

Editorial illustration: Instinct MI355X 在三项 ComfyUI 工作流中超越 NVIDIA B200,ROCm 7.2.0 PyTorch 优化加持

AMD Instinct MI355X 是数据中心 GPU,在已发布的基准测试中于三项 ComfyUI 生成工作流上超越 NVIDIA B200——文生视频 Wan2.2(1.44×)、文生图 FLUX.1-dev(1.42×)和 3D Hunyuan3D v2.1(1.20×)——得益于 AOTriton gfx950 内核、hipBLASLt GEMM 调优及 ROCm 7.2.0 中的其他优化。

🟡 🔧 硬件 2026年5月12日 · 1 分钟阅读

NVIDIA:Fleet Intelligence——大规模 GPU 集群实时管理监控与加密完整性验证

Editorial illustration: Fleet Intelligence——大规模 GPU 集群实时管理监控与加密完整性验证

NVIDIA Fleet Intelligence 是一项托管服务,可实时监控大型 NVIDIA 数据中心 GPU 机群——包括功耗、温度、性能和 ECC 错误——并通过 NVIDIA 远程证明服务(NRAS)进行加密 GPU 真实性验证。该服务对 Vera Rubin、Blackwell 和 Hopper GPU 所有者免费。

🟡 🔧 硬件 2026年5月11日 · 1 分钟阅读

vLLM: TurboQuant研究显示FP8在KV-cache中仍居优势——3bit-nc准确率下降约20个百分点

Editorial illustration: TurboQuant研究显示FP8在KV-cache量化中仍居优势——3bit-nc准确率下降约20个百分点

Red Hat AI团队对TurboQuant激进KV-cache量化方法(3-4位)与FP8标准进行了系统对比。结果显示FP8保持吞吐量和精度,而3bit-nc变体在AIME25等高难度推理基准上损失约20个百分点。

🔴 🔧 硬件 2026年5月7日 · 2 分钟阅读

NVIDIA:Spectrum-X多路径可靠连接成为OCP开放标准,面向超大规模AI网络

Editorial illustration: paralelne svjetlovodne staze između AI rack-ova s natpisom MRC, Spectrum-X i OCP open standard

NVIDIA Spectrum-X多路径可靠连接(MRC)是一种RDMA传输协议,可将单一连接分布到多条网络路径上,现已通过开放计算项目(OCP)发布为开放规范。MRC已在OpenAI、微软Fairwater数据中心和Oracle Abilene数据中心投入生产,并由AMD、博通、英特尔和微软共同参与开发。

🟡 🔧 硬件 2026年5月6日 · 1 分钟阅读

AMD: FarSkip-Collective 将 AMD GPU 上的 MoE 推理速度提升 18–34%

编辑插图:AMD GPU 之间的 MoE 推理中无空闲块的并行数据流

AMD ROCm 团队推出了 FarSkip-Collective,这是一种改进的 MoE 架构,可消除专家并行通信期间的 GPU 空闲时间。结果:Llama-4 Scout 的 TTFT 减少 18%,DeepSeek-V3 速度提升最高 1.34×,Moonlight 预训练阶段加速 11%。

查看完整档案 →