NVIDIA:得益于协同设计,Vera Rubin平台以四分之一的Blackwell世代GPU数量训练最大规模的AI模型
NVIDIA称新的Vera Rubin平台凭借硬件与软件的端到端协同设计(codesign),仅用Blackwell世代四分之一数量的GPU即可训练出最大规模的AI模型。Nemotron 3 Ultra模型在SWE-bench Verified基准测试中取得71.7%的成绩,Vera CPU的吞吐量比x86替代方案高出约30%。
60 条新闻
NVIDIA称新的Vera Rubin平台凭借硬件与软件的端到端协同设计(codesign),仅用Blackwell世代四分之一数量的GPU即可训练出最大规模的AI模型。Nemotron 3 Ultra模型在SWE-bench Verified基准测试中取得71.7%的成绩,Vera CPU的吞吐量比x86替代方案高出约30%。
AMD发布AIMs 2.2——为Instinct GPU加速器、EPYC CPU和Radeon GPU提供自动配置的标准化Docker推理微服务,支持Gemma-4 31B、Llama-3.1 8B和Qwen3等模型。
AMD ROCm博客介绍了工程师如何在代理模式下使用Cursor IDE与Claude Opus 4.7优化AMD Instinct MI250上的双精度HIP内核。通过约45次实验分四个阶段,实现了28.3倍加速——运行时间从46.7秒降至1.65秒——且位完全相同,容差为1e-12。
AMD发布了hipVS,这是一个基于hipRAFT算法、面向AMD Instinct GPU的GPU加速向量检索库。该库与NVIDIA cuVS平台API兼容,支持四种检索算法,并附带智能体RAG系统演示——该系统将查询分解为3至5个子查询。
以DeepSeek V4 Pro模型测试,NVIDIA Blackwell GB300 NVL72的每瓦性能最高可达Hopper的25倍;仅靠软件优化,在一个月内实现最高5倍的效率提升。
AMD的GEAK GPU内核自动化优化智能体将DeepSeek-V4 MLA内核从PyTorch迁移到MI355加速器的Triton。结果显示预填充速度最高提升9.13倍,解码几何平均加速4.94倍,SGLang框架中端到端吞吐量提升2.10倍。
AMD发布了在Instinct GPU上通过ROCm技术栈运行SGLang Diffusion的教程,支持图像生成与编辑扩散模型。SGLang最初因加速大型语言模型而流行,现在将支持范围扩展至图像扩散领域,从而增强AMD在NVIDIA生态之外的AI推理产品竞争力。
FlyDSL 是 AMD 的 Python 领域特定语言,用于编写 GPU 核函数,根据新的 ROCm 指南,其性能可媲美手动优化的 HIP C++ 代码,同时代码量更少。AMD 发布了移植现有 HIP 核函数的实用指南,将 FlyDSL 定位为 NVIDIA CUDA 工具链的 Python 优先替代方案。
AMD ROCm团队发布了CDNA4架构GPU占用率手动计算技术指南。核心发现:MI355X上的矩阵密集型内核在仅12%占用率时即可达到峰值吞吐量——对于来自CUDA生态系统的从业者而言,这是一个反直觉的结果。
搭载Olympus核心的NVIDIA Vera CPU比Grace处理器提升50% IPC,并提供3.4 TB/s核心间带宽。Perplexity在编码智能体工作流上测得1.5倍的任务完成速度提升。
AMD Quark 0.12通过Diffusers和xDiT框架,在Instinct MI350 GPU上实现了FLUX.1-dev图像生成模型的MXFP4量化。配合torch.compile,MXFP4 ASM比BF16 eager基线实现1.92倍加速,CLIP评分与参考值相同。
AMD ROCm Primus Tuning Agent结合确定性种子规划器和LLM引导的探索循环,自动为AMD Instinct GPU上的LLM训练找到最优配置。在Mixtral 8×22B上,约30分钟的搜索实现了比AMD参考基准高27%的吞吐量。
Multiverse Computing和东芝公司的行业专家为OECD.ai分析了量子技术在哪些方面已经改变AI,以及乐观预期在哪些方面缺乏证据支撑。张量网络将计算需求降低10至100倍;更广泛的量子机器学习应用在未来十年内无法实现。
AMD Research于2026年7月3日发布了开放基准测试框架AgentKernelArena,用于衡量AI编程代理优化真实GPU内核的能力。在四个类别共214个任务中,AMD自研的GEAKv3(Claude Opus 4.6)以9.04倍加速在HIP内核上领先,Claude Code(Opus 4.6)以6.08倍位居第二。所有实验均在ROCm 7.1.1环境下的AMD Instinct MI300X上进行。
AMD ROCm团队于2026年7月3日发布了Eagle3推测性解码在AMD硬件上的生产应用详情。Eagle3多层方法、vLLM后端和AMD Quark FP8量化的组合,在AMD Instinct MI355X上为Kimi-K2.5实现1.69倍至2.00倍的吞吐量提升,为MiniMax-M2.5实现1.38倍至1.79倍的提升,且输出质量无损失。
AMD发布了一种GPU驻留目标检测流水线,结合rocDecode、DLPack、PyTorch和MIGraphX,确保视频帧在最终检测结果出来之前始终保留在VRAM中。
NVIDIA 详解了在 Blackwell 架构上叠加的软件优化——从 NVFP4 精度到推测性解码——如何在 DeepSeek V4 模型上实现高达 20 倍的吞吐量提升和五倍的 token 成本降低。
AMD在AITER框架(AI Tensor Engine for ROCm)中发布了FlyDSL系统,可自动生成专用GEMM内核,用于AMD GPU上LLM解码阶段。结果:平均延迟降低1.64倍,针对M≤8 token的最关键场景加速1.79倍,在配备256个计算单元的Instinct MI355X上测试。
AMD Resource Manager 新增了自动抢占(pre-emption)功能:监控每个工作负载的 GPU 使用率,并在低于可配置阈值(如 10%)超过指定空闲计时器(如 15 分钟)后终止相应作业。提供两种策略——仅在 GPU 有压力时抢占或始终抢占——将被不活跃开发环境占用的资源归还共享池。
AMD在Instinct MI355X加速器上展示了W_MXFP4_A_MXFP6混合精度量化技术,与BF16基准相比吞吐量最高提升29%,同时保持接近FP8标准的精度,使用vLLM框架进行生产推理。
英伟达与AWS宣布搭载RTX PRO 4500 Blackwell GPU的EC2 G7实例,相比上一代G6提供4.6倍的AI推理性能,而cuVS库成为Amazon OpenSearch Serverless的默认选项,带来10倍更快的向量索引速度。
OpenAI与博通联合宣布Jalapeño——专为LLM推理优化的定制ASIC芯片。这是OpenAI进入自研芯片领域的战略举措,与谷歌TPU、苹果神经引擎和AWS Trainium并列,同时减少对NVIDIA GPU的依赖。
ATOM是AMD为MI355X GPU开发的开源推理引擎,针对DeepSeek-V4带来两项优化:PrefillDelayer消除了秩协调时的空闲损耗,Two-Batch Overlap通过重叠网络操作加速令牌负载均衡。
AMD ROCm团队在8×Instinct MI325X上演示了EAGLE3推测解码技术,使用Kimi-K2.5模型,输出吞吐量提升33%,中位令牌间延迟降低58%,GSM8K基准测试精度无损失。
JUPITER 是欧洲首台 E 级超级计算机,位于德国于利希研究中心。搭载 NVIDIA Grace Hopper 超级芯片和 Quantum-X800 InfiniBand 网络,JUPITER 已完成860亿神经元的完整映射,打破了50量子比特模拟的量子记录,并在气候模拟中创下世界纪录。
搭载 Olympus 核心的 NVIDIA Vera CPU 将进驻洛斯阿拉莫斯国家实验室,在 URSA 工作负载上较现有 Crossroads x86 处理器性能提升7倍,热传导蒙特卡洛模拟性能提升3倍。三台新超算 Mission、Vision 和 Veritas 计划于2027年投入运营。
NVIDIA 发布了三个面向科学 AI 的新 CUDA-X 软件库:cuPhoton 为天文学带来高达14,900倍的加速,ALCHEMI 在 Lila Sciences 实现材料筛选50倍提速,DAQIRI 为物理探测器加速实时网络数据采集。
AMD在ROCm博客上介绍了针对AMD Instinct GPU上可探索3D世界生成框架Matrix3D的优化工作。通过将CUDA专用组件替换为Triton内核,并使用gsplat库实现3DGS,MI250 GPU上的渲染速度提升了54%,MI300上提升了50%,渲染内核本身比CUDA版本快36%。
AMD发布了一份比较分析报告,研究训练四款大型语言模型——GPT-4、Llama 3、DeepSeek-V2和Grok 4.0——时产生的RoCE网络流量模式,为在多GPU节点横向扩展集群中构建AI基础设施提供了实践指南。
AMD 推出了 Schola,这是一款用于 Unreal Engine 的开源插件,通过 Python 框架和 gRPC 实现与 Gymnasium 兼容的强化学习训练。示例中,协作机器人手臂 xArm6 在 Unreal Engine 5.7 中配合 MuJoCo 物理引擎、PPO 算法和 PyTorch 在 AMD ROCm GPU 加速栈上进行训练。教程展示了一个到达任务,机械臂末端移动至随机目标位置。
AMD在MLPerf Training v6.0中展示了Instinct MI355X在LLM基准测试中与同级NVIDIA GPU性能差距约为5%。MI355X比去年的MI300X快3.5倍,比上一轮快13–19%。AMD首次引入MXFP4(FP4)训练配方和Primus统一框架,并完成了包含512块MI300X GPU、64个节点的多节点提交。
NVIDIA宣布其Blackwell平台在MLPerf Training 6.0全部七项测试中取得最佳成绩。GB300 NVL72训练速度比GB200 NVL72最高提升1.6倍,最大规模提交使用8192块Blackwell GPU训练拥有6710亿参数的DeepSeek-V3模型。CoreWeave用8192块GPU在2.02分钟内完成DeepSeek-V3 671B训练,微软Azure用7.07分钟完成Llama 3.1 405B训练。
AMD发布了ATOM推理引擎,专为Instinct GPU设计,提供OpenAI兼容API并协调KV缓存、调度和并行性。ATOM位于ROCm技术栈顶层,搭配AITER内核和MoRI RDMA通信,支持TP、DP和EP并行,针对DeepSeek V2至V4、Mixtral和Qwen3-MoE等MoE模型进行了优化。提供FP8、MXFP4、INT8和INT4量化,以及配备EAGLE提议器的MTP投机解码。
加州大学圣地亚哥分校研究人员在 Google 支持下,正在用2,000台退役 Pixel 智能手机构建一个数据中心。通过保留主板,可节省约50%的内嵌碳排放;由25至50台手机组成的集群,已能应对75门并行计算学生课程的峰值负载。
Black Forest Labs 与 ASUS 及 NVIDIA 合作,将 FLUX.2 [klein] 预装于 ASUS ProArt 消费级笔记本。这是 FLUX 模型首次以预装形式出现在消费级硬件上。这款 40 亿参数的模型可在本地、无需依赖云端的情况下,在不到一秒内完成图像的生成与编辑。
OpenAI 宣布将在美国密歇根州建设一座全新的 Stargate 数据中心。这是其算力基础设施项目 Stargate 的扩张,OpenAI 将其置于所谓 Intelligence Age 的语境之中。本次公告未详述容量和投资等细节,因此请参阅官方来源。
AMD 宣布,阿里巴巴的开源强化学习框架 ROLL 现已可借助 ROCm 软件在 AMD Instinct GPU 上原生运行,无需修改代码、自定义补丁或非标准构建。此次合作包括 vLLM 兼容性、针对 Ray 的修复,以及对大语言模型分布式 RL 训练的支持。
AMD在ROCm博客上介绍了在Instinct MI300X GPU上实现的推测解码。这种由较小draft模型预测token、较大模型进行验证的技术,相比经典自回归生成实现了最高4.3倍的吞吐量提升。
AMD ROCm博客介绍了针对搭载CDNA 4架构的Instinct MI355X加速器的FP8 GEMM(混合精度矩阵乘法)内核的全新4波交错方法。该优化将布局从8波乒乓方案改为每波拥有完整512个VGPR寄存器的4波设计,通过基于XOR的swizzle消除LDS内存冲突,并通过精确交错MFMA指令与数据加载来隐藏内存延迟。
LightSeek Foundation的开源LLM推理引擎TokenSpeed(MIT许可证)使用八块NVIDIA Blackwell B200 GPU在TP8配置下,以Qwen3.5-397B-A17B模型实现了每秒580个令牌的速度。该记录在带前缀缓存和CPU-GPU执行重叠的智能体工作负载下实现,在100万令牌上下文下性能下降不足16%。
AMD ROCm博客发布了关于Ryzen AI Max+ 395处理器上LLM推理的详细分析,该处理器采用UMA(统一内存架构)设计。配备128 GB LPDDR5X内存的系统在完整GPU卸载模式下,于Qwen3.5 35B MoE模型上实现42词元/秒的速度,并通过结合CPU与GPU内存支持多达1220亿参数的模型。
AMD ROCm团队发布了在MI355 GPU上使用Gluon编程模型编写高性能GEMM内核的教程。经过优化的FP16内核达到1.489 TFLOPS,MFMA效率98.75%,扩展到BF8(3.257 TFLOPS)和MXFP4(5.255 TFLOPS)展示了对现代AI工作负载的适用性。教程包含将L2缓存未命中从530万减少到410万的工作组重映射与swizzle技术。
AMD于2026年5月20日发布ROCm 7.13——其开源AI计算栈的新版本,引入MI350P GPU支持、每个MI300X加速器最多8个隔离vGPU虚拟化、用于透明性能分析的开源ROCprof Trace解码器,以及带有领域专用SDK的模块化TheRock打包方案。该版本已在Ubuntu 26.04和RHEL 9.6上完成验证,并包含MI350X和MI355X的VMware ESXi 9.1支持。
BubbleFence是AMD ROCm于2026年5月15日发布的新AI工具,解决了将视频流语义划分为训练/验证/测试集而不产生语义泄漏的基本ML问题。与传统基于元数据的启发式方法不同,BubbleFence使用视觉基础模型嵌入(CLIP)和带LID加权的自适应气泡进行分区。在自动驾驶(Zenseact开放数据集)和Minecraft游戏场景中演示,无需更改配置。
AMD ROCm Kimi-K2.5 MI325X 量化方案是于 2026 年 5 月 14 日发布的新型推理加速蓝图。该方案结合 AMD Quark 量化工具包将 Kimi-K2.5 模型转换为 W4A8 和 W8A8 精度格式、FlyDSL 推理服务层以及 AITER 优化栈。这一方案为中国前沿模型提供了非 NVIDIA 推理路径,并展示了 AMD 将 MI325X 打造为 H100/H200 可行替代方案的策略。
AMD Instinct MI355X 是数据中心 GPU,在已发布的基准测试中于三项 ComfyUI 生成工作流上超越 NVIDIA B200——文生视频 Wan2.2(1.44×)、文生图 FLUX.1-dev(1.42×)和 3D Hunyuan3D v2.1(1.20×)——得益于 AOTriton gfx950 内核、hipBLASLt GEMM 调优及 ROCm 7.2.0 中的其他优化。
NVIDIA Fleet Intelligence 是一项托管服务,可实时监控大型 NVIDIA 数据中心 GPU 机群——包括功耗、温度、性能和 ECC 错误——并通过 NVIDIA 远程证明服务(NRAS)进行加密 GPU 真实性验证。该服务对 Vera Rubin、Blackwell 和 Hopper GPU 所有者免费。
Red Hat AI团队对TurboQuant激进KV-cache量化方法(3-4位)与FP8标准进行了系统对比。结果显示FP8保持吞吐量和精度,而3bit-nc变体在AIME25等高难度推理基准上损失约20个百分点。
NVIDIA Spectrum-X多路径可靠连接(MRC)是一种RDMA传输协议,可将单一连接分布到多条网络路径上,现已通过开放计算项目(OCP)发布为开放规范。MRC已在OpenAI、微软Fairwater数据中心和Oracle Abilene数据中心投入生产,并由AMD、博通、英特尔和微软共同参与开发。
AMD ROCm 团队推出了 FarSkip-Collective,这是一种改进的 MoE 架构,可消除专家并行通信期间的 GPU 空闲时间。结果:Llama-4 Scout 的 TTFT 减少 18%,DeepSeek-V3 速度提升最高 1.34×,Moonlight 预训练阶段加速 11%。