PyTorch: 「免费归一化」将Layer Norm融合进GEMM和attention核——Meta瞄准降低大型模型训练成本
来自Meta的PyTorch团队发布了将归一化操作直接融合进GEMM和attention核的技术,旨在消除其计算开销——「免费归一化」。代码已通过核函数库在GitHub上开放,直接效果是加快频繁使用Layer Norm和RMS Norm操作的模型的训练和推理速度。
83 条新闻
来自Meta的PyTorch团队发布了将归一化操作直接融合进GEMM和attention核的技术,旨在消除其计算开销——「免费归一化」。代码已通过核函数库在GitHub上开放,直接效果是加快频繁使用Layer Norm和RMS Norm操作的模型的训练和推理速度。
Ollama 是本地运行开放 AI 模型的平台,宣布获得 8800 万美元融资,投资方包括 Benchmark、Theory Ventures 和 Docker 创始人 Solomon Hykes。该平台服务 890 万开发者和 85% 的财富 500 强企业,云服务每月处理 token 量翻倍。
PyTorch 2.13发布,包含来自526位贡献者的3328个提交。核心亮点:nn.LinearCrossEntropyLoss将LLM训练峰值GPU显存最高降低4倍,Apple Silicon上FlexAttention最高提速12.3倍,新torchcomms后端现代化分布式训练。
CNCF TAG Infrastructure发布白皮书,梳理云原生AI环境中的数据存储瓶颈,区分训练、推理和智能体AI各阶段的需求差异,并为Kubernetes AI/ML工作负载提供架构指南。
IBM与Red Hat将Lightwell Network正式发布,提供超过6500个经数字签名的Java和Python修复依赖项,并推出面向金融服务的Lightwell Clearinghouse Premier,支持补丁封禁协调,背后是50亿美元的开源安全投入承诺。
腾讯混元AI Infra团队与vLLM团队联合将HPC_ATTN注意力后端和hpc MoE后端上游至主线vLLM项目,在8× NVIDIA H20配置上将TTFT降低24%、TPOT降低17%,无需fork vLLM代码。
Moonshot AI 开发的 Kimi K2.7 Code 已作为 GitHub Copilot 模型选择器中首款开放权重模型上线,托管在 Microsoft Azure 上。目前可在 Pro、Pro+ 和 Max 套餐中按用量计费使用,计划扩展至 Business 和 Enterprise 套餐。
LangChain 发布了 OpenWiki——一款自动生成和更新代码库文档 wiki 的开源 CLI 工具。其目标是为代码智能体提供关于代码库的结构化上下文,而无需膨胀 AGENTS.md 或 CLAUDE.md 等指令文件。该工具基于 DeepAgents 框架构建,支持多种 LLM 提供商。
RadixArk 发布 Miles,这是一个将 SGLang、Megatron-LM、Ray 和 PyTorch 整合为统一生产级堆栈的开源强化学习框架,专为在 Hopper 和 Blackwell GPU 上对大型语言模型进行后训练而设计。
CNCF 沙箱项目 Kepler 完全重写:新架构以读取标准 /proc 和 /sys 路径替代 eBPF 方法,消除了千瓦级测量跳变,并将进程功率归因误差降至毫瓦级。
LF AI & Data Foundation 发布 ONNX v1.22.0,带来面向 Transformer 架构和大语言模型的原生注意力算子、通过 Pyodide 在浏览器中预览模型的 WebAssembly 支持,以及 SLSA Level 2 加密证明。27 位贡献者参与其中,其中 16 位系首次贡献。
Palantir将NVIDIA Nemotron开源模型集成到其面向美国政府机构和关键基础设施的主权AI操作系统中。该系统在气隙隔离环境(完全物理隔离、无互联网连接的网络)中运行,覆盖国防、能源、医疗、教育和交通等领域。
GitHub Desktop 3.6已在macOS和Windows上发布,带来了对Git工作树的支持——一种无需暂存即可并行处理多个分支的机制——以及更深度的Copilot集成,用于提交信息和合并冲突解决。
TokenSpeed-Kernel是一个开源三层内核子系统,无需重写代码即可将NVIDIA和AMD GPU上的LLM推理加速高达3.6倍,已集成到vLLM推理框架中。
Allen Institute(AI2)分析了OLMo 3与OLMo混合架构,发现混合模型在预测语义相关、上下文依赖的词元方面表现更优,而纯Transformer在逐字复制文本时仍占优势。
OpenThoughts-Agent是用于智能体语言模型的开放数据整理流水线。经过100+消融实验,团队构建了10万条样本并微调Qwen3-32B,在7个智能体基准上达到44.8%,超越所有现有开源模型。
Claude Code v2.1.185 是于2026年6月20日发布的用户体验补丁,修改了API流卡顿提示信息,并将激活阈值从10秒静默延长至20秒,模型与API均无变化。
Multi-LCB是arXiv:2606.20517论文描述的LiveCodeBench基准测试扩展项目,已被ICLR 2026录用,将评测范围从Python扩展到12种编程语言。通过测试24个大型语言模型,作者发现了显著的Python过拟合现象和语言特异性数据污染,直接揭示了当前模型在多语言代码生成方面的局限。
Engineering Playbook是英国AI安全研究院(UK AISI)于2026年6月18日发布的开源文档,开放了评估前沿AI模型的内部基础设施。Playbook分为五层(Evaluate、Isolate、Connect、Run、Scale),基于早前开源的Inspect AI工具,该工具拥有200多个现成评估和240名贡献者。
Robin Rombach——Black Forest Labs(FLUX模型开发者)联合创始人兼CEO——向G7领导人发出呼吁:开放、负责任的AI发展应成为全球规范。Rombach认为,AI参数的公开可及性能够促进创新并推动技术民主化。
Allen Institute发布了MolmoMotion,一款完全开源的模型,可根据视频和「旋转碗」等自然语言指令预测物体的3D轨迹。该模型在PointMotionBench上达到最优性能,平均位移0.109米(前记录为0.134米),并将机器人抓放任务成功率从56%提升至76.3%,提升20.3个百分点。模型在包含116万段视频及3D轨迹和动作描述的MolmoMotion-1M数据集上训练。
vLLM推出了Semantic Router Fusion——一种多个模型并行组成面板、由裁判模型分析共识与差异并合成单一回答的基本单元。支持本地vLLM和私有端点,以及Gemini、Kimi、DeepSeek和Claude等公共提供商。在OpenRouter DRACO上的外部验证显示合并面板达到69%,优于最佳单一模型的65.3%,且具备完整的OpenAI API兼容性。
GitHub发布了多语言代码库数据集,包含超过4000万个仓库的8000万行以上分类记录,采用完全开放的CC0-1.0许可证。数据集为每个仓库记录三个文本来源——README、评论最多的issue和评论最多的pull request——并通过fastText、gcld3和lingua-py三种工具进行语言检测。在非英语README文件中葡萄牙语排名第一,韩语在issue讨论中最为突出。
CNCF报告称,Oracle捐赠的300万美元OCI计算积分为OpenTelemetry、containerd、Falco、Longhorn、Crossplane和Jaeger等12个以上项目提供了Arm64 CI/CD支持。需求迅速超过了每月5,000美元的初始指导方针。这一转变伴随着超过50%的新AWS实例和33%的Azure实例现在运行Arm64架构的数据。
AI2 发布 olmo-eval,这是一个开源评估平台,将 OLMES 标准从一次性基准测试扩展为完整的开发迭代循环。核心创新是跨检查点的逐题配对比较,并内置统计指标,用于区分真实改进与数据噪声。
vLLM 团队宣布对 MiniMax M3 提供完整的首日(Day-0)支持——该模型具备百万 Token 上下文、原生多模态能力以及混合专家(MoE)架构。核心创新是 MiniMax Sparse Attention,无需完整物化 KV 缓存即可实现长上下文的实际服务。
Ollama 更新了 Apple Silicon 的 MLX 引擎,通过 Metal 内核融合和 GPU 采样实现了最高 20% 的 token 生成速度提升。全新 NVFP4 量化格式将相比未量化 BF16 的质量损失减半,而快照系统则支持分支与重试功能,简化了代理工作流。
Helion是一种无需直接CUDA代码即可编写GPU内核的PyTorch原生DSL。九个Helion内核已集成至vLLM用于Qwen3模型的FP8推理:非GEMM内核在H100上实现高达73%的加速,整体吞吐量较此前方案提升约5–9%。
LF AI & Data基金会以IBM、Red Hat和NVIDIA为创始成员,启动了DocLang规范工作组,旨在开发AI原生文档的开放标准。该格式保留语义含义和几何布局,内置治理控制,并针对现代AI分词器和代理工作流进行了优化。
vime是一个全新的语言模型后训练RL框架,将Megatron分布式训练与vLLM推理融合为统一管道。在GB200硬件上,Qwen3-30B-A3B MoE模型每步约需147秒——比H200快1.72倍。R3路由回放将对数概率差从0.019降至0.013。
一篇新论文提出 vla.cpp,一个用于在资源受限的机器人硬件上运行 Vision-Language-Action 策略的 C++ 推理引擎。该引擎在 LIBERO-Object 基准上达到 SOTA 水平,并仅用 1.3 GiB 内存运行 BitVLA。
Ollama 0.30 带来了与 llama.cpp 的集成以提升性能,以及 GGUF 模型兼容性,在 NVIDIA GPU 上吞吐量提升高达 20%。它通过 Vulkan 将硬件支持扩展到 AMD 和 Intel 设备,并新增了对 tool-calling 的支持。它补充了面向 Apple silicon 的现有 MLX 引擎。
vLLM 团队发布了其 Semantic Router 的 v0.3 'Themis' 版本,这是首个可用于生产的、在模型之间路由查询的版本。它带来了规范化配置、可检视的决策流,以及面向 Kubernetes 部署的可复现路由行为。
Google Research 于 2026 年 6 月 3 日在 GitHub 上以 Apache 2.0 许可证发布了驱动全球洪水预测服务 Flood Hub 的 Python/PyTorch 框架。该框架在开源数据集 Caravan 上使用 LSTM 和更新的 ME-LSTM 架构,而升级后的 v2 模型将有测站流域的可靠预测期延长了 6 天。
vLLM Semantic Router 新增了会话感知智能体路由(SAAR),这一机制能够理解长时间的智能体对话,而非将每条消息单独处理。在 21,600 个测试回合中,SAAR 将模型切换减少了 79.29%,彻底消除了不安全的切换,并将预估成本降低了 78.71%。
vLLM 将英特尔的 AutoRound 量化集成进 vLLM-Omni,实现了多模态和扩散模型的 W4A16 压缩。其结果是检查点最多缩小 62%,质量损失极小,并在英特尔 XPU 和 NVIDIA 显卡上实现更快的生成。
vLLM 团队发布了一份实用指南,介绍如何在基于 GB10 芯片的 NVIDIA DGX Spark 系统上运行 vLLM。指南涵盖统一内存的行为、提供 NVFP4 模型 Nemotron-3-Super 的服务、Docker 部署、Prometheus 指标,以及在这款全新边缘硬件上的本地评估结果。
xAI 发布了 xai-sdk-python v1.15.0,这是一个包含三项变更的版本:在 ChatModel 类中新增 grok-build-0.1 模型、支持 context compaction 即上下文压缩,以及将版本号从 1.14.0 提升到 1.15.0。所有变更均通过三个独立的拉取请求引入。
PithTrain是一套为AI编码智能体优化的Mixture-of-Experts模型训练新系统。该论文引入agent-task efficiency指标及配套的ATE-Bench,PithTrain在其上实现智能体步骤减少最多62%、活跃GPU时间减少最多64%,同时保持可比的吞吐量。
vLLM 于 2026 年 5 月 28 日引入了用于权重同步(weight synchronization)的标准化 API,并改进了对异步强化学习的支持。它解决了每个 RL 框架各自临时实现训练与推理之间权重传输的碎片化问题,并修复了大型分布式部署中的稳定性问题。
Data Formulator 0.7 是 Microsoft Research 的开源系统,它连接企业中碎片化的数据源并支持迭代式分析流程。它带来持久化数据连接器和上下文感知的 AI 智能体,使分析无需掌握 SQL 或编程。
Mistral Search Toolkit 是用于为 AI 应用构建生产级搜索流水线的开源框架。它将摄取、检索和评估整合到单一接口下,可部署在云端、本地或网络边缘。
OpenJarvis v1.0 是用于构建在自有硬件上本地运行的个人 AI 智能体的开源框架,内置 Ollama 集成。它采用 local-first 方式,模型保持本地、云端可选,并跟踪能耗、成本和延迟。
PyTorch编译器torch.compile通过消除向全局内存的冗余写入,利用内核融合技术在GPU上实现最高10倍加速。Inductor编译器不再为每个操作启动独立的GPU内核,而是自动将依赖操作合并为一个将中间值保留在快速处理器寄存器中的内核。
xAI发布了Python SDK v1.14.0,为web_search功能带来图像搜索支持。新的enable_image_search字段和SERVER_SIDE_TOOL_IMAGE_SEARCH枚举常量使构建基于Grok应用的开发团队能够在服务端启用视觉内容搜索,作为标准网页文本搜索的补充。
Linux Foundation AI项目Kedro发布了1.2.0版本以及Kedro-Viz 12.3.0。新的@experimental装饰器允许标记处于开发中的API,starter项目support-agent-langgraph演示了与LangGraph编排和Langfuse/Opik提示管理工具的集成。Kedro-Viz获得了Mermaid图表和节点预览可扩展性,以改善管道调试。
Stability AI于2026年5月20日发布Stable Audio 3.0——包含4个音频模型(Small SFX、Small、Medium、Large)的系列,其中3个为开放权重并已在Hugging Face上线。最大亮点是支持最长6分钟的音频生成(前版本仅支持47秒),以及音频修复、因果延续和LoRA微调功能。公司声明所有模型均使用经许可的数据进行训练。
LangChain发布了LangSmith Engine技术详解——一款分析生产AI智能体错误并提出具体修复方案的自主元智能体。Engine端到端自动化错误检测、评估器生成和回归测试。
PyTorch团队发布了实验性ExecuTorch MLX Delegate——一个利用Apple MLX框架和Metal GPU内核在Apple Silicon芯片上实现3至6倍吞吐量提升的后端。支持Llama 3.2、Qwen 3、Phi-4 mini、Whisper和Voxtral实时流式转录。
GitHub宣布Copilot Spaces的REST API正式全面开放,使团队可以通过编程方式创建、配置和删除上下文感知的AI工作区。新接口对管理大量Spaces而无需依赖手动工作流程的组织特别有用。