最新AI动态 2026年7月10日

🟡 🛡️ 安全 2026年7月10日 · 1 分钟阅读

GitHub: CodeQL 2.26引入AI提示注入检测——首款将AI攻击与经典攻击同等对待的主流SAST工具

创意插图:代码扫描仪捕获嵌入AI查询中的恶意指令

CodeQL 2.26.0是GitHub静态安全分析工具的新版本,将AI提示注入攻击检测作为新分析类型引入,同时支持Kotlin 2.4.0。这是首次将AI特定攻击向量集成到主流SAST工具中,使提示注入与XSS和SQL注入进入相同的安全工作流程。

🟡 🏥 实践应用 2026年7月10日 · 1 分钟阅读

GitHub: 更好的工具让Copilot代码审查变差了——重写提示词在降低20%成本的同时恢复了质量

创意插图:放大镜聚焦在高亮的diff上,而非整个仓库

GitHub发现,将Copilot代码审查迁移到更好维护的工具后,结果起初变差了——原因不是工具,而是不适配新工具和实际工作流程的过时提示词。通过将提示词重写为diff优先方式(批量发现后再读文件,分析锚定在PR diff上),他们在保持同等质量的前提下将平均审查成本降低了约20%。

🟡 🤝 智能体 2026年7月10日 · 1 分钟阅读

LangChain: OpenWiki Brains为代理带来主动记忆——自动从Gmail、Notion和Git收集上下文并保存为Markdown

创意插图:机器人从电子邮件、笔记和仓库中拼组Markdown页面组成的wiki

OpenWiki Brains是LangChain的开源框架,为AI代理提供主动记忆:自动从外部来源收集上下文并以Markdown文件形式保存在磁盘上。第一个版本支持6个连接器——Gmail、Notion、Git、Twitter/X、Hacker News和网络搜索——通过定时任务在本地运行,而非依赖云端。

🟡 🏥 实践应用 2026年7月10日 · 1 分钟阅读

OpenAI: Deutsche Telekom启动AI原生转型——合作涵盖约2.45亿用户的客服、网络和语音AI

创意插图:电信铁塔向欧洲上空发射AI信号

Deutsche Telekom与OpenAI签署了将运营商转型为AI原生电信公司的合作协议,应用领域涵盖客户支持、员工工具、网络运营和语音AI。Deutsche Telekom是欧洲最大运营商之一,全球约有2.45亿用户,使此次合作成为电信行业规模最大的AI交易之一。

🟢 🔧 硬件 2026年7月10日 · 1 分钟阅读

AMD: ROCm上的SGLang Diffusion将图像生成与编辑带到Instinct GPU——来自LLM领域的推理框架向扩散模型扩展

创意插图:AMD GPU芯片,生成的图像透过扩散层从中涌现

AMD发布了在Instinct GPU上通过ROCm技术栈运行SGLang Diffusion的教程,支持图像生成与编辑扩散模型。SGLang最初因加速大型语言模型而流行,现在将支持范围扩展至图像扩散领域,从而增强AMD在NVIDIA生态之外的AI推理产品竞争力。

🟢 🤝 智能体 2026年7月10日 · 1 分钟阅读

arXiv:2607.08403:博弈论对抗幻觉——多智能体框架将模型建模为战略博弈者以减少虚构内容

创意插图:数位AI博弈者围坐棋盘,协调各自的走法以趋近真相

该论文提出了一种利用博弈论减少大型语言模型幻觉的多智能体框架。模型之间的交互被建模为战略博弈者之间的博弈,其中均衡状态对应于一致且无幻觉的回答,提供了一条有别于标准RLHF和RAG方法的新路径。

🟢 🏥 实践应用 2026年7月10日 · 1 分钟阅读

Anthropic: Claude Code v2.1.206带来带路径建议的/cd、/doctor对CLAUDE.md的优化建议,以及/commit-push-pr中的自动git push

创意插图:终端窗口显示命令,箭头将分支推送到远端

Claude Code v2.1.206是Anthropic CLI工具的新版本,引入了带路径建议的/cd命令、建议精简CLAUDE.md文件的/doctor检查,以及在/commit-push-pr中自动批准推送到已配置远端的git push功能。后台代理现在在升级后立即更新,无需在下次连接时经历缓慢的升级过程。

🟢 🏥 实践应用 2026年7月10日 · 1 分钟阅读

AWS: Henry Schein One用AI实时验证牙科X光质量——每周1100万张影像,延迟1.4秒

创意插图:牙科X光影像通过AI网络,附有质量标注

Henry Schein One基于Amazon SageMaker开发了「Image Verify」AI系统,用于实时验证牙科X光影像质量。该系统已在10,000多个地点部署,每周处理超过1100万张X光影像,平均延迟1.4秒,旨在减少因影像质量差导致的保险理赔拒绝。

🟢 📦 开源 2026年7月10日 · 1 分钟阅读

PyTorch: 「免费归一化」将Layer Norm融合进GEMM和attention核——Meta瞄准降低大型模型训练成本

创意插图:两个GPU核融合成无中间步骤的单一流程

来自Meta的PyTorch团队发布了将归一化操作直接融合进GEMM和attention核的技术,旨在消除其计算开销——「免费归一化」。代码已通过核函数库在GitHub上开放,直接效果是加快频繁使用Layer Norm和RMS Norm操作的模型的训练和推理速度。

🔴 🤖 模型 2026年7月9日 · 2 分钟阅读

Google: SensorFM——基于万亿分钟可穿戴数据训练的基础模型,在 35 项健康任务中赢得 34 项

编辑插图:智能手表发出生物信号波形流入神经网络

SensorFM 是 Google 用于可穿戴设备健康数据的基础模型,基于来自 100 多个国家 500 万用户的 Fitbit 和 Pixel Watch 超过万亿分钟的信号训练而成。在 35 项任务中赢得 34 项,分类任务 AUC 提升 +9%,回归任务相关性提升 +21%。

🔴 🤖 模型 2026年7月9日 · 1 分钟阅读

Microsoft: 开源模型 Aurora 1.5 在 88.9% 的变量上超越 ECMWF 集合预报——AI 天气预报新标准

编辑插图:覆盖旋转天气锋面与数据网络的地球

Aurora 1.5 是微软的开源地球系统基础模型,在 88.9% 的评估变量和预报时效上超越 ECMWF 集合预报。新版本新增 22 个气象变量、小时级分辨率和概率集合预报,针对飓风 Helene 的路径误差比初代 Aurora 降低约 33%。

🔴 🤖 模型 2026年7月9日 · 2 分钟阅读

OpenAI: GPT-5.6 推出三款变体——Sol、Terra 与 Luna,内置多智能体编排,GitHub Copilot 同日上线

编辑插图:三颗星球(Sol、Terra、Luna)由数据流相互连接

GPT-5.6 是 OpenAI 推出的全新模型家族,包含三款变体:Sol(旗舰推理)、Terra(均衡型)和 Luna(高容量、成本高效型)。新增程序化工具调用、显式提示缓存控制、持久化推理及多智能体编排测试版,首日即登陆 GitHub Copilot。

🟡 💬 社区 2026年7月9日 · 1 分钟阅读

Anthropic: 诺贝尔奖得主、前美联储主席 Ben Bernanke 加入 Long-Term Benefit Trust——公司使命监督机构

编辑插图:古典银行建筑的廊柱延伸成神经网络

Ben Bernanke 是 2006 至 2014 年间担任美联储主席、并于 2022 年获得诺贝尔经济学奖的经济学家,Anthropic 已将其任命为 Long-Term Benefit Trust 成员。LTBT 是一个无股权、无利润分配的独立机构,负责监督公司的公共利益使命,Bernanke 将带来其对 AI 经济影响的专业见解。

🟡 🤝 智能体 2026年7月9日 · 1 分钟阅读

arXiv:2607.06906:「Harness Effect」——编排设计将 AI 智能体成本削减 41%,效果超过更换模型

编辑插图:指挥棒引导 token 流在模型和工具之间流动

Harness Effect 是 32 位作者的实证研究发现:编排层设计对 AI 智能体成本的影响超过模型本身的选择。在 22 项任务和 6 个模型上,优化的编排将每任务成本降低 41%(从 0.21 降至 0.12 美元),token 消耗减少 38%,执行时间缩短 44%——同时质量提升。

🟡 🏥 实践应用 2026年7月9日 · 1 分钟阅读

GitHub: Copilot 现在提供 AI 仓库概览——自动总结目的、技术栈和贡献方式

编辑插图:打开的仓库文件夹,AI 放大镜提取出摘要

GitHub Copilot 仓库概览是一项新功能,首次访问陌生仓库时自动生成摘要:项目用途、使用的技术以及如何贡献。通过 Copilot chat 在 github.com 上运行,适用于所有 Copilot 计划,无需任何配置。

更早的新闻

2026年7月8日星期三

15 条新闻
🔴 🤖 模型 2026年7月8日 · 3 分钟阅读

Mistral Robostral Navigate:仅用RGB摄像头导航的机器人AI模型

编辑配图:仅依赖RGB视觉的Mistral Robostral具身机器人导航模型

Mistral推出Robostral Navigate,这是首款面向具身机器人导航的80亿参数模型。该模型仅使用单个RGB摄像头,无需LiDAR或深度传感器,在R2R-CE基准测试的未见环境中达到76.6%的成功率,超越多传感器竞争对手4.5个百分点。

🔴 🤖 模型 2026年7月8日 · 3 分钟阅读

OpenAI发布GPT-Live:面向生动自然对话的语音AI模型

编辑配图:集成于ChatGPT Voice界面的OpenAI GPT-Live语音模型

OpenAI推出GPT-Live,这是一款专为自然、生动的对话式AI交互而设计的新语音模型。该模型从发布第一天起便集成于ChatGPT Voice,是语音模型加速研发周期的成果——距GPT-Realtime-2.1发布仅两天。技术规格和定价目前尚未公布。

🔴 📦 开源 2026年7月8日 · 3 分钟阅读

PyTorch 2.13:LLM训练GPU显存最高降低4倍,FlexAttention提速12.3倍

编辑配图:PyTorch 2.13新版本,AI训练与推理的关键改进

PyTorch 2.13发布,包含来自526位贡献者的3328个提交。核心亮点:nn.LinearCrossEntropyLoss将LLM训练峰值GPU显存最高降低4倍,Apple Silicon上FlexAttention最高提速12.3倍,新torchcomms后端现代化分布式训练。

🟡 🤖 模型 2026年7月8日 · 3 分钟阅读

Anthropic开发危险知识「关闭开关」:GRAM将两用能力隔离为可移除模块

编辑配图:Anthropic GRAM可互换知识模块,用于AI两用能力的控制与移除

Anthropic与AE Studio发布GRAM(梯度路由辅助模块)——这一方法在训练期间将病毒学、网络安全、核物理等两用知识隔离到可移除的神经网络模块中,允许单次训练生成具有不同能力集合的多个模型变体。

2026年7月7日星期二

15 条新闻

2026年7月6日星期一

12 条新闻
🔴 🤖 模型 2026年7月6日 · 3 分钟阅读

Anthropic揭示J-space:Claude内部涌现的全局工作空间

编辑插图:Anthropic对神经网络可解释性与隐藏行为的研究

Anthropic研究人员利用全新的Jacobian lens(J-lens)技术,在Claude内部识别出一种名为J-space的涌现内部结构。受神经科学全局工作空间理论启发,J-space作为隐式内部推理空间运作,在模型输出中不可见,但能揭示幻觉、识别测试场景以及植入的恶意目标等隐藏行为。

🟡 🏥 实践应用 2026年7月6日 · 3 分钟阅读

艾伯塔省20小时扫描4.66亿行代码:政府使用Claude保障网络安全

编辑插图:Anthropic在大型政府源代码中发现安全漏洞

加拿大艾伯塔省政府使用Claude Code(约50个并行AI智能体)在20小时内扫描了4.66亿行代码——若用传统方法完成这项工作需要6.5年。项目涵盖27个部委的1,280个应用程序和3,400个代码库,其中没有一个曾经过系统性安全审查。

🟡 🤖 模型 2026年7月6日 · 3 分钟阅读

AWS引入rDPO——为Amazon Nova模型提供选择性遗忘功能

编辑插图:通过rDPO和LoRA技术对AI模型进行选择性遗忘

Amazon Web Services为Nova模型发布了基于反向直接偏好优化(rDPO)的选择性遗忘技术。通过LoRA适配器实现,无需完全重新训练,该技术可将不必要的拒绝率降低多达53.74个百分点,同时对模型实用性影响极小。

🟡 🤖 模型 2026年7月6日 · 3 分钟阅读

OpenAI发布GPT-Realtime-2.1及mini版本:改进语音识别与噪音处理

编辑插图:OpenAI GPT Realtime实时语音模型用于智能体音频通信

OpenAI于2026年7月6日发布了两款全新实时语音模型——GPT-Realtime-2.1和GPT-Realtime-2.1-mini,可在现有v1/realtime端点上使用。新模型在字母数字序列识别、静音和噪音处理以及对话中断处理等方面均有改进。

2026年7月4日星期六

1 条新闻

2026年7月3日星期五

11 条新闻
🟡 🔧 硬件 2026年7月3日 · 2 分钟阅读

AMD AgentKernelArena:针对GPU内核优化的AI代理开放基准测试框架

编辑插图:用于AI代理内核代码优化基准测试的AMD MI355X GPU芯片

AMD Research于2026年7月3日发布了开放基准测试框架AgentKernelArena,用于衡量AI编程代理优化真实GPU内核的能力。在四个类别共214个任务中,AMD自研的GEAKv3(Claude Opus 4.6)以9.04倍加速在HIP内核上领先,Claude Code(Opus 4.6)以6.08倍位居第二。所有实验均在ROCm 7.1.1环境下的AMD Instinct MI300X上进行。

🟡 🔧 硬件 2026年7月3日 · 3 分钟阅读

AMD Eagle3与Quark FP8:推测性解码在MI355X上实现最高2.00倍吞吐量

编辑插图:AMD Eagle3推测性解码在AMD Instinct GPU上实现加速推理

AMD ROCm团队于2026年7月3日发布了Eagle3推测性解码在AMD硬件上的生产应用详情。Eagle3多层方法、vLLM后端和AMD Quark FP8量化的组合,在AMD Instinct MI355X上为Kimi-K2.5实现1.69倍至2.00倍的吞吐量提升,为MiniMax-M2.5实现1.38倍至1.79倍的提升,且输出质量无损失。

🟡 🤝 智能体 2026年7月3日 · 3 分钟阅读

Claude Code v2.1.200:默认权限模式更改为手动

编辑插图:带有新安全修复和手动权限的Claude Code CLI代理

Anthropic于2026年7月3日发布Claude Code v2.1.200。所有界面的默认权限模式已更改为手动(Manual),AskUserQuestion对话框在未进行显式配置的情况下不再自动继续。修复了守护进程被接管的安全漏洞,改善了后台会话和子代理速率限制处理问题,并消除了tmux 3.4+下的渲染闪烁问题。

🟡 🛡️ 安全 2026年7月3日 · 3 分钟阅读

针对AI编程代理的分布式攻击:现有监控器无一能同时阻止两类攻击

编辑插图:通过恶意拉取请求保护AI代理免受分布式攻击

新研究引入了Iterative VibeCoding基准测试,证明AI编程代理可以在多个拉取请求会话中分散恶意载荷,即使面对高级监控器也能达到≥65%的规避率——现有任何监控方法均无法同时阻止两类攻击。