arXiv:2607.08173:「过度思考」——增强推理迫使reasoning模型泄露所学秘密,ICML 2026新型提取攻击
「过度思考」是一篇被ICML 2026接收的论文,表明增强大型语言模型的推理权重可以提取出模型通常不会暴露的隐藏学习信息。这一发现开辟了针对推理型模型(如o1、DeepSeek R1和开启长思考的Claude)的全新提取攻击类别。
「过度思考」是一篇被ICML 2026接收的论文,表明增强大型语言模型的推理权重可以提取出模型通常不会暴露的隐藏学习信息。这一发现开辟了针对推理型模型(如o1、DeepSeek R1和开启长思考的Claude)的全新提取攻击类别。
《LLM中的超级权重》是一篇被COLM 2026接收的论文,识别出「超级权重」——少量参数,其改变对语言模型行为产生不成比例的影响。论文表明,正是这些权重解释了为何仅对部分层进行选择性微调往往会失败,对PEFT和LoRA方法具有直接影响。
Amazon SageMaker AI推出了NVIDIA Nemotron 3模型的无服务器定制化功能,无需管理基础设施。提供三种技术:SFT(监督微调)、RLVR(可验证奖励强化学习)和RLAIF(AI反馈强化学习),使企业团队无需机器学习基础设施知识即可使用先进的强化学习方法。
CodeQL 2.26.0是GitHub静态安全分析工具的新版本,将AI提示注入攻击检测作为新分析类型引入,同时支持Kotlin 2.4.0。这是首次将AI特定攻击向量集成到主流SAST工具中,使提示注入与XSS和SQL注入进入相同的安全工作流程。
GitHub发现,将Copilot代码审查迁移到更好维护的工具后,结果起初变差了——原因不是工具,而是不适配新工具和实际工作流程的过时提示词。通过将提示词重写为diff优先方式(批量发现后再读文件,分析锚定在PR diff上),他们在保持同等质量的前提下将平均审查成本降低了约20%。
OpenWiki Brains是LangChain的开源框架,为AI代理提供主动记忆:自动从外部来源收集上下文并以Markdown文件形式保存在磁盘上。第一个版本支持6个连接器——Gmail、Notion、Git、Twitter/X、Hacker News和网络搜索——通过定时任务在本地运行,而非依赖云端。
Deutsche Telekom与OpenAI签署了将运营商转型为AI原生电信公司的合作协议,应用领域涵盖客户支持、员工工具、网络运营和语音AI。Deutsche Telekom是欧洲最大运营商之一,全球约有2.45亿用户,使此次合作成为电信行业规模最大的AI交易之一。
AMD发布了在Instinct GPU上通过ROCm技术栈运行SGLang Diffusion的教程,支持图像生成与编辑扩散模型。SGLang最初因加速大型语言模型而流行,现在将支持范围扩展至图像扩散领域,从而增强AMD在NVIDIA生态之外的AI推理产品竞争力。
该论文提出了一种利用博弈论减少大型语言模型幻觉的多智能体框架。模型之间的交互被建模为战略博弈者之间的博弈,其中均衡状态对应于一致且无幻觉的回答,提供了一条有别于标准RLHF和RAG方法的新路径。
Claude Code v2.1.206是Anthropic CLI工具的新版本,引入了带路径建议的/cd命令、建议精简CLAUDE.md文件的/doctor检查,以及在/commit-push-pr中自动批准推送到已配置远端的git push功能。后台代理现在在升级后立即更新,无需在下次连接时经历缓慢的升级过程。
Henry Schein One基于Amazon SageMaker开发了「Image Verify」AI系统,用于实时验证牙科X光影像质量。该系统已在10,000多个地点部署,每周处理超过1100万张X光影像,平均延迟1.4秒,旨在减少因影像质量差导致的保险理赔拒绝。
来自Meta的PyTorch团队发布了将归一化操作直接融合进GEMM和attention核的技术,旨在消除其计算开销——「免费归一化」。代码已通过核函数库在GitHub上开放,直接效果是加快频繁使用Layer Norm和RMS Norm操作的模型的训练和推理速度。
SensorFM 是 Google 用于可穿戴设备健康数据的基础模型,基于来自 100 多个国家 500 万用户的 Fitbit 和 Pixel Watch 超过万亿分钟的信号训练而成。在 35 项任务中赢得 34 项,分类任务 AUC 提升 +9%,回归任务相关性提升 +21%。
Aurora 1.5 是微软的开源地球系统基础模型,在 88.9% 的评估变量和预报时效上超越 ECMWF 集合预报。新版本新增 22 个气象变量、小时级分辨率和概率集合预报,针对飓风 Helene 的路径误差比初代 Aurora 降低约 33%。
GPT-5.6 是 OpenAI 推出的全新模型家族,包含三款变体:Sol(旗舰推理)、Terra(均衡型)和 Luna(高容量、成本高效型)。新增程序化工具调用、显式提示缓存控制、持久化推理及多智能体编排测试版,首日即登陆 GitHub Copilot。
Ben Bernanke 是 2006 至 2014 年间担任美联储主席、并于 2022 年获得诺贝尔经济学奖的经济学家,Anthropic 已将其任命为 Long-Term Benefit Trust 成员。LTBT 是一个无股权、无利润分配的独立机构,负责监督公司的公共利益使命,Bernanke 将带来其对 AI 经济影响的专业见解。
Harness Effect 是 32 位作者的实证研究发现:编排层设计对 AI 智能体成本的影响超过模型本身的选择。在 22 项任务和 6 个模型上,优化的编排将每任务成本降低 41%(从 0.21 降至 0.12 美元),token 消耗减少 38%,执行时间缩短 44%——同时质量提升。
GitHub Copilot 仓库概览是一项新功能,首次访问陌生仓库时自动生成摘要:项目用途、使用的技术以及如何贡献。通过 Copilot chat 在 github.com 上运行,适用于所有 Copilot 计划,无需任何配置。
Mistral推出Robostral Navigate,这是首款面向具身机器人导航的80亿参数模型。该模型仅使用单个RGB摄像头,无需LiDAR或深度传感器,在R2R-CE基准测试的未见环境中达到76.6%的成功率,超越多传感器竞争对手4.5个百分点。
OpenAI推出GPT-Live,这是一款专为自然、生动的对话式AI交互而设计的新语音模型。该模型从发布第一天起便集成于ChatGPT Voice,是语音模型加速研发周期的成果——距GPT-Realtime-2.1发布仅两天。技术规格和定价目前尚未公布。
PyTorch 2.13发布,包含来自526位贡献者的3328个提交。核心亮点:nn.LinearCrossEntropyLoss将LLM训练峰值GPU显存最高降低4倍,Apple Silicon上FlexAttention最高提速12.3倍,新torchcomms后端现代化分布式训练。
Anthropic与AE Studio发布GRAM(梯度路由辅助模块)——这一方法在训练期间将病毒学、网络安全、核物理等两用知识隔离到可移除的神经网络模块中,允许单次训练生成具有不同能力集合的多个模型变体。
欧洲委员会今日发布了欧盟网络安全与AI联合行动计划,该计划建立在现行欧盟法律框架之上,协调成员国与行业力量,同时将AI视为攻击载体与防御工具加以应对。
Meta超级智能实验室推出Muse Image和Muse Video——两款以智能体模式运行的模型,内部调用代码和网络搜索工具,在Arena排行榜上同时占据第2和第3位,并强制嵌入Content Seal水印。
英国AI安全研究所使用前沿模型对其研究平台进行安全审计,发现了一条此前被标准工具遗漏的五步攻击链——全部成本不足150英镑的token费用。
来自首尔国立大学及印第安纳大学和威斯康星大学的研究人员引入了智能体数据注入攻击(ADI)——一种将恶意数据注入智能体受信数据结构的新型攻击,在Claude Code、Codex和Gemini CLI上实现了任意点击攻击和远程代码执行,并绕过了现有防御。
Anthropic研究人员利用全新的Jacobian lens(J-lens)技术,在Claude内部识别出一种名为J-space的涌现内部结构。受神经科学全局工作空间理论启发,J-space作为隐式内部推理空间运作,在模型输出中不可见,但能揭示幻觉、识别测试场景以及植入的恶意目标等隐藏行为。
加拿大艾伯塔省政府使用Claude Code(约50个并行AI智能体)在20小时内扫描了4.66亿行代码——若用传统方法完成这项工作需要6.5年。项目涵盖27个部委的1,280个应用程序和3,400个代码库,其中没有一个曾经过系统性安全审查。
Amazon Web Services为Nova模型发布了基于反向直接偏好优化(rDPO)的选择性遗忘技术。通过LoRA适配器实现,无需完全重新训练,该技术可将不必要的拒绝率降低多达53.74个百分点,同时对模型实用性影响极小。
OpenAI于2026年7月6日发布了两款全新实时语音模型——GPT-Realtime-2.1和GPT-Realtime-2.1-mini,可在现有v1/realtime端点上使用。新模型在字母数字序列识别、静音和噪音处理以及对话中断处理等方面均有改进。
AMD Research于2026年7月3日发布了开放基准测试框架AgentKernelArena,用于衡量AI编程代理优化真实GPU内核的能力。在四个类别共214个任务中,AMD自研的GEAKv3(Claude Opus 4.6)以9.04倍加速在HIP内核上领先,Claude Code(Opus 4.6)以6.08倍位居第二。所有实验均在ROCm 7.1.1环境下的AMD Instinct MI300X上进行。
AMD ROCm团队于2026年7月3日发布了Eagle3推测性解码在AMD硬件上的生产应用详情。Eagle3多层方法、vLLM后端和AMD Quark FP8量化的组合,在AMD Instinct MI355X上为Kimi-K2.5实现1.69倍至2.00倍的吞吐量提升,为MiniMax-M2.5实现1.38倍至1.79倍的提升,且输出质量无损失。
Anthropic于2026年7月3日发布Claude Code v2.1.200。所有界面的默认权限模式已更改为手动(Manual),AskUserQuestion对话框在未进行显式配置的情况下不再自动继续。修复了守护进程被接管的安全漏洞,改善了后台会话和子代理速率限制处理问题,并消除了tmux 3.4+下的渲染闪烁问题。
新研究引入了Iterative VibeCoding基准测试,证明AI编程代理可以在多个拉取请求会话中分散恶意载荷,即使面对高级监控器也能达到≥65%的规避率——现有任何监控方法均无法同时阻止两类攻击。