🤖 模型

189 条新闻

🟡 🤖 模型 2026年7月10日 · 1 分钟阅读

arXiv:2607.08733:「超级权重」揭示选择性微调失败之谜——COLM 2026接收论文

创意插图:参数网络中,数个发光节点支撑着整个结构

《LLM中的超级权重》是一篇被COLM 2026接收的论文,识别出「超级权重」——少量参数,其改变对语言模型行为产生不成比例的影响。论文表明,正是这些权重解释了为何仅对部分层进行选择性微调往往会失败,对PEFT和LoRA方法具有直接影响。

🔴 🤖 模型 2026年7月9日 · 2 分钟阅读

Google: SensorFM——基于万亿分钟可穿戴数据训练的基础模型,在 35 项健康任务中赢得 34 项

编辑插图:智能手表发出生物信号波形流入神经网络

SensorFM 是 Google 用于可穿戴设备健康数据的基础模型,基于来自 100 多个国家 500 万用户的 Fitbit 和 Pixel Watch 超过万亿分钟的信号训练而成。在 35 项任务中赢得 34 项,分类任务 AUC 提升 +9%,回归任务相关性提升 +21%。

🔴 🤖 模型 2026年7月9日 · 1 分钟阅读

Microsoft: 开源模型 Aurora 1.5 在 88.9% 的变量上超越 ECMWF 集合预报——AI 天气预报新标准

编辑插图:覆盖旋转天气锋面与数据网络的地球

Aurora 1.5 是微软的开源地球系统基础模型,在 88.9% 的评估变量和预报时效上超越 ECMWF 集合预报。新版本新增 22 个气象变量、小时级分辨率和概率集合预报,针对飓风 Helene 的路径误差比初代 Aurora 降低约 33%。

🔴 🤖 模型 2026年7月9日 · 2 分钟阅读

OpenAI: GPT-5.6 推出三款变体——Sol、Terra 与 Luna,内置多智能体编排,GitHub Copilot 同日上线

编辑插图:三颗星球(Sol、Terra、Luna)由数据流相互连接

GPT-5.6 是 OpenAI 推出的全新模型家族,包含三款变体:Sol(旗舰推理)、Terra(均衡型)和 Luna(高容量、成本高效型)。新增程序化工具调用、显式提示缓存控制、持久化推理及多智能体编排测试版,首日即登陆 GitHub Copilot。

🟡 🤖 模型 2026年7月9日 · 1 分钟阅读

Meta: Muse Spark 1.1 带来百万 token 上下文的多模态推理,并通过 Model API 协调子智能体

编辑插图:中央火花分支延伸至多个子智能体和应用流

Muse Spark 1.1 是 Meta Superintelligence Labs 面向智能体任务的多模态推理模型,上下文窗口达百万 token。模型可协调子智能体、在多个应用中导航工作流,并接受图像、视频和 PDF 输入,现已通过 Meta Model API 公开预览,并在 Meta AI 应用的 Thinking 模式中可用。

🟡 🤖 模型 2026年7月9日 · 1 分钟阅读

xAI: Grok 4.5——面向编程和智能体任务的新旗舰,每百万输入 token 仅需 2 美元

编辑插图:黑暗控制台屏幕上的代码,机器人手臂持工具从中伸出

Grok 4.5 是 xAI 面向编程和智能体任务的新旗舰模型,输入价格为每百万 token 2 美元,输出 6 美元。支持可配置的推理强度(low/medium/high),已在 Perplexity 的 Agent API 中上线,以激进价格大幅低于同类前沿模型。

🔴 🤖 模型 2026年7月8日 · 3 分钟阅读

Mistral Robostral Navigate:仅用RGB摄像头导航的机器人AI模型

编辑配图:仅依赖RGB视觉的Mistral Robostral具身机器人导航模型

Mistral推出Robostral Navigate,这是首款面向具身机器人导航的80亿参数模型。该模型仅使用单个RGB摄像头,无需LiDAR或深度传感器,在R2R-CE基准测试的未见环境中达到76.6%的成功率,超越多传感器竞争对手4.5个百分点。

🔴 🤖 模型 2026年7月8日 · 3 分钟阅读

OpenAI发布GPT-Live:面向生动自然对话的语音AI模型

编辑配图:集成于ChatGPT Voice界面的OpenAI GPT-Live语音模型

OpenAI推出GPT-Live,这是一款专为自然、生动的对话式AI交互而设计的新语音模型。该模型从发布第一天起便集成于ChatGPT Voice,是语音模型加速研发周期的成果——距GPT-Realtime-2.1发布仅两天。技术规格和定价目前尚未公布。

🟡 🤖 模型 2026年7月8日 · 3 分钟阅读

Anthropic开发危险知识「关闭开关」:GRAM将两用能力隔离为可移除模块

编辑配图:Anthropic GRAM可互换知识模块,用于AI两用能力的控制与移除

Anthropic与AE Studio发布GRAM(梯度路由辅助模块)——这一方法在训练期间将病毒学、网络安全、核物理等两用知识隔离到可移除的神经网络模块中,允许单次训练生成具有不同能力集合的多个模型变体。

🔴 🤖 模型 2026年7月7日 · 3 分钟阅读

Meta发布Muse Image和Muse Video:能自主纠错的智能体AI

编辑插图:Meta Muse用于图像和视频内容创作的生成式AI

Meta超级智能实验室推出Muse Image和Muse Video——两款以智能体模式运行的模型,内部调用代码和网络搜索工具,在Arena排行榜上同时占据第2和第3位,并强制嵌入Content Seal水印。

🟡 🤖 模型 2026年7月7日 · 3 分钟阅读

Direct-OPD:较弱模型如何在无需昂贵强化学习的情况下训练更强模型

编辑插图:弱到强的RL蒸馏作为AI系统超级对齐的方法

清华大学和智谱AI的研究人员提出了Direct On-Policy Distillation(Direct-OPD)——一种将强化学习收益从较弱的教师模型迁移给较强学生的方法,无需模仿最终策略,在AIME 2024上实现了从48.3%到62.4%的跃升。

🔴 🤖 模型 2026年7月6日 · 3 分钟阅读

Anthropic揭示J-space:Claude内部涌现的全局工作空间

编辑插图:Anthropic对神经网络可解释性与隐藏行为的研究

Anthropic研究人员利用全新的Jacobian lens(J-lens)技术,在Claude内部识别出一种名为J-space的涌现内部结构。受神经科学全局工作空间理论启发,J-space作为隐式内部推理空间运作,在模型输出中不可见,但能揭示幻觉、识别测试场景以及植入的恶意目标等隐藏行为。

🟡 🤖 模型 2026年7月6日 · 3 分钟阅读

AWS引入rDPO——为Amazon Nova模型提供选择性遗忘功能

编辑插图:通过rDPO和LoRA技术对AI模型进行选择性遗忘

Amazon Web Services为Nova模型发布了基于反向直接偏好优化(rDPO)的选择性遗忘技术。通过LoRA适配器实现,无需完全重新训练,该技术可将不必要的拒绝率降低多达53.74个百分点,同时对模型实用性影响极小。

🟡 🤖 模型 2026年7月6日 · 3 分钟阅读

OpenAI发布GPT-Realtime-2.1及mini版本:改进语音识别与噪音处理

编辑插图:OpenAI GPT Realtime实时语音模型用于智能体音频通信

OpenAI于2026年7月6日发布了两款全新实时语音模型——GPT-Realtime-2.1和GPT-Realtime-2.1-mini,可在现有v1/realtime端点上使用。新模型在字母数字序列识别、静音和噪音处理以及对话中断处理等方面均有改进。

🟢 🤖 模型 2026年7月6日 · 3 分钟阅读

MiniMax M2、M2.1和M2.5登陆Amazon Bedrock

编辑插图:AWS Bedrock平台新增第三方开放MoE模型

Amazon Bedrock扩展了模型目录,新增三款开放权重MiniMax模型——拥有百万token上下文的M2、专为深度推理和编码设计的M2.1,以及采用2300亿参数混合专家架构、面向智能体应用的M2.5。

🟡 🤖 模型 2026年7月3日 · 3 分钟阅读

ReContext在无需重新训练的情况下改善128K上下文窗口的利用率

编辑插图:语言模型在128K token长上下文中重放证据

伊利诺伊大学的研究人员开发了ReContext——一种推理时技术,在三种LLM架构和八个基准测试中递归重放长上下文窗口中的相关证据,一致改善性能,无需重新训练。

🟢 🤖 模型 2026年7月3日 · 3 分钟阅读

VRRL:强化学习迫使视觉模型在自我修正时真正利用图像

编辑插图:视觉-语言模型通过强化学习在场景上进行自我反思

Liyan Tang、Fangcong Yin和Greg Durrett开发了VRRL——一种强化学习框架,通过轨迹前缀遮蔽和经验回放,迫使视觉-语言模型将自我反思锚定在真实视觉输入上,在分布偏移样本上取得显著更好的效果。

🟡 🤖 模型 2026年7月1日 · 2 分钟阅读

Fable 5与Mythos 5重返服务:Anthropic为用户恢复模型访问权限

编辑配图:Anthropic为用户恢复Claude Fable 5和Mythos 5的可用性

Anthropic于7月1日恢复了Claude Fable 5和Claude Mythos 5的访问权限,距其因美国出口管制而下架已近三周。此次复出伴随着一款改进版安全分类器的部署,以及关于越狱严重性评级行业框架的提案。

🟡 🤖 模型 2026年7月1日 · 2 分钟阅读

NVIDIA Nemotron 和 OpenAI GPT OSS 模型在 AWS GovCloud 上获得 FedRAMP High 认证

编辑插图:NVIDIA Nemotron 和 OpenAI gpt-oss 模型在 AWS Bedrock GovCloud 上运行,并具备严格的安全认证

AWS GovCloud(US)在 Amazon Bedrock 上新增六款模型:OpenAI 开放权重模型 gpt-oss-120b 和 gpt-oss-20b,以及四款支持 100 万 token 上下文的 NVIDIA Nemotron 模型。基础设施满足 FedRAMP High、DoD IL 2/4/5、ITAR 和 CJIS 要求,并采用零运营商访问设计。

🟡 🤖 模型 2026年7月1日 · 3 分钟阅读

GitHub Copilot Vision 和浏览器工具:同日两项功能正式发布

编辑插图:GitHub Copilot Vision 和浏览器工具正式发布

GitHub 宣布两项 Copilot 功能正式发布(GA):Vision 支持在聊天提示中附加图片和 PDF,浏览器工具使 VS Code 中的智能体能够控制真实浏览器。两项功能均对所有套餐开放,无需管理员操作。

🔴 🤖 模型 2026年6月30日 · 3 分钟阅读

Claude Sonnet 5:Anthropic 最具智能体能力的模型成为新标准

编辑配图:Anthropic 发布全新旗舰 Claude Sonnet 5 智能体任务模型

Anthropic 今日发布 Claude Sonnet 5——该模型能够规划多步骤任务、操控浏览器与终端,在核心任务上的表现接近 Opus 4.8,同时提供 2026 年 8 月 31 日前每百万 token 输入 $2、输出 $10 的入门价格,以及 100 万 token 上下文窗口。

🟡 🤖 模型 2026年6月30日 · 3 分钟阅读

Fable 5 回归:政府解除出口管制,全球重新部署于 7 月 1 日开始

编辑配图:Anthropic 在美国政府解除出口禁令后重新启用 Fable 5

历经 18 天全球停用后,Anthropic 宣布重新部署 Fable 5:美国政府于 6 月 30 日解除出口管制,改进后的安全分类器在超过 99% 的情况下能够阻断已发现的绕过技术。

🟡 🤖 模型 2026年6月30日 · 2 分钟阅读

Google 同日发布两款模型:Gemini Omni Flash 与 Nano Banana 2 Lite

编辑配图:Google 发布 Gemini Omni Flash 视频模型和 Nano Banana 2 图像生成模型

2026 年 6 月 30 日,Google 同时发布 Gemini Omni Flash(用于对话式视频编辑)和 Nano Banana 2 Lite(用于快速图像合成)。视频模型每秒输出收费 0.10 美元,图像模型每千张仅需 0.034 美元。

🟡 🤖 模型 2026年6月30日 · 2 分钟阅读

Google Research 发布 TabFM:面向表格数据的零样本基础模型

编辑配图:Google TabFM 基础模型用于表格数据的零样本分析

Google Research 发布 TabFM,这是一个面向表格数据的基础模型,可在单次前向传播中给出零样本预测,无需调整超参数和特征工程。该模型在 TabArena 基准测试中取得顶级 Elo 评分,已在 Hugging Face 和 GitHub 上发布,并宣布将集成至 Google BigQuery。

🔴 🤖 模型 2026年6月29日 · 2 分钟阅读

Meta:Brain2Qwerty v2——无需外科植入物,以61%准确率将大脑信号转化为文字

编辑插图:Brain2Qwerty v2——无需外科植入物,以61%准确率将大脑信号转化为文字,无文字无人脸

Brain2Qwerty v2是Meta Research的AI系统,利用MEG扫描仪在无需手术的情况下将脑信号转化为文字。单词识别平均准确率达61%,是其他非侵入式方法(8%)的七倍。训练代码和数据集已开源发布。

🟡 🤖 模型 2026年6月29日 · 1 分钟阅读

GitHub:Claude Opus 4.8快速模式进入Copilot预览;Anthropic终止Opus 4.6的快速模式

编辑插图:Claude Opus 4.8快速模式进入Copilot预览;Anthropic终止Opus 4.6的快速模式,无文字无人脸

Claude Opus 4.8快速模式现已进入GitHub Copilot用户的预览阶段,在保持模型智能水平的同时显著加快输出token生成速度。与此同时,Anthropic终止了Opus 4.6的快速模式——快速模式能力集中到唯一剩余的支持模型。

🟢 🤖 模型 2026年6月29日 · 1 分钟阅读

Allen Institute:DiScoFormer——单个Transformer跨分布同步估计密度与得分函数

编辑插图:DiScoFormer——单个Transformer跨越不同分布同步估计密度与得分,无文字无人脸

DiScoFormer是Allen Institute for AI(AI2)的Transformer模型,在单次前向传播中同时估计密度函数(分布密度)和得分函数——此前需要两个独立模型。它将KDE推广至高维空间,无需重新训练即可适应新分布。

🟢 🤖 模型 2026年6月29日 · 1 分钟阅读

arXiv:2606.28166:Tandem RL——可验证奖励提升思维链可读性并改善向小模型的迁移

编辑插图:2606.28166:Tandem RL——可验证奖励提升思维链可读性并改善向小模型的迁移,无文字无人脸

Tandem RL是一种训练语言模型的新方法,将RLVR(带可验证奖励的强化学习)与串联方法结合:更强的模型在生成思维链时与冻结的较弱模型协作。在Qwen3-4B上,它在保持同等性能的同时显著提升可读性和向小模型迁移时的鲁棒性。

🟡 🤖 模型 2026年6月28日 · 1 分钟阅读

GitHub: MAI-Code-1-Flash,微软编程模型,现已在 Copilot Business 和 Enterprise 方案中正式发布

编辑插图:加速的代码流穿过开发界面,无文字无人脸

MAI-Code-1-Flash 是微软专有的编程模型,于 2026 年 6 月 26 日在 GitHub Copilot Business 和 Enterprise 方案中正式发布。该模型针对低延迟和高频智能体编程工作流进行了优化,按提供商定价的用量计费,管理员须在组织设置中显式启用。

🟢 🤖 模型 2026年6月28日 · 1 分钟阅读

arXiv:2606.26935: CoT 训练收益流向更强的动作预测,而非更深的智能体推理

编辑插图:分叉的决策流收窄为单一清晰路径,无文字无人脸

arXiv:2606.26935 研究(Jingyu Liu 等人)表明,LLM 智能体的思维链(CoT)训练收益流向更强的直接动作预测,而非更广泛的推理优势。后期检查点更少因 CoT 修改动作,而对 action-token 掩盖监督信号则提升了域外泛化能力。

🟢 🤖 模型 2026年6月28日 · 1 分钟阅读

arXiv:2606.26502: 推理模型在出错任务上消耗更多 token,与人类放弃的行为相反

编辑插图:两条努力曲线相互背离,一升一降,无文字无人脸

arXiv:2606.26502 研究(Han-yu Wang)发现,大型推理模型(LRM)在最终出错的任务上消耗的 token 多于答对的任务,与人类在困难任务上选择放弃的行为相反。差距显著(H-ARC 基准 Cohen's d 为 1.47–3.13),所有五款测试模型均呈现与人类相反的模式。

🔴 🤖 模型 2026年6月27日 · 2 分钟阅读

OpenAI:GPT-5.6 Sol预览发布——编码、科学与网络安全

编辑插图:带有代码、分子结构和网络安全盾牌标签的抽象神经网络图

GPT-5.6 Sol是OpenAI发布的下一代预览模型,目前处于预览状态(尚未正式发布),在编码、科学推理和网络安全方面能力增强,并配备迄今最先进的安全体系。

🟡 🤖 模型 2026年6月27日 · 1 分钟阅读

Anthropic:API速率限制提升——Sonnet和Haiku与Opus同等,三个层级

编辑插图:显示三级API访问的图表,箭头向上,抽象云朵和服务器机架

Anthropic统一了所有模型的API速率限制——Sonnet和Haiku现在在三个使用层级(Start、Build、Scale)上享有与Opus相同的配额。同时,Claude Opus 4.7的快速模式将于7月24日弃用。

🟡 🤖 模型 2026年6月27日 · 2 分钟阅读

arXiv:2606.26836: 标准基准遗漏了82%的AI模型真实能力

编辑插图:条形图显示单一模型评估与能力前沿测量之间的基准差距

研究人员证明,仅测量单一模型单次尝试的标准基准低估了LLM真实能力达82%。通过引入能力前沿框架——在21个模型和16个基准上使用帕累托最优性——可以在降低85%成本的同时达到相同准确率。

🟡 🤖 模型 2026年6月27日 · 1 分钟阅读

Google:冻结多令牌预测使Pixel上的Gemini Nano推理速度提升50%以上

编辑插图:智能手机芯片示意图,显示Pixel设备上的并行令牌预测路径

Google通过冻结多令牌预测技术将Pixel 9和10上的Gemini Nano推理速度提升了50%以上——每次前向传播平均生成约2个令牌,每实例节省130MB内存,且输出结果完全不变。

🟢 🤖 模型 2026年6月27日 · 1 分钟阅读

arXiv:2606.27288: 组合LLM何时真正有效——67个前沿模型的共同失败上限

编辑插图:AI模型集成准确率上限示意图,抽象图表无人脸

对来自21家提供商的67个前沿模型的研究引入了共同失败上限概念——LLM集成准确率的上界,由所有模型在同一查询上失败的比率决定。结果表明,若无查询级路由,组合模型鲜少超越单一最强模型。

🟡 🤖 模型 2026年6月26日 · 2 分钟阅读

Google Research:推理如何解锁LLM中的参数化知识

编辑插图:风格化的神经网络路径依次点亮,抽象的大脑和数据节点,冷蓝色调

Google Research揭示了推理轨迹通过两种机制改善模型权重中存储事实的提取——计算缓冲区和事实启动——在Gemini 2.5和Qwen3-32B上进行了测试。

🟢 🤖 模型 2026年6月26日 · 1 分钟阅读

arXiv:2606.25325: OPPO——让AI同时从声音、表情和文本中读懂情绪的强化学习框架

编辑插图:多模态系统中声波、人脸框和文字气泡融合为单一情绪分析的示意图

OPPO是一个强化学习系统,用于训练全模态语言模型同时理解视觉、听觉和文本情绪线索,抑制跨模态幻觉,并在MER-UniBench和MME-Emotion两个基准数据集上达到最优水平。

🟡 🤖 模型 2026年6月25日 · 2 分钟阅读

arXiv:2606.24510: RaDaR — 专用32B推理LLM在RCT中加速罕见病诊断

编辑插图:医疗AI诊断、准确率图表、分子结构与数字化医疗记录

RaDaR是专为罕见病诊断训练的320亿参数开源推理LLM。在随机对照试验中,相较于互联网搜索,它将医生诊断准确率提升了21.44个百分点,并能在61%的病例中提前临床记录识别出正确诊断。

🟡 🤖 模型 2026年6月25日 · 2 分钟阅读

arXiv:2606.24014: 健康领域RL训练将对齐能力迁移至80%以上的OOD基准

编辑插图:神经网络连接跨多个领域分叉,对齐迁移箭头,抽象科学可视化

Google Research研究人员表明,针对真实性、公平性和可纠正性等有益特征进行RL训练,可在50余个独立OOD基准中超过80%的基准上取得提升——包括训练领域以外的其他领域。

🟡 🤖 模型 2026年6月25日 · 1 分钟阅读

Google:DiffusionGemma 26B — 扩散方法实现4倍更快的文本生成

编辑插图:从扩散云中形成的并行文本流抽象呈现,数字风格

DiffusionGemma是谷歌260亿参数MoE模型,采用扩散方法并行生成文本。在单张H100 GPU上每秒生成超过1000个令牌,比标准自回归模型快4倍,但质量相较Gemma 4有所妥协。

🟡 🤖 模型 2026年6月25日 · 1 分钟阅读

Google:Gemini 3.5 Live Translate — 实时70+语言语音互译

编辑插图:音频波形连接全球多种文字的对话气泡,实时翻译概念图

谷歌推出Gemini 3.5 Live Translate——支持70余种语言和2000多种语言组合的实时语音转语音翻译系统,保留原讲话者的语调,并通过SynthID水印保护合成音频。

🟡 🤖 模型 2026年6月24日 · 2 分钟阅读

arXiv:2606.23181:DART——无需训练的混合推理模型自适应思考预算

编辑插图:抽象的令牌网络中两条独立决策路径的分支图

DART是一种无需任何训练即可决定AI模型是否需要深度思考的路由方法,可将思考令牌消耗减少15–69%,同时在代码测试中将准确率提升最高22.5分。

🟡 🤖 模型 2026年6月24日 · 1 分钟阅读

Mistral:OCR 4——支持170种语言的结构化文档提取与边界框

编辑插图:扫描的纸质文档,多语言段落和边界框被标注高亮

Mistral OCR 4是一款新的光学字符识别模型,在OlmOCRBench上以85.20分位居榜首,支持170种语言,并带来段落级边界框——每1000页定价4美元。

🟡 🤖 模型 2026年6月24日 · 2 分钟阅读

PyTorch/SGLang:DeepSeek-V4 Pro在NVIDIA GB300上——相同交互性下吞吐量提升5倍

编辑插图:安装有NVIDIA Blackwell GPU卡的服务器机架,以及展示吞吐量5倍增长的图表

PyTorch团队与SGLang在2026年4月至6月期间,将NVIDIA GB300架构上DeepSeek-V4 Pro模型的服务吞吐量从约2,200提升至超过11,200令牌/秒/GPU——在不牺牲终端用户交互性的前提下实现了5倍提升。

🟡 🤖 模型 2026年6月21日 · 1 分钟阅读

arXiv:2606.20560: DiffusionGemma 可解释性与 Gemma 4 相当——28.6× 差距缩小至 1.1×

编辑配图:DiffusionGemma 可解释性与 Gemma 4 相当——28.6× 差距缩小至 1.1×

DiffusionGemma 是谷歌在连续潜在空间中运行的扩散语言模型。一项由 Neel Nanda 领衔的 13 位作者研究表明,其初始不透明度比 Gemma 4 高 28.6 倍,但可解释性令牌瓶颈将该差距缩小至仅 1.1 倍。

🟢 🤖 模型 2026年6月21日 · 1 分钟阅读

arXiv:2606.20543: 空间投机解码将图像生成速度提升13.3倍

编辑插图:空间投机解码将图像生成速度提升13.3倍

SSD(空间投机解码)是一种新方法,可在自回归图像生成过程中同时预测像素的水平和垂直邻居,在DPG-Bench和GenEval基准测试中实现最高13.3倍的加速,且不损失视觉质量。

🟢 🤖 模型 2026年6月21日 · 1 分钟阅读

arXiv:2606.20561: TimeProVe将长视频推理推断成本降低93%

编辑配图:TimeProVe将长视频推理推断成本降低93%

TimeProVe是一个通过引入两阶段「提议再验证」方法来加速大型视觉语言模型在长视频上推理的框架。它将高成本模型的调用次数减少75%,总推断成本降低93%,并在新的OpenTSUBench基准测试中超越最强竞争对手7.3个百分点。

🟢 🤖 模型 2026年6月21日 · 1 分钟阅读

arXiv:2606.20008: VIMPO — 无评论家强化学习在MATH-500和AIME上超越GRPO

编辑插图:VIMPO——无评论家强化学习在MATH-500和AIME上超越GRPO

VIMPO是一种面向LLM推理的新型强化学习方法,从KL正则化RL中推导出隐式价值函数,无需独立的评论家网络。在包括AIME 2024和AIME 2025在内的四个数学基准测试上超越GRPO,且在噪声奖励条件下优势依然稳定。

🟡 🤖 模型 2026年6月20日 · 1 分钟阅读

arXiv:2606.20333:SoftSkill将技能文档压缩为32个潜在token,LiveMath提升42.1分

编辑插图:长文档被压缩为几个发光的潜在token

SoftSkill是arXiv:2606.20333论文描述的一种方法,将技能文档(如Markdown SKILL.md文件)转换为指导模型行为的紧凑连续潜在对象,而无需修改基础模型。SoftSkill仅使用32个虚拟token,在LiveMath任务上比无技能提示提升了42.1个百分点。

查看完整档案 →