AWS:Self-Distilled Reasoning让Amazon Nova 2数学准确率在微调后从6%恢复至约68%
AWS推出了Self-Distilled Reasoning(SDR),一种在训练数据缺乏思维链的情况下对Amazon Nova 2模型进行监督式微调的技术。该方法利用基础版Nova 2 Lite生成思维链轨迹,实现超过6.5%的相对性能提升,并将整体数学准确率从6%恢复至约68%,在三个基准测试上均无需人工标注即可验证。
本文由人工智能基于一手来源生成。
Self-Distilled Reasoning是什么,解决了什么问题?
AWS推出了Self-Distilled Reasoning(SDR),一种用于对Amazon Nova 2模型进行监督式微调(supervised fine-tuning,在已标注样本上对模型进行额外训练)的技术,适用于训练数据缺乏思维链(chain-of-thought,模型在给出最终答案前经历的推理步骤)的场景。此类数据在实践中很常见:企业往往只有问答对,而没有记录推理路径,这使得训练模型自主推理变得困难。
为何普通微调会破坏整体性能?
当模型直接在缺乏推理轨迹的狭窄数据上微调(普通SFT)时,模型的整体数学性能会从基础模型的70%骤降至仅6%——这种现象被称为灾难性遗忘(catastrophic forgetting),即由于后续训练过于狭窄而导致先前习得能力的丧失。模型在狭窄任务上表现良好,却失去了此前拥有的解决数学问题的能力。
SDR利用模型生成自身的训练数据
AWS提出的解决方案是利用基础版Nova 2 Lite模型,为缺乏思维链轨迹的现有训练数据自主生成这些轨迹,无需人工标注。经过这样丰富后的数据随后被用于对目标模型进行微调。结果显示:SDR在目标任务上实现了超过6.5%的相对性能提升,同时将整体数学准确率从6%恢复至约68%——这一差距表明,在微调过程中保留推理能力可以大幅减少对模型其他技能造成的连带损害。
在三个不同基准测试上进行了验证
AWS在来自不同领域的三个基准测试上测试了该方法:MedMCQA(医学问题)、CoCoHD和Invoice-OCR(发票处理)。三项互不相关任务上结果的一致性表明,SDR并非针对单一数据类型的狭隘解决方案,而是在原始数据本身缺乏推理轨迹时适用的通用微调方法。
常见问题
- 什么是监督式微调(SFT)?
- 监督式微调是指在特定的一组已标注样本上,对已训练完成的模型进行额外训练,以使其更好地完成特定任务。
- 什么是灾难性遗忘,SDR如何解决这个问题?
- 灾难性遗忘(catastrophic forgetting)是指模型在经过狭窄范围的微调后丧失整体能力;在普通SFT下,Amazon Nova 2的整体数学性能从70%降至6%,而SDR技术将其恢复至约68%。
- Self-Distilled Reasoning如何生成训练数据?
- SDR利用基础模型Amazon Nova 2 Lite,为缺少思维链轨迹的现有训练数据自主生成思维链(chain-of-thought)轨迹,无需人工标注。
📬 AI 新闻直达您的邮箱
按您的方式定制每日摘要——自选主题、来源和频率,一键退订。