arXiv:2607.17641: VRR-Stop解决LLM智能体何时应停止反复修复自身回答的问题
Yitao Wu及其合作者证明,当verifier和repairer都会出错时,LLM智能体的verify-repair循环可能会使结果变差,并提出VRR-Stop——一个具有4个噪声参数和belief filtering的模型,配合VRR-Guard后备机制。在数学任务上,该方案相比固定五轮修复提升了60.6个百分点。
本文由人工智能基于一手来源生成。
为何verify-repair循环有时反而使回答变差?
Yitao Wu及其合作者在论文「Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents」(arXiv:2607.17641)中探讨了LLM智能体中的一种常见模式:智能体交替调用verifier(评估当前回答的正确性)和repairer(尝试修正回答)。作者展示了一个悖论性的发现——如果verifier和repairer都以不可忽视的概率出错,循环中每一轮额外的迭代不一定能改善结果,反而可能使其变差,因为repairer可能会朝错误的方向「修复」一个本已正确的回答。
VRR-Stop:具有4个参数的噪声模型与belief filtering
作为解决方案,作者提出了VRR-Stop,一种用4个参数——即verifier和repairer在两个方向上的错误率——描述其行为的噪声模型的方法。基于该模型,belief filtering持续追踪当前回答正确的估计概率,并据此决定智能体是应进行下一轮修复,还是应停止。此外还定义了VRR-Guard,一种后备机制,当估计变得过于不确定、无法可靠继续时,由它来接管决策。
VRR-Stop相较固定五轮修复的表现
在数学推理任务上,VRR-Stop相比通常采用的固定五轮verify-repair修复方法提升了60.6个百分点,而固定方法会将循环持续进行到预设步数,而不考虑回答是否有所改善。作者强调,这一提升相较固定循环仅带来极小的额外计算开销,这使VRR-Stop成为依赖迭代验证与修复回答的智能体系统的实用替代方案。
常见问题
- 为何verify-repair循环有时会使LLM智能体的回答变差?
- verify-repair循环交替调用verifier(评估回答是否正确)和repairer(尝试修正回答)。如果两者都会出错,每一轮额外的循环都可能丢弃一个本来正确的答案,或引入新的错误,而不是改善结果。
- VRR-Stop是什么,如何决定何时停止?
- VRR-Stop是一种方法,它用4个参数为verifier和repairer的噪声建模,随后通过belief filtering(即持续追踪当前回答正确的估计概率)来决定智能体应继续修复回答、停止,还是依赖VRR-Guard后备机制。
- VRR-Stop相比固定轮次能提升多少结果?
- 在数学推理任务上,VRR-Stop相比固定五轮修复的方法提升了60.6个百分点,同时仅带来极小的额外计算开销。
📬 AI 新闻直达您的邮箱
按您的方式定制每日摘要——自选主题、来源和频率,一键退订。