🟡 🤝 智能体 发布于: · 2 分钟阅读 ·

arXiv:2607.15901:DSWorld世界模型让数据科学智能体训练与推理最高提速14倍

arXiv:2607.15901 ↗

DSWorld世界模型预测数据科学智能体操作结果并加速训练的示意图

DSWorld是Zherui Yang、Fan Liu和Hao Liu提出的世界模型,用于预测数据科学智能体操作的结果,从而降低计算效率低下的问题。该模型结合结构化状态、智能路由和基于LLM的模拟器,并配合Reflective World Model Optimization及8000条轨迹数据集。结果是RL智能体训练提速约14倍,基于搜索的推理提速约3-6倍。

🤖

本文由人工智能基于一手来源生成。

什么是DSWorld,为何数据科学智能体需要世界模型?

世界模型是一种在动作真正执行之前,于内部模拟其结果的组件,使智能体无需每次都等待真实操作结果。Zherui Yang、Fan Liu和Hao Liu提出了DSWorld,一个专为数据科学智能体——自动编写并执行代码以进行数据分析、模型训练和结果评估的系统——设计的世界模型。他们要解决的问题是计算效率低下:每一次尝试的操作通常都需要真实执行,而这类任务往往是资源密集型的,例如模型训练或大规模数据集处理。

DSWorld结合结构化状态、路由与模拟

该架构结合了三个要素:简明描述当前任务上下文的结构化状态;决定何时值得调用真实模拟、何时用快速估算更划算的智能路由;以及无需真实执行便能预测资源密集型操作结果的基于LLM的模拟器。该系统还搭配了名为”Reflective World Model Optimization”的技术——一种误差感知的强化学习(RL)方法,从自身预测错误中学习——以及作为训练基础的8000条记录轨迹数据集。

DSWorld:训练提速14倍,推理提速3-6倍

结果显示出显著的加速:相较于没有世界模型的方法,DSWorld使RL智能体训练提速约14倍,并使基于搜索的推理——即智能体在选定最佳方案前探索多种可能操作——提速3到6倍。此外,该系统在状态转移预测任务上——即预测某项操作后任务状态将如何变化——比测试中最强的LLM基线高出35.6%,同时在数据科学的整体任务上保持了具有竞争力的表现。

加速效果改变了智能体工作的经济性

14倍的训练提速与3-6倍的推理提速相结合,意味着数据科学智能体能够在相同的时间和计算预算内尝试更多策略。对于那些通常需要昂贵、反复执行代码的任务——例如超参数搜索或模型选择——这直接转化为更低的成本和更快的自动化数据科学流水线迭代速度。

常见问题

在数据科学智能体的语境下,世界模型是什么?
世界模型是一种在操作实际执行之前预测其结果的组件,使智能体能在资源密集型任务上节省时间和计算资源。
DSWorld比现有方法快多少?
DSWorld使RL智能体训练提速约14倍,基于搜索的推理提速3到6倍,在状态转移预测上比最强的LLM基线高出35.6%。
什么是Reflective World Model Optimization?
这是一种误差感知的强化学习(RL)技术,它从世界模型自身的预测错误中学习,使用了一个包含8000条记录轨迹的数据集。

📬 AI 新闻直达您的邮箱

按您的方式定制每日摘要——自选主题、来源和频率,一键退订。