ScaleEnv:从零合成全交互环境,靠工具依赖图保证可解

训练通用的 tool-use agent 需要大量交互环境让模型自我探索,但现成环境极度稀缺,而既有合成方法在多样性可扩展性上都不够。ScaleEnv 的思路很直接:从零造一个完全可交互、且任务可验证的环境,不依赖既有实现。

论文信息

  • 标题:ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training
  • 作者:Tu Dunwei, Hao Hongyan, Yang Hansi et al., 2026
  • arXiv2602.06820
  • 关键词:environment synthesis from scratch、tool dependency graph、generalist agent

要解决的问题

通用 agent 要适配多样场景,靠的是在交互环境里探索学习。问题是:真实交互环境太少,合成方法又受限于环境多样性和扩展性。结果是模型要么过拟合到少数手工环境,要么在未见场景下泛化失败。

核心方法

ScaleEnv 是一个从零构建全交互环境 + 可验证任务的框架,关键机制有三条:

  1. 过程式测试保证可靠性:对合成的环境做过程式测试,确保环境本身能正确运行、状态一致;
  2. 工具依赖图扩展:通过工具间的依赖关系扩展,保证任务在结构上完整
  3. 可执行动作验证:验证每个动作确实可执行,从而保证任务可解(solvable)

三条合起来,解决的是合成环境最致命的两个问题——「造出来跑不通」和「任务根本无解」。

实验结果

  • 在未见过的多轮 tool-use 基准 τ²-Bench 和 VitaBench 上,用 ScaleEnv 探索训练带来显著性能提升,体现强泛化;
  • 进一步研究了领域数量与模型泛化的关系,给出经验证据:扩展环境多样性对鲁棒 agent 学习是关键——这是「scaling environmental diversity」的正面证据。

定位与启示

ScaleEnv 代表「环境合成」里偏工程可靠性的路线:不假设环境已存在,而是从零造并保证可解。它和 Environment-free(不造环境、直接用 LLM 当世界模型)是两个极端——一个把环境做实做硬,一个把环境做虚做软。两者互补:ScaleEnv 适合需要真实状态转移的 tool-use 训练,Environment-free 适合 API 生态稀缺时的快速数据补充。综述 2606.12191 里它属于规模驱动合成的典型。


ScaleEnv:从零合成全交互环境,靠工具依赖图保证可解
https://kissshhot.github.io/2026/08/21/scaleenv-environment-synthesis-from-scratch/
作者
丁一帆
发布于
2026年8月21日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。