Environment-free:让 LLM 当世界模型,零执行环境造 API 调用轨迹

训练 API 调用 agent 要海量高质量轨迹,但这些轨迹通常依赖完整实现的环境——可执行的 API、真实预填充的后端数据库。这套基础设施是扩展性的最大瓶颈。Environment-free 的反直觉思路是:根本不造执行环境,直接让 LLM 当即时世界模型,只给 API 规格就能造出逼真的交互轨迹。

论文信息

  • 标题:Environment-free Synthetic Data Generation for API-Calling Agents
  • 作者:Lee Seanie, Chowdhury Sanjoy, Jiang Chao et al., 2026
  • arXiv2607.16900
  • 关键词:environment-free、LLM as world model、API-calling agent、synthetic trajectory

要解决的问题

API-calling agent 的监督数据卡在「环境」上:要造一批轨迹,先得把 API 实现出来、把后端数据库填真实数据。API 生态越多样,这个成本越不可承受。于是数据量上不去,agent 训不出来。

核心方法

方法把 LLM 当作 on-the-fly 的数字世界模型,只用 API 规格作为输入,合成模拟「agent ↔︎ 有状态环境」交互的轨迹,分三步:

  1. 任务生成:LLM 基于给定 API 生成多样的、可被这些 API 解决的任务;
  2. 教师求解 + 模拟器响应:教师 agent 迭代求解每个任务,同时一个 LLM 模拟器根据任务上下文和模拟历史生成连贯的合成 API 响应(关键在「有状态」——响应要和历史一致);
  3. 判官过滤:LLM judge 过滤轨迹,保证数据集质量。

核心是把「环境」从一个工程实体压缩成「LLM 的条件生成」——环境状态隐含在模拟历史里。

实验结果

  • 在有挑战的 AppWorldOfficeBench 上评测,涵盖信息检索和状态改变两类任务;
  • 用合成数据微调模型带来显著性能增益,证明无需任何可执行环境也能产出有效监督;
  • 结论:基于 LLM 的 API 模拟是跨多样 API 生态训练 agent 的实用、可扩展方案。

定位与启示

Environment-free 代表「数据合成」里最激进的一支——把环境彻底虚化。它和 ScaleEnv 形成对照:ScaleEnv 把环境做实做硬以保证可解,Environment-free 把环境做虚做软以换扩展性。它的成立条件是「LLM 足以充当可信世界模型」,这恰恰是 2026 年大模型能力强到一定程度后才划算的赌注。风险也在这里:模拟器一旦状态不一致,合成的轨迹会带毒。judge 过滤是它对冲这个风险的机制。


Environment-free:让 LLM 当世界模型,零执行环境造 API 调用轨迹
https://kissshhot.github.io/2026/08/21/env-free-synthetic-data-api-agents/
作者
丁一帆
发布于
2026年8月21日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。