AgentOmnia:双向环境-任务合成 + PRD 自演化,全场景 agentic scaling

LLM agent 进展很快,但进步是碎片化的——跨领域、能力、任务难度、交互设定都参差不齐。AgentOmnia 把这个问题框定为「全场景 agentic scaling」,用一条 taxonomy 把任务空间定义、数据合成、后训练、评测、改进串成一个闭环,并造出了相当规模的环境-任务-工具集合。

论文信息

  • 标题:AgentOmnia: Scaling Agentic Models for Full-Scenario Applications
  • 作者:Jiang Hao, Xin Gangtao, Huang Yingdi et al., 2026
  • arXiv2607.23124
  • 关键词:full-scenario scaling、bidirectional env-task synthesis、PRD self-evolution、OmniaBench

要解决的问题

agent 能力提升碎片化:ToC / ToB / ToE 三类应用各自为政,能力维度、任务难度、交互设定缺乏统一坐标系,导致诊断不精细、改进没方向。需要一个能同时刻画「全场景」并驱动定向提升的框架。

核心方法

AgentOmnia 协调五个阶段(任务空间定义、数据合成、后训练、评测、改进),核心有几条:

  1. 可扩展 taxonomy:Domain × Capability × Atomic Difficulty 三维分类,统一对齐各阶段,并用 OmniaBench 做细粒度诊断;
  2. 双向环境-任务合成:环境↔︎任务双向生成,结合三条管线——工具依赖(tool-dependency)、程序结构化(program-structured)、求解器(solver-based);
  3. 规模数据:构建 5,018 个有状态环境、255,375 个工具、52,361 个任务;程序/求解器/验证器提供正确性信号;
  4. 后训练:SFT + 在线 agentic RL + rollback curriculum(回滚课程);
  5. PRD 自演化:评测失败转化为产品需求文档(PRD),驱动定向自我演化。

实验结果

  • 起点 Qwen3-30B-A3B-Thinking-2507,OmniaBench 挑战子集 pass rate 9.16% → 37.11%
  • OmniaBench / τ²-Bench / DeepPlanning / VitaBench 四基准宏平均 22.86% → 41.69%
  • 统一协议下,在 OmniaBench 上领先受评 agentic 后训练基线,并保持最高四基准宏平均;
  • 在全部四个基准上超越 Qwen3-235B-A22B-Thinking-2507,宏平均也超过 Qwen3.5-35B-A3B;
  • 增益横跨三个应用切分、十个能力维度、八个原子难度因子、90 个一级领域中的 76 个——说明是广泛提升而非某类专属
  • 一轮研究为 PRD 引导的自演化提供初步证据。

定位与启示

AgentOmnia 是这一批里野心最大的工作:它把环境合成、数据合成、RL 后训练、评测、自演化焊成一条流水线,并用 PRD 把「失败」结构化成「下一步做什么」。它的双向 env-task 合成 + 三管线 + 回滚课程,基本是「Agentic 数据合成与环境合成」这个类别的集大成。对做 agent 后训练的人,最有借鉴价值的是两点:一是用 taxonomy 把碎片化能力变成可诊断、可定向修补的坐标系;二是把评测失败转成 PRD 做 self-evolution——这是把「环境-数据-模型」三者闭环驱动的可行范式。


AgentOmnia:双向环境-任务合成 + PRD 自演化,全场景 agentic scaling
https://kissshhot.github.io/2026/08/21/agentomnia-full-scenario-agentic-scaling/
作者
丁一帆
发布于
2026年8月21日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。