AgentOmnia:双向环境-任务合成 + PRD 自演化,全场景 agentic scaling
LLM agent 进展很快,但进步是碎片化的——跨领域、能力、任务难度、交互设定都参差不齐。AgentOmnia 把这个问题框定为「全场景 agentic scaling」,用一条 taxonomy 把任务空间定义、数据合成、后训练、评测、改进串成一个闭环,并造出了相当规模的环境-任务-工具集合。
论文信息
- 标题:AgentOmnia: Scaling Agentic Models for Full-Scenario Applications
- 作者:Jiang Hao, Xin Gangtao, Huang Yingdi et al., 2026
- arXiv:2607.23124
- 关键词:full-scenario scaling、bidirectional env-task synthesis、PRD self-evolution、OmniaBench
要解决的问题
agent 能力提升碎片化:ToC / ToB / ToE 三类应用各自为政,能力维度、任务难度、交互设定缺乏统一坐标系,导致诊断不精细、改进没方向。需要一个能同时刻画「全场景」并驱动定向提升的框架。
核心方法
AgentOmnia 协调五个阶段(任务空间定义、数据合成、后训练、评测、改进),核心有几条:
- 可扩展 taxonomy:Domain × Capability × Atomic Difficulty 三维分类,统一对齐各阶段,并用 OmniaBench 做细粒度诊断;
- 双向环境-任务合成:环境↔︎任务双向生成,结合三条管线——工具依赖(tool-dependency)、程序结构化(program-structured)、求解器(solver-based);
- 规模数据:构建 5,018 个有状态环境、255,375 个工具、52,361 个任务;程序/求解器/验证器提供正确性信号;
- 后训练:SFT + 在线 agentic RL + rollback curriculum(回滚课程);
- PRD 自演化:评测失败转化为产品需求文档(PRD),驱动定向自我演化。
实验结果
- 起点 Qwen3-30B-A3B-Thinking-2507,OmniaBench 挑战子集 pass rate 9.16% → 37.11%;
- OmniaBench / τ²-Bench / DeepPlanning / VitaBench 四基准宏平均 22.86% → 41.69%;
- 统一协议下,在 OmniaBench 上领先受评 agentic 后训练基线,并保持最高四基准宏平均;
- 在全部四个基准上超越 Qwen3-235B-A22B-Thinking-2507,宏平均也超过 Qwen3.5-35B-A3B;
- 增益横跨三个应用切分、十个能力维度、八个原子难度因子、90 个一级领域中的 76 个——说明是广泛提升而非某类专属;
- 一轮研究为 PRD 引导的自演化提供初步证据。
定位与启示
AgentOmnia 是这一批里野心最大的工作:它把环境合成、数据合成、RL 后训练、评测、自演化焊成一条流水线,并用 PRD 把「失败」结构化成「下一步做什么」。它的双向 env-task 合成 + 三管线 + 回滚课程,基本是「Agentic 数据合成与环境合成」这个类别的集大成。对做 agent 后训练的人,最有借鉴价值的是两点:一是用 taxonomy 把碎片化能力变成可诊断、可定向修补的坐标系;二是把评测失败转成 PRD 做 self-evolution——这是把「环境-数据-模型」三者闭环驱动的可行范式。
AgentOmnia:双向环境-任务合成 + PRD 自演化,全场景 agentic scaling
https://kissshhot.github.io/2026/08/21/agentomnia-full-scenario-agentic-scaling/
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。