AgentInstruct (Orca-3):用 agentic 流做生成式教学,25M 对合成数据
合成数据对加速语言模型开发越来越关键,但它质量参差、多样性不稳,有效使用往往需要大量人工策展。AgentInstruct(即 Orca-3)把这个问题重新定义成「生成式教学(Generative Teaching)」——用强模型造数据去教另一个模型一项新技能或行为,并用 agentic 流自动生成大规模、多样、高质量的数据。
论文信息
- 标题:AgentInstruct: Toward Generative Teaching with Agentic Flows
- 作者:Mitra Arindam, Del Corro Luciano, Zheng Guoqing et al., 2024(Microsoft,Orca 系列)
- arXiv:2407.03502
- 关键词:generative teaching、synthetic data、agentic flow、instruction tuning、Orca-3
要解决的问题
合成数据有两面:成功用例不少,但 model collapse、模仿缺陷的担忧也在。根因是合成数据质量与多样性不稳定,而有效利用又依赖大量人工策展。AgentInstruct 要做的是自动化地把策展这件事交给 agentic 流。
核心方法
- Generative Teaching 设定:聚焦后训练,用强模型造数据教会目标模型一项新技能/行为;
- agentic 框架:可扩展的 agentic flow,同时生成 prompt 和 response,只用原始数据源(文本文档、代码文件)作为种子;
- 规模数据:造出 25M 对数据,覆盖文本编辑、创意写作、工具使用、编程、阅读理解等不同技能,可用于任意基座的指令微调。
关键在于「agentic 流」替人完成了从原始素材到结构化指令数据的转化——种子是 raw 的,产物是 ready-to-train 的。
实验结果
- 用该数据后训练 Mistral-7b 得到 Orca-3,对比同基座的
Mistral-7b-Instruct:
- AGIEval +40%、MMLU +19%、GSM8K +54%、BBH +38%、AlpacaEval +45%;
- 一致性地超过 Llama-8B-instruct 和 GPT-3.5-turbo。
定位与启示
AgentInstruct 是「数据合成」的早期标杆:它证明 agentic 流可以把「人工策展合成数据」自动化,并用 25M 对数据 + 全面的 benchmark 提升把结论钉死。它的种子驱动(raw text/code → prompt+response)启发了后来一批工作——ToolACE 的形式化思考、Environment-free 的 task→trajectory 管线都能看到「agentic 流替代人工策展」的同源思想。对今天做合成数据的人,它仍是「先把数据多样性做起来、再谈质量」的基线参照。
AgentInstruct (Orca-3):用 agentic 流做生成式教学,25M 对合成数据
https://kissshhot.github.io/2026/08/21/agentinstruct-generative-teaching/
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。