Agentic-R:为 agentic search 训练检索器,用全局答案正确性反传
Agentic search 是个新范式:agent 把多步推理和按需检索交错起来解复杂问题。但它有个被忽视的短板——检索器。现有 search agent 几乎都用基于相似度的检索器,而「相似的段落」不等于「对最终答案有用的段落」。Agentic-R 专门为 agentic search 训练检索器,把「全局答案正确性」纳入检索器的训练信号。
论文信息
- 标题:Agentic-R: Learning to Retrieve for Agentic Search
- 作者:Liu Wenhan, Ma Xinyu, Zhu Yutao et al., 2026
- arXiv:2601.11888
- 关键词:agentic search、retriever training、global answer correctness、bidirectional optimization
要解决的问题
单轮 RAG 的检索器只看局部——query 和 passage 是否相关。但 agentic search 是多轮的,一个 passage 好不好,最终要看它有没有帮到答案生成。相似度高的 passage 可能对答案无用,相似度低的反而关键。用单轮 RAG 检索器套到 agentic search 上,信号错位。
核心方法
- 双信号度量 passage 效用:不只看局部 query-passage 相关性,还引入全局答案正确性——一个 passage 的价值由它对最终答案的贡献来衡量;
- 迭代双向优化:search agent 和 retriever 双向、迭代地共同优化;
- 检索器持续进化:不同于 RAG 检索器「用固定问题训练一次」,Agentic-R 的检索器用 agent 不断演化、质量越来越高的 query 持续改进。
核心思想:检索器和 agent 是耦合的,agent 越强→产生的 query 越好→检索器越准→agent 又更强,形成正向循环。
实验结果
- 在 7 个单跳和多跳 QA 基准上,Agentic-R 检索器在不同 search agent 下一致超越强基线;
- 代码已开源。
定位与启示
Agentic-R 把「数据/能力合成」的视角延伸到了检索这一环:它不是造数据集,而是训练一个为 agentic 场景量身定制的检索器。它的贡献是把检索器从「局部相似度」升级到「全局任务效用」,并用迭代双向优化让检索器和 agent 共演化。和这一批其它工作对照:ToolACE/AgentInstruct 造的是静态数据,Agentic-R 造的是一个会随 agent 进化的能力组件。对做 agentic search 的人,「相似 ≠ 有用」这个观察是出发点,而双向迭代优化是可直接落地的训练范式。
Agentic-R:为 agentic search 训练检索器,用全局答案正确性反传
https://kissshhot.github.io/2026/08/21/agentic-r-learning-to-retrieve/
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。