Agentic-R:为 agentic search 训练检索器,用全局答案正确性反传

Agentic search 是个新范式:agent 把多步推理和按需检索交错起来解复杂问题。但它有个被忽视的短板——检索器。现有 search agent 几乎都用基于相似度的检索器,而「相似的段落」不等于「对最终答案有用的段落」。Agentic-R 专门为 agentic search 训练检索器,把「全局答案正确性」纳入检索器的训练信号。

论文信息

  • 标题:Agentic-R: Learning to Retrieve for Agentic Search
  • 作者:Liu Wenhan, Ma Xinyu, Zhu Yutao et al., 2026
  • arXiv2601.11888
  • 关键词:agentic search、retriever training、global answer correctness、bidirectional optimization

要解决的问题

单轮 RAG 的检索器只看局部——query 和 passage 是否相关。但 agentic search 是多轮的,一个 passage 好不好,最终要看它有没有帮到答案生成。相似度高的 passage 可能对答案无用,相似度低的反而关键。用单轮 RAG 检索器套到 agentic search 上,信号错位。

核心方法

  1. 双信号度量 passage 效用:不只看局部 query-passage 相关性,还引入全局答案正确性——一个 passage 的价值由它对最终答案的贡献来衡量;
  2. 迭代双向优化:search agent 和 retriever 双向、迭代地共同优化;
  3. 检索器持续进化:不同于 RAG 检索器「用固定问题训练一次」,Agentic-R 的检索器用 agent 不断演化、质量越来越高的 query 持续改进。

核心思想:检索器和 agent 是耦合的,agent 越强→产生的 query 越好→检索器越准→agent 又更强,形成正向循环。

实验结果

  • 在 7 个单跳和多跳 QA 基准上,Agentic-R 检索器在不同 search agent 下一致超越强基线
  • 代码已开源。

定位与启示

Agentic-R 把「数据/能力合成」的视角延伸到了检索这一环:它不是造数据集,而是训练一个为 agentic 场景量身定制的检索器。它的贡献是把检索器从「局部相似度」升级到「全局任务效用」,并用迭代双向优化让检索器和 agent 共演化。和这一批其它工作对照:ToolACE/AgentInstruct 造的是静态数据,Agentic-R 造的是一个会随 agent 进化的能力组件。对做 agentic search 的人,「相似 ≠ 有用」这个观察是出发点,而双向迭代优化是可直接落地的训练范式。


Agentic-R:为 agentic search 训练检索器,用全局答案正确性反传
https://kissshhot.github.io/2026/08/21/agentic-r-learning-to-retrieve/
作者
丁一帆
发布于
2026年8月21日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。