共计 39 篇文章
2026
G2PO:把多条 Agent 轨迹合成状态图——用全局边增益分配长程信用
VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配
FlowTracer:把注意力变成守恒信息流——定位通向答案的 token 推理骨干
Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token
SCRL:从推理链生成可验证子问题——让失败 rollout 也产生细粒度信用
DelTA:从隐式判别器到 token 级信用分配——方法、公式与完整数值推演
综述|From Reasoning to Agentic:LLM 强化学习信用分配的统一地图与识别边界
HCAPO:用结局反看关键动作——长程 LLM Agent 的事后信用分配
Open-MOPD:诊断并修复多教师 On-Policy 蒸馏中的能力失衡
SAO: 面向智能体强化学习的单轨迹异步优化