共计 27 篇文章
2026
VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配
Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token
SCRL:从推理链生成可验证子问题——让失败 rollout 也产生细粒度信用
DelTA:从隐式判别器到 token 级信用分配——方法、公式与完整数值推演
综述|From Reasoning to Agentic:LLM 强化学习信用分配的统一地图与识别边界
Open-MOPD:诊断并修复多教师 On-Policy 蒸馏中的能力失衡
SAO: 面向智能体强化学习的单轨迹异步优化
论文精读|GLM-5.3:纯后训练 scaling 带来的涌现网络安全能力
PowerOPD:用有界幂变换稳定 On-Policy Distillation
论文精读|GLM-4.5 后训练阶段详解:专家模型迭代与混合推理