共计 9 篇文章
2026
OPDVR:用答案正确性过滤蒸馏信号,如何把 OPD 与可验证奖励结合?
2026 年大模型 PPO:前沿进展、主流范式与论文地图
SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO
VC-PPO 详解:PPO 在长 CoT 上为什么崩?价值优化才是命门
VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配
FlowTracer:把注意力变成守恒信息流——定位通向答案的 token 推理骨干
Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token
SCRL:从推理链生成可验证子问题——让失败 rollout 也产生细粒度信用
DelTA:从隐式判别器到 token 级信用分配——方法、公式与完整数值推演