VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配
一句话结论:VIMPO 从 KL 正则 RL 的最优性条件推出:策略相对 reference 的逐 token log-ratio,等于 Bellman residual 加 KL 校正。它用终态价值为零训练“策略隐含价值”,再从同一恒等式构造 PPO actor advantage,不需要独立 critic。
论文信息
- 标题:VIMPO: Value-Implicit Policy Optimization for LLMs
- 作者:Kang et al.
- 版本:arXiv:2606.20008,2026
- 论文:arXiv:2606.20008
- 代码:github.com/backprop07/VIMPO
1. Motivation:critic-free 为什么通常等于粗信用
actor-critic 可以用 (V(s_t)) 给每个 token 构造不同 advantage,但 critic 与快速变化的语言策略共同训练时容易失配,还增加显存。GRPO 删除 critic,代价是把一个 trajectory advantage 广播给全部 token。
VIMPO 试图同时保留两边的优点:不训练价值网络,却从策略/reference 的概率几何中恢复逐 token 的 value recurrence 与 TD advantage。
2. 从 KL 最优策略到价值递推
把自回归生成视为确定性转移 MDP:状态 (s_t=(x,a_0,,a_{t-1})),动作是下一个 token (a_t)。
KL 正则局部最优条件为
\[ \pi^*(\cdot\mid s_t) =\arg\max_\pi \mathbb E_{a\sim\pi}[Q^*(s_t,a)] -\beta\operatorname{KL}(\pi\|\pi_{\mathrm{ref}}). \]
与确定性 Bellman 方程
\[ Q^*(s_t,a_t)=r(s_t,a_t)+\gamma V^*(s_{t+1}) \]
结合后,得到论文核心恒等式:
\[ \beta\log\frac{\pi^*(a_t\mid s_t)} {\pi_{\mathrm{ref}}(a_t\mid s_t)} =r_t+\gamma V^*(s_{t+1})-V^*(s_t) +\beta\operatorname{KL}^*(s_t). \]
所以逐 token 的 TD advantage 可以写成
\[ \widehat A_t^{\mathrm{TD}} =\beta\log\frac{\pi_\theta(a_t\mid s_t)} {\pi_{\mathrm{ref}}(a_t\mid s_t)} -\beta\operatorname{KL}_{\pi_\theta}(s_t). \]
3. 终端锚点如何把 outcome reward 写进策略
用可训练策略 () 替代 (^*),递推得到 policy-implied value。终态没有未来奖励,因此
\[ V_\pi(s_T)=0. \]
在 outcome-only、() 的 RLVR 中,令 group 平均奖励为 (R),value loss 展开为
\[ L_V(\pi)=\frac12\left[ \sum_{k=0}^{T-1} \left( \beta\log\frac{\pi(a_k\mid s_k)} {\pi_{\mathrm{ref}}(a_k\mid s_k)} -\beta\operatorname{sg}[\operatorname{KL}_\pi(s_k)] \right) -(R_{\mathrm{final}}-\bar R) \right]^2. \]
KL 项 stop-gradient,只作中心化基线,防止模型通过操纵整分布 KL 来投机降低 loss。外部 verifier reward 只进入这个 value target。
单步 advantage 还可像 GAE 一样累积:
\[ \widehat A_t^\lambda =\sum_{\ell=0}^{T-t-1}(\gamma\lambda)^\ell \widehat A_{t+\ell}^{\mathrm{TD}}. \]
归一化、detach 后进入 PPO clipped actor loss (L_A),总目标:
\[ L_{\mathrm{VIMPO}}=L_V+c_A L_A. \]
4. 具体数值推演
考虑两条三 token rollout,奖励 ([1,0]),所以 (R=0.5)。为便于手算,取 (,,)。
4.1 成功 rollout 的 value loss
假设三个 token 的 (/_{}) 比值为 ([1.5,1.2,1.1]),逐状态 KL 为 ([0.05,0.03,0.02])。
log-ratio 乘 ():
\[ 0.1[\log1.5,\log1.2,\log1.1] \approx[0.04055,0.01823,0.00953]. \]
KL 校正为
\[ 0.1[0.05,0.03,0.02]=[0.005,0.003,0.002]. \]
三步 policy-implied TD advantage:
\[ \widehat A^{\mathrm{TD}} \approx[0.03555,0.01523,0.00753]. \]
累计校正 log-ratio 为
\[ 0.03555+0.01523+0.00753=0.05831. \]
成功轨迹的中心化 reward target 是 (1-0.5=0.5),所以
\[ L_V^{\mathrm{succ}} =\frac12(0.05831-0.5)^2 \approx0.0975. \]
梯度会推动累计策略/reference log-ratio 更接近正的 0.5。
4.2 第一 token 的 GAE 型 advantage
\[ \widehat A_0^\lambda =0.03555+0.9(0.01523)+0.9^2(0.00753) \approx0.05535. \]
这已经是 state-dependent 的逐 token 信号,而不是把成功 rollout 的统一 (+1) 广播给三步。实际训练还会在有效 response token 上归一化,并 detach 后交给 PPO。
5. 实验结果
论文在 Guru 数学子集上训练 Qwen3-4B-Base,评测 MATH-500、AIME 2024/2025、OlympiadBench。
- Base 四项平均 21.1,naive GRPO 36.6,较强 token-level GRPO 37.4,VIMPO 39.5。
- MATH-500:GRPO 79.6,VIMPO 81.6。
- AIME 2024 avg@32:19.3 → 21.7。
- AIME 2025 avg@32:17.6 → 20.8。
- OlympiadBench:33.2 → 34.0。
- 将 25% 二值训练奖励随机翻转后,GRPO 平均 32.2,VIMPO 35.9。
- value-only((c_A=0))也能学习,但更慢;加入 actor update 后训练准确率更高,同时 policy shift 也更大。
主实验使用 ({-4})、(c_A=5{-3})。论文明确说明是 4B 数学域、单 seed 实验,不能据此断言大模型或其他任务也有同样收益。
6. 最具创新的点
VIMPO 最创新的是让价值信息成为策略概率比的代数属性,而非另一个神经网络的预测。终态边界把序列累计 log-ratio 与中心化 outcome reward 对齐;同一推导又给出 actor advantage,实现“reward incorporation”和“policy improvement”解耦。
7. 不足与可能改进
7.1 最优性恒等式被用于非最优训练中策略
式子在 (^*) 下严格成立,训练时直接代入 (_) 是建模假设。离 reference 很远时,policy-implied value 未必校准。可监控 Bellman residual,并周期性更新 reference。
7.2 exact KL 成本高
每个 token 都需要 policy 与 reference 的完整词表分布。长序列和大模型上开销不小。可研究候选集 KL、采样估计或缓存 reference logits,但必须验证零均值中心化性质是否保留。
7.3 系数敏感且固定
() 和 (c_A) 同时控制参考几何、学习速度和 response length。论文消融显示过强设置会早早平台。可采用 early strong / late weak 的自适应 schedule。
7.4 reward 并未直接进入 actor advantage
这可能带来抗 reward noise 的好处,也可能在复杂环境中使 actor 与真实局部回报脱节。可比较混合 outcome advantage 与 policy-implied advantage 的版本。
7.5 证据范围窄
只有 Qwen3-4B 数学、单 seed,也没有与精调 PPO/VAPO critic 做同预算比较。代码、tool use、Agent POMDP 和多 seed 是必要后续验证。
8. 阅读结论
VIMPO 是一条很有理论味道的中间路线:既不接受 GRPO 的统一信用,也不承担独立 critic。它目前更像一个有前景的 proof-of-concept;其价值取决于 policy/reference log-ratio 在更大规模、更长 horizon 上能否持续充当稳定的隐式价值坐标。
参考入口
- 核心推导:第 3.1–3.2 节,式 (1)–(5)
- value loss 与 actor:第 3.3–3.4 节,式 (6)–(12)
- 实验与局限:第 4–5 节,表 1、图 3–5
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。