VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配

一句话结论:VIMPO 从 KL 正则 RL 的最优性条件推出:策略相对 reference 的逐 token log-ratio,等于 Bellman residual 加 KL 校正。它用终态价值为零训练“策略隐含价值”,再从同一恒等式构造 PPO actor advantage,不需要独立 critic。

论文信息

1. Motivation:critic-free 为什么通常等于粗信用

actor-critic 可以用 (V(s_t)) 给每个 token 构造不同 advantage,但 critic 与快速变化的语言策略共同训练时容易失配,还增加显存。GRPO 删除 critic,代价是把一个 trajectory advantage 广播给全部 token。

VIMPO 试图同时保留两边的优点:不训练价值网络,却从策略/reference 的概率几何中恢复逐 token 的 value recurrence 与 TD advantage。

2. 从 KL 最优策略到价值递推

把自回归生成视为确定性转移 MDP:状态 (s_t=(x,a_0,,a_{t-1})),动作是下一个 token (a_t)。

KL 正则局部最优条件为

\[ \pi^*(\cdot\mid s_t) =\arg\max_\pi \mathbb E_{a\sim\pi}[Q^*(s_t,a)] -\beta\operatorname{KL}(\pi\|\pi_{\mathrm{ref}}). \]

与确定性 Bellman 方程

\[ Q^*(s_t,a_t)=r(s_t,a_t)+\gamma V^*(s_{t+1}) \]

结合后,得到论文核心恒等式:

\[ \beta\log\frac{\pi^*(a_t\mid s_t)} {\pi_{\mathrm{ref}}(a_t\mid s_t)} =r_t+\gamma V^*(s_{t+1})-V^*(s_t) +\beta\operatorname{KL}^*(s_t). \]

所以逐 token 的 TD advantage 可以写成

\[ \widehat A_t^{\mathrm{TD}} =\beta\log\frac{\pi_\theta(a_t\mid s_t)} {\pi_{\mathrm{ref}}(a_t\mid s_t)} -\beta\operatorname{KL}_{\pi_\theta}(s_t). \]

3. 终端锚点如何把 outcome reward 写进策略

用可训练策略 () 替代 (^*),递推得到 policy-implied value。终态没有未来奖励,因此

\[ V_\pi(s_T)=0. \]

在 outcome-only、() 的 RLVR 中,令 group 平均奖励为 (R),value loss 展开为

\[ L_V(\pi)=\frac12\left[ \sum_{k=0}^{T-1} \left( \beta\log\frac{\pi(a_k\mid s_k)} {\pi_{\mathrm{ref}}(a_k\mid s_k)} -\beta\operatorname{sg}[\operatorname{KL}_\pi(s_k)] \right) -(R_{\mathrm{final}}-\bar R) \right]^2. \]

KL 项 stop-gradient,只作中心化基线,防止模型通过操纵整分布 KL 来投机降低 loss。外部 verifier reward 只进入这个 value target。

单步 advantage 还可像 GAE 一样累积:

\[ \widehat A_t^\lambda =\sum_{\ell=0}^{T-t-1}(\gamma\lambda)^\ell \widehat A_{t+\ell}^{\mathrm{TD}}. \]

归一化、detach 后进入 PPO clipped actor loss (L_A),总目标:

\[ L_{\mathrm{VIMPO}}=L_V+c_A L_A. \]

4. 具体数值推演

考虑两条三 token rollout,奖励 ([1,0]),所以 (R=0.5)。为便于手算,取 (,,)。

4.1 成功 rollout 的 value loss

假设三个 token 的 (/_{}) 比值为 ([1.5,1.2,1.1]),逐状态 KL 为 ([0.05,0.03,0.02])。

log-ratio 乘 ():

\[ 0.1[\log1.5,\log1.2,\log1.1] \approx[0.04055,0.01823,0.00953]. \]

KL 校正为

\[ 0.1[0.05,0.03,0.02]=[0.005,0.003,0.002]. \]

三步 policy-implied TD advantage:

\[ \widehat A^{\mathrm{TD}} \approx[0.03555,0.01523,0.00753]. \]

累计校正 log-ratio 为

\[ 0.03555+0.01523+0.00753=0.05831. \]

成功轨迹的中心化 reward target 是 (1-0.5=0.5),所以

\[ L_V^{\mathrm{succ}} =\frac12(0.05831-0.5)^2 \approx0.0975. \]

梯度会推动累计策略/reference log-ratio 更接近正的 0.5。

4.2 第一 token 的 GAE 型 advantage

\[ \widehat A_0^\lambda =0.03555+0.9(0.01523)+0.9^2(0.00753) \approx0.05535. \]

这已经是 state-dependent 的逐 token 信号,而不是把成功 rollout 的统一 (+1) 广播给三步。实际训练还会在有效 response token 上归一化,并 detach 后交给 PPO。

5. 实验结果

论文在 Guru 数学子集上训练 Qwen3-4B-Base,评测 MATH-500、AIME 2024/2025、OlympiadBench。

  • Base 四项平均 21.1,naive GRPO 36.6,较强 token-level GRPO 37.4,VIMPO 39.5
  • MATH-500:GRPO 79.6,VIMPO 81.6。
  • AIME 2024 avg@32:19.3 → 21.7。
  • AIME 2025 avg@32:17.6 → 20.8。
  • OlympiadBench:33.2 → 34.0。
  • 将 25% 二值训练奖励随机翻转后,GRPO 平均 32.2,VIMPO 35.9。
  • value-only((c_A=0))也能学习,但更慢;加入 actor update 后训练准确率更高,同时 policy shift 也更大。

主实验使用 ({-4})、(c_A=5{-3})。论文明确说明是 4B 数学域、单 seed 实验,不能据此断言大模型或其他任务也有同样收益。

6. 最具创新的点

VIMPO 最创新的是让价值信息成为策略概率比的代数属性,而非另一个神经网络的预测。终态边界把序列累计 log-ratio 与中心化 outcome reward 对齐;同一推导又给出 actor advantage,实现“reward incorporation”和“policy improvement”解耦。

7. 不足与可能改进

7.1 最优性恒等式被用于非最优训练中策略

式子在 (^*) 下严格成立,训练时直接代入 (_) 是建模假设。离 reference 很远时,policy-implied value 未必校准。可监控 Bellman residual,并周期性更新 reference。

7.2 exact KL 成本高

每个 token 都需要 policy 与 reference 的完整词表分布。长序列和大模型上开销不小。可研究候选集 KL、采样估计或缓存 reference logits,但必须验证零均值中心化性质是否保留。

7.3 系数敏感且固定

() 和 (c_A) 同时控制参考几何、学习速度和 response length。论文消融显示过强设置会早早平台。可采用 early strong / late weak 的自适应 schedule。

7.4 reward 并未直接进入 actor advantage

这可能带来抗 reward noise 的好处,也可能在复杂环境中使 actor 与真实局部回报脱节。可比较混合 outcome advantage 与 policy-implied advantage 的版本。

7.5 证据范围窄

只有 Qwen3-4B 数学、单 seed,也没有与精调 PPO/VAPO critic 做同预算比较。代码、tool use、Agent POMDP 和多 seed 是必要后续验证。

8. 阅读结论

VIMPO 是一条很有理论味道的中间路线:既不接受 GRPO 的统一信用,也不承担独立 critic。它目前更像一个有前景的 proof-of-concept;其价值取决于 policy/reference log-ratio 在更大规模、更长 horizon 上能否持续充当稳定的隐式价值坐标。

参考入口

  • 核心推导:第 3.1–3.2 节,式 (1)–(5)
  • value loss 与 actor:第 3.3–3.4 节,式 (6)–(12)
  • 实验与局限:第 4–5 节,表 1、图 3–5

VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配
https://kissshhot.github.io/2026/08/20/vimpo-value-implicit-policy/
作者
丁一帆
发布于
2026年8月20日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。