DelTA:从隐式判别器到 token 级信用分配——方法、公式与完整数值推演

一句话结论:DelTA 不额外训练过程奖励模型,而是把 RLVR 的策略梯度更新看成 token-gradient 空间中的隐式线性判别器,再放大“更像正确侧、而不像错误侧”的 token 方向。它真正改变的不是奖励本身,而是序列奖励进入策略梯度时,各 token 梯度所占的份量。

论文信息

  • 标题:DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
  • 作者:Kaiyi Zhang、Wei Wu、Yankai Lin
  • arXiv2605.21467
  • PDF论文全文
  • 代码github.com/RUCBM/DelTA
  • 版本:arXiv v1,2026-05-20
  • 关键词:token-level credit、discriminator view、RLVR、DAPO

下文的公式编号与论文一致;实验数值来自论文表格。数值推演部分是我构造的教学用二维简化示例,用于跑通算法,不是论文报告的训练样本。

1. 论文全景

RLVR(Reinforcement Learning from Verifiable Rewards,可验证奖励强化学习)常常只有一个 response-level 奖励:答案对得 1 分,错得 0 分。但优化时真正被改变的是每个位置的 token 概率。于是核心问题是:

同一条回复里的 token 共用一个优势值,为什么训练后有些 token 概率明显上升,有些几乎不动,甚至下降?

论文的回答分两层:

  1. 解释层:局部策略梯度更新方向会对 token-gradient 向量打分,因此它等价于一个隐式线性判别器。
  2. 方法层:标准序列级 RLVR 用正、负优势 token-gradient 的均值构造判别方向,容易被两侧都频繁出现的格式或背景模式拖偏。DelTA 根据“离本侧质心更近、离对侧质心更远”的程度给 token 重新加权,再用加权后的质心更新策略。

它不是显式判断某个字符串是否重要,也不是给 token 生成语义标签;信用取决于该 token 在特定上下文下的梯度方向

2. Motivation:序列奖励为什么会产生错误的 token 信用

对同一 prompt (q),从旧策略采样 (G) 条回复 (o_i),每条回复得到序列奖励 (R_i)。组内标准化优势为

\[ \hat A_i = \frac{R_i-\mu_R}{\sigma_R+\epsilon_A}. \]

同一回复的所有 token 共享 (A_i)。记第 (t) 个已采样 token 的梯度为

\[ v_{i,t}=\left.\nabla_\theta \log \pi_\theta(o_{i,t}\mid q,o_{i,<t})\right|_{\theta=\theta_{\mathrm{old}}}. \]

在旧策略附近、裁剪尚未激活时,DAPO 一类序列级 RLVR 的局部更新可写成(论文式 2):

\[ \Delta\theta_{\mathrm{RLVR}} \propto \sum_{i:\hat A_i>0}\sum_t \hat A_i v_{i,t} - \sum_{i:\hat A_i<0}\sum_t |\hat A_i|v_{i,t}. \]

问题不在于“每个 token 的优势值相同”这一点本身,而在于这些 token-gradient 最后如何聚合成更新方向。若正负回复都反复出现同一种格式、实体或背景 token,它们对应的高频梯度会大量进入两侧均值;真正稀疏但能区分正确与错误推理的方向反而会被稀释。

这揭示了一个目标错位:

  • 普通质心擅长做 within-side summarization:分别概括正侧和负侧;
  • RLVR 真正需要的是 between-side discrimination:找出能区分正负两侧的方向。

“最能代表本侧”的 token 不一定“最能区分两侧”。论文表 2 也验证了这一点:只看本侧距离的变体平均分为 17.94,不仅低于完整 DelTA 的 23.27,也低于 DAPO 的 19.05。

3. Method:DelTA 如何工作

3.1 策略更新就是一个局部线性判别器

给定任意上下文 (c) 和候选 token (x),一阶 Taylor 展开给出(论文式 1):

\[ \Delta \log \pi(x\mid c) \approx \nabla_\theta \log \pi_\theta(x\mid c)^\top \Delta\theta. \]

因此,一个候选 token 的 log-probability 是上升还是下降,取决于它的梯度向量与更新方向的内积。

把正负优势侧的总质量和质心定义为

\[ M_+=\sum_{i:\hat A_i>0}\sum_t \hat A_i, \qquad M_-=\sum_{i:\hat A_i<0}\sum_t |\hat A_i|, \]

\[ \bar\mu_+ = \frac{\sum_{i:\hat A_i>0}\sum_t \hat A_i v_{i,t}}{M_+}, \qquad \bar\mu_- = \frac{\sum_{i:\hat A_i<0}\sum_t |\hat A_i|v_{i,t}}{M_-}, \]

则更新方向为(论文式 3):

\[ \Delta\theta_{\mathrm{RLVR}}\propto M_+\bar\mu_+-M_-\bar\mu_-. \]

这就是判别器视角:(+) 和 (-) 是两侧参考方向,候选 token-gradient 与它们的相对对齐程度决定概率变化。这个判别器没有单独的参数和损失,它就是策略梯度更新本身。

3.2 可扩展的 token-gradient 代理

为每个 rollout token 显式保存全参数梯度在 LLM 规模下不可行。论文在实际计算系数时使用 LM head 的层受限代理。若

\[ z_t=Wh_t,\qquad p_t=\operatorname{softmax}(z_t), \]

则已生成 token (y_t) 对对应输出行的梯度为

\[ \tilde v_{i,t}=(1-p_t(y_t))h_t. \]

这个代理只用于计算 stop-gradient 权重;最终加权的 RLVR 损失仍更新模型的全部参数。论文附录 F 明确把它称为可扩展近似,而不是完整梯度的精确重建。

3.3 初始化正负侧质心

DelTA 先用原始优势加权均值初始化:

\[ \mu_+^{(0)}=\bar\mu_+,\qquad \mu_-^{(0)}=\bar\mu_-. \]

3.4 用两侧距离差计算软信用

对正优势 token,定义距离 margin:

\[ \Delta_{i,t}^{+,(k)} = \|v_{i,t}-\mu_-^{(k)}\|_2^2 - \|v_{i,t}-\mu_+^{(k)}\|_2^2. \]

它越大,说明该 token-gradient 更靠近正侧而远离负侧。负优势 token 对称地定义

\[ \Delta_{i,t}^{-,(k)} = \|v_{i,t}-\mu_+^{(k)}\|_2^2 - \|v_{i,t}-\mu_-^{(k)}\|_2^2. \]

DelTA 解一个带二元熵正则的软分配问题,闭式解是 Sigmoid(论文式 5–6):

\[ \alpha_{i,t}^{(k)} = \begin{cases} \sigma\!\left(\Delta_{i,t}^{+,(k)}/\gamma_+^{(k)}\right), & \hat A_i>0,\\ \sigma\!\left(\Delta_{i,t}^{-,(k)}/\gamma_-^{(k)}\right), & \hat A_i<0. \end{cases} \]

(+) 和 (-) 是两侧自适应温度,由该侧距离 margin 的经验标准差得到。温度小,分配更接近硬选择;温度大,权重更平滑。

这里必须比较两侧。只靠“离本侧质心近”会把两侧共有的高频模式也当成重要 token,而距离差要求 token 同时满足“像本侧、且不像对侧”。

3.5 交替更新质心

固定 () 后,用它重新计算加权质心(论文式 7):

\[ \mu_+^{(k+1)} = \frac{\sum_{\hat A_i>0}\sum_t \hat A_i\alpha_{i,t}^{(k)}v_{i,t}} {\sum_{\hat A_i>0}\sum_t \hat A_i\alpha_{i,t}^{(k)}}, \]

\[ \mu_-^{(k+1)} = \frac{\sum_{\hat A_i<0}\sum_t |\hat A_i|\alpha_{i,t}^{(k)}v_{i,t}} {\sum_{\hat A_i<0}\sum_t |\hat A_i|\alpha_{i,t}^{(k)}}. \]

论文主实验只做一次 refinement,即 (K=1)。附录表 11 显示增加到 (K=2) 或 (K=3) 反而降低平均分,作者推测过度 refinement 可能过拟合当前 batch 的 token-gradient 几何。

3.6 映射成有界权重并进入 DAPO

最终分数映射到有界区间:

\[ \lambda_{i,t} = \lambda_{\min} +(\lambda_{\max}-\lambda_{\min})\alpha_{i,t}^{\star}. \]

主实验取 ([{},{}]=[0.8,1.2])。令总 token 数 (N=i|o_i|),权重和 (Z={i,t}_{i,t}),实现中使用

\[ \bar\lambda_{i,t}=\lambda_{i,t}\frac{N}{Z}, \qquad \frac{1}{N}\sum_{i,t}\bar\lambda_{i,t}=1. \]

若 (_{i,t}()) 是原 DAPO 的 clipped token surrogate,则

\[ J_{\mathrm{DelTA}}(\theta) = \mathbb E\left[ \frac{1}{N}\sum_{i,t}\bar\lambda_{i,t}\ell_{i,t}(\theta) \right] = \mathbb E\left[ \frac{1}{Z}\sum_{i,t}\lambda_{i,t}\ell_{i,t}(\theta) \right]. \]

自归一化保持整批 loss 的平均尺度基本稳定,使改动集中在 token 之间的相对信用,而不是粗暴放大整个梯度。系数每个 rollout batch 计算一次,在该 batch 的多轮优化中固定,采样新轨迹后再更新。

4. 具体数值例子:从奖励到 token 权重完整推演

下面用一个二维、四 token 的教学示例跑完 DelTA。真实模型的 (v_{i,t}) 是高维 LM-head 梯度代理,计算过程相同。

第 1 步:构造正负回复

同一问题采样两条回复:

  • 正确回复:奖励 (R_+=1),优势 (A_+=+1);
  • 错误回复:奖励 (R_-=0),优势 (A_-=-1)。

每条回复只保留两个代表性 token-gradient:

侧别 token 角色 梯度向量
正侧 关键正确推理 (v_{+,1}=(2,0))
正侧 共享格式 (v_{+,2}=(0,3))
负侧 关键错误推理 (v_{-,1}=(-2,0))
负侧 共享格式 (v_{-,2}=(0,3))

这里“共享格式”在两侧完全相同,目的是模拟高频但没有判别力的模式。

第 2 步:初始化质心

因为每侧优势绝对值都是 1:

\[ \mu_+^{(0)} = \frac{(2,0)+(0,3)}{2} =(1,1.5), \]

\[ \mu_-^{(0)} = \frac{(-2,0)+(0,3)}{2} =(-1,1.5). \]

可以看到,两个质心都被共享格式方向的 (y=3) 拉高。

第 3 步:计算距离 margin 与第一次软分配

对正侧关键 token (v_{+,1}=(2,0)):

\[ \|v_{+,1}-\mu_-^{(0)}\|^2 =3^2+(-1.5)^2 =11.25, \]

\[ \|v_{+,1}-\mu_+^{(0)}\|^2 =1^2+(-1.5)^2 =3.25. \]

所以 margin 为 (11.25-3.25=8)。负侧关键 token 对称地也得到 8。

对共享格式 token (v=(0,3)),它到两个质心的距离都为

\[ 1^2+1.5^2=3.25, \]

因此 margin 为 0。

为便于手算,取自适应温度 (+=-=4),它正好是本例每侧两个 margin ([8,0]) 的总体标准差。于是:

\[ \alpha_{\mathrm{key}}^{(0)} =\sigma(8/4) =\sigma(2) \approx0.8808, \]

\[ \alpha_{\mathrm{shared}}^{(0)} =\sigma(0) =0.5. \]

关键推理方向获得更高软信用;两侧共有的格式方向只得到中性分数。

第 4 步:refinement 更新质心

正侧新质心为

\[ \mu_+^{(1)} = \frac{0.8808(2,0)+0.5(0,3)}{0.8808+0.5} \approx(1.2758,1.0863). \]

负侧对称地得到

\[ \mu_-^{(1)}\approx(-1.2758,1.0863). \]

更新后,两个质心在真正区分正负的 (x) 方向上更分离,同时共享格式造成的 (y) 分量从 1.5 降到约 1.0863。

第 5 步:计算最终分数和有界权重

用 refinement 后的质心重新计算,关键 token 的最终 margin 约为 10.2062,共享格式仍为 0:

\[ \alpha_{\mathrm{key}}^\star =\sigma(10.2062/4) \approx0.9277, \qquad \alpha_{\mathrm{shared}}^\star=0.5. \]

映射到论文使用的 ([0.8,1.2]):

\[ \lambda_{\mathrm{key}} =0.8+0.4\times0.9277 \approx1.1711, \]

\[ \lambda_{\mathrm{shared}} =0.8+0.4\times0.5 =1.0. \]

四个 token 的权重和

\[ Z=2\times1.1711+2\times1.0=4.3422, \qquad N=4. \]

自归一化后:

\[ \bar\lambda_{\mathrm{key}} =1.1711\times\frac{4}{4.3422} \approx1.0788, \]

\[ \bar\lambda_{\mathrm{shared}} =1.0\times\frac{4}{4.3422} \approx0.9212. \]

最终效果是:关键推理 token 相对放大约 7.9%,共享格式 token 相对压低约 7.9%,但整批平均权重仍为 1。

本例左右完全对称,所以更新方向不会旋转:标准更新为 ((4,0)),DelTA 自归一化后约为 ((4.3152,0))。真实 batch 中两侧的共享模式、频次和方向并不完全对称,重加权会同时改变更新方向与各 token 的局部概率变化。这个对称例子刻意牺牲了“方向旋转”,换取每一步都能手算和核查。

5. Results:实验到底证明了什么

5.1 主实验

训练设置来自论文第 4.1 节和附录 I:

  • 数据:DeepMath-103K,二元可验证奖励;
  • backbone:Qwen3-8B-Base、Qwen3-14B-Base;
  • rollout 数:16,训练 batch size:128;
  • 最大训练回复长度:20,480,评测最大生成长度:30,000;
  • DelTA:(K=1),权重范围 ([0.8,1.2]);
  • 所有方法关闭 dynamic sampling,以隔离目标函数差异;
  • 主要训练运行在 8 张 NVIDIA B200 上。

论文表 1 的七个数学 benchmark 加权平均结果为:

Backbone 最强同规模 baseline Baseline Avg. DelTA Avg. 绝对提升 相对提升
Qwen3-8B-Base SAPO 25.14 28.40 +3.26 约 +13.0%
Qwen3-14B-Base FIPO 37.29 39.91 +2.62 约 +7.0%

DelTA 在表 1 的每个单项 benchmark 上也都是同规模最优。作者用 16 次独立生成评测做单侧 Mann–Whitney U 检验,报告两种规模上相对最强 baseline 均达到 (p<0.05)。

需要准确理解这个显著性结论:论文重复的是评测生成,不是多随机种子的完整训练。

5.2 泛化结果

场景 Baseline DelTA 绝对提升
Olmo3-7B,七个数学 benchmark Avg. 19.01 22.80 +3.79
代码生成加权 Avg. 47.7 49.5 +1.8
Qwen3-8B,GPQA-D + MMLU-Pro OOD Avg. 58.87 62.38 +3.51
Qwen3-14B,GPQA-D + MMLU-Pro OOD Avg. 66.77 68.40 +1.63

这些结果支持“方法不只适用于某个 Qwen3 数学 benchmark”的主张,但还不能直接推出它对多轮工具 Agent 或不可验证开放任务同样有效。

5.3 消融与诊断

最有说服力的证据不是主表,而是几组机制实验:

  1. 必须比较对侧:within-side-only 平均分 17.94,完整 DelTA 为 23.27。
  2. 权重排序有信息量:只训练 top-50% () token 仍优于全 token DAPO;bottom-50% 很快崩溃;随机 50% 没有同样收益。
  3. refinement 很关键:去掉 refinement 后平均分从 23.27 降到 19.97,是表 3 最大降幅。
  4. 不是随机扰动带来的收益:默认代理为 23.27,随机 () 只有 18.34。
  5. 代理仍有改进空间:更丰富的 top-K hidden-gradient proxy 达到 24.29,高于默认代理的 23.27。

5.4 计算代价

DelTA 在 (K) 次 refinement 下需要 (K+2) 次额外 actor forward pass 来估计系数。主设置 (K=1),即 3 次额外 pass。论文在 8 张 B200 上测得首个训练 step 比 DAPO 多 37 秒,约占 DelTA 首 step 总时间的 10.2%。这是“相对温和的额外开销”,不是零成本。

6. 最具创新性的点

最核心的创新不是“又提出一种 token 权重”,而是建立了一条可反向设计的因果链:

策略梯度更新方向

→ token-gradient 空间中的隐式判别器

→ 正负侧质心决定判别边界

→ token 权重可以重塑质心

→ 重塑质心就能改变哪些 token 概率被提升或抑制。

过去很多 token 信用方法从熵、过程奖励或未来影响等外部启发式出发;DelTA 的权重直接来自 RLVR 更新自身的正负对比几何。论文表 2、top/bottom token 选择实验和随机权重消融共同支撑了这一点。

7. 不足与可能的改进

7.1 作者明确承认的局限

局限 1:使用层受限梯度代理。

默认代理只利用最终 hidden state、真实 token 概率和 LM-head 对应行,不能重建完整参数梯度。

  • 改进:研究低秩、分层或 top-K 竞争感知的梯度 sketch。
  • 代价:更高显存和计算量。
  • 验证:同时报告代理与抽样 full-gradient 的方向相似度、最终准确率和额外耗时。论文 top-K proxy 的 24.29 已说明更丰富代理值得继续研究。

局限 2:评测仍以数学为主。

代码、Olmo3 和 OOD 结果扩展了覆盖面,但没有验证多轮交互、工具调用和更复杂的可验证信号。

  • 改进:在 WebShop、ALFWorld、浏览器或代码 Agent 的 action token 上测试。
  • 风险:长轨迹会显著放大 hidden-state 缓存和额外 forward pass 成本。
  • 验证:除最终成功率外,测量无效动作率、轨迹长度和关键动作的权重排序质量。

局限 3:存在额外计算。

主设置需要 3 次额外 actor pass。

  • 改进:分块缓存 hidden state、低精度代理、只对候选 token 计算系数,或降低系数刷新频率。
  • 验证:报告端到端吞吐、峰值显存和相同 GPU-hour 下的最终效果,而不只比较单 step 时间。

7.2 我的分析

局限 4:理论解释是局部一阶的。

判别器视角在 (_{}) 附近、clipping 局部未激活时成立;它不是完整多 epoch、非线性训练轨迹的全局收敛理论。

  • 改进:跟踪训练中真实 log-probability 变化与一阶判别分数的一致率,并分析 clipping 激活后的偏差。
  • 验证:按训练阶段、token 类型和 advantage 侧别报告预测符号准确率。

局限 5:显著性没有覆盖训练随机性。

16 次评测重复只能衡量生成采样方差,不能衡量不同 seed、rollout 轨迹和 checkpoint 选择造成的训练方差。

  • 改进:至少在较小 backbone 上做多 seed 完整训练,并报告均值、标准差和置信区间。
  • 代价:RLVR 训练成本高,但这是判断 +3.26 / +2.62 是否稳定的关键证据。

局限 6:DelTA 不等于语义或因果上的“关键 token”。

(_{i,t}) 衡量的是当前 batch 中梯度方向的正负可分性。某个 token 字符串在不同上下文可能得到完全不同权重;论文的词云也只是 context-agnostic 定性图。

  • 改进:结合上下文级 counterfactual,例如屏蔽高权重 token、替换推理步骤或做梯度干预。
  • 验证:检查高权重 token 的干预是否比同频率随机 token 更显著地改变奖励和后续轨迹。

局限 7:没有正负对比时,方法本身也没有信用来源。

如果一个 rollout group 全对或全错,组内奖励方差接近零,优势和正负侧结构都会退化。DelTA 改善的是已有对比信号如何分给 token,并不创造新的监督。

  • 改进:结合难度自适应采样、跨 batch 质心记忆或课程学习,保证每组有足够的正负对比。
  • 风险:跨 batch 记忆会引入陈旧策略分布和额外偏差。
  • 验证:按组内奖励方差分桶,比较有效 batch 比例、梯度稳定性和样本效率。

8. 读者应记住的要点

  • DelTA 的切入点是更新方向,不是额外奖励模型。
  • token 信用来自“更像本侧、且不像对侧”的梯度方向,而不是 token 字符串本身。
  • 距离差、软分配、一次质心 refinement、有界映射和自归一化缺一不可;消融实验支持这条设计链。
  • 主实验提升明确,跨 backbone、代码和 OOD 也有正向证据。
  • 最大风险是层受限代理、额外 forward pass、局部一阶解释和缺少多 seed 训练验证。

我的判断是:DelTA 最有价值的地方,是把一个模糊的“哪些 token 应该拿信用”问题,改写成了一个可计算、可消融、也可继续改进的判别几何问题。它没有彻底解决信用分配,但给出了目前相当干净的一条工程与分析路径。

在标准 sequence-level RLVR 下,这个隐式判别器是这样构造的:

  • 用 advantage 加权平均 token-gradient 向量,分别形成正样本侧质心负样本侧质心
  • 更新方向 = 围绕这两个质心做线性判别。

问题在于:这种质心构造会被共享高频模式(比如格式 token)主导,把那些稀疏但真正有判别力的方向稀释掉。结果是”格式 token 拿走信用,关键推理 token 被淹没”。

核心方法

DelTA(Discriminative Token Credit Assignment)估一组 token 系数

  • 放大”侧特异(side-specific)“的 token-gradient 方向——这些方向只在正或负侧出现,真正区分高低奖励响应;
  • 压低共享或弱判别的方向(格式、填充 token)。

这些系数去 reweight 一个 self-normalized RLVR surrogate,让有效的侧向质心更具对比性,从而重塑 RLVR 的更新方向。本质上是对”隐式判别器”做去噪与锐化。

实验结果

  • 7 个数学推理 benchmark 上,相对同规模最强 baseline:Qwen3-8B-Base +3.26 平均分,Qwen3-14B-Base +2.62 平均分
  • 代码生成、不同 backbone、域外评测上均保持增益,泛化性扎实

定位与启示

DelTA 的贡献不在”又加一个 process reward”,而在给了 RLVR 一个可解释的几何视角——信用分配就是判别方向的选择。顺着这个视角,“哪些 token 该被奖励”不再是个启发式问题,而是”哪个方向判别力强”的量化问题。

对实践者:当你发现训练在奖励格式 token 时,DelTA 的诊断(质心被高频模式主导)和修法(侧特异系数 reweight)可以直接用上。


DelTA:从隐式判别器到 token 级信用分配——方法、公式与完整数值推演
https://kissshhot.github.io/2026/08/20/delta-discriminative-token-credit/
作者
丁一帆
发布于
2026年8月20日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。