ICSD:当"老师可信"不等于"听老师的话有用"——给 On-Policy Self-Distillation 装上影响力校准

你正开车去机场。导航员(老师)说:“前方路口左转有一家加油站。”——这句话本身可信,加油站确实在那儿。但你这趟的目的是赶飞机,不需要加油,而且左转会绕远。照做反而离目的地更远。

这就是论文《Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL》(arXiv:2608.14945)要解决的核心矛盾。作者把它命名为 trust-utility mismatch(信任-效用错配)信任回答”老师的修正靠不靠谱”,效用回答”朝它走是否服务于当前策略改进方向”——两者谁也回答不了谁,但现有方法一直把它们当成一回事。

本文用一个 ALFWorld 里的具体例子,一步步讲清楚问题来龙去脉,以及作者提出的 ICSD(Influence Calibration for Self-Distillation) 如何在几乎零开销下修好它。

一、把场景搭起来:什么是 OPSD

1.1 一个具体例子:在 ALFWorld 里把苹果放进冰箱

ALFWorld 是一个文本家居环境。假设当前任务是 “把一个洗干净的苹果放进冰箱”。智能体已完成:走到台面 → 拿起苹果 → 走到水池 → 用水洗干净苹果。现在它要决定下一步动作。

智能体(学生策略 \(\pi_\theta\))此刻采样出下一个动作的 token 序列,比如 "go to fridge 1"。同时有一个特权版本的自我 \(\pi_{\theta^+}(\cdot\mid x_t, z_t)\) 也在评估同一个 token——它和学生共享同一套 actor 参数,但多看了一眼额外上下文 \(z_t\)(例如从整条轨迹里抽出来的”目标终点是冰箱、冰箱在东边”这类线索)。

直觉上:特权自我因为信息更全,对”该走哪步”判断更准。OPSD(On-Policy Self-Distillation)就是让学生在自己生成的轨迹上、向这个更准的特权自我学,从而把稀疏的 RL 奖励(任务最后成功/失败才给一个信号)变成每个 token 上都有的密集监督。

1.2 两个关键量:教师-学生差距 \(\Delta_t\) 与信任权重 \(g_t\)

对某个 token \(a_t\)(比如 "fridge" 这个 token),定义教师-学生差距

\[\Delta_t = \mathrm{sg}\!\left[\log \pi_{\theta^+}(a_t\mid x_t, z_t) - \log \pi_\theta(a_t\mid x_t)\right]\]

其中 \(\mathrm{sg}\) 是 stop-gradient(这个差距只当”参考标尺”,不回传梯度)。

  • \(\Delta_t > 0\):特权自我比学生更看好这个 token(“教师支持”)。
  • \(\Delta_t < 0\):特权自我比学生更不看好(“教师反对”)。

现有方法(如 SDAR)直接拿 \(\Delta_t\) 套一个单调函数,得到 \([0,1]\)信任权重

\[g_t = G_{\mathrm{trust}}(\Delta_t)\]

论文实验里 \(G_{\mathrm{trust}}\) 取 split 参数 0.4 的非对称 Laplace CDF。\(g_t\) 越大,这个 token 上分到的蒸馏强度越大。

1.3 OPSD 的目标函数

\(\mathcal{B}\) 为一个 minibatch 里所有有效响应 token 的集合,每个 token 的辅助蒸馏损失为:

\[\hat{\ell}_t^{KD}(\theta) = \mathrm{sg}\!\left[\log \pi_{\theta^+}(a_t\mid x_t, z_t)\right] - \log \pi_\theta(a_t\mid x_t)\]

带 per-token 系数 \(c_t\) 的 OPSD 目标为:

\[\mathcal{L}(\theta) = \mathcal{L}_{RL}(\theta) + \frac{\lambda}{|\mathcal{B}|} \sum_{t\in\mathcal{B}} \mathrm{sg}(c_t)\, \hat{\ell}_t^{KD}(\theta)\]

既有方法里 \(c_t = g_t\)——蒸馏强度只看教师有多信。问题就出在这。

二、核心问题:信任不等于效用

2.1 两个 \(\Delta_t\) 相同的 token,命运却该不同

回到放苹果的例子。假设在两个不同时刻,学生都采样出某个 token,且特权自我都比学生更看好它(\(\Delta_t=+0.6\)):

时刻 token \(\Delta_t\) 优势 \(\hat{A}_t\) 含义
A fridge(走向冰箱) +0.6 +0.5 教师支持,且这一步整体被优势函数奖励(方向对)
B microwave(走向微波炉) +0.6 -0.3 教师也支持(微波炉也是常见家电,局部看合理),但这步整体被优势函数惩罚(绕远,离冰箱目标更远)

注意:两个 token 的 \(\Delta_t\) 完全相同,所以 SDAR 给它们相同的信任权重 \(g_t\),会同等强度地把学生推向教师。可对于”把苹果放进冰箱”这个目标,A 是该加强的好动作,B 是该削弱的坏动作——同等加强显然不对。

这就是 trust-utility mismatch:

信任问”这个修正可不可信”(\(\Delta_t\) 大不大);效用问”朝它走是否服务于当前策略改进方向”(\(\hat{A}_t\) 的符号与大小)。\(\Delta_t\) 完全回答不了 \(\hat{A}_t\) 的事。

2.2 这个问题有多严重

作者在冻结的 ALFWorld 训练批次上做了统计:仅靠信任分配,会把 60.1% 的教师支持质量压在与当前目标相反的 token 上。也就是说,教师信誓旦旦支持的 token 里,超过六成其实是在”拖后腿”。这不是个别 case,而是系统性的。

三、ICSD 的核心思路:在不增模型求值的前提下,给信任加一层”效用校验”

ICSD 不替换 \(g_t\),而是在它之上叠加一层教师指向的目标影响力 \(u_t\),再做保质量的批量归一化,最后和 \(g_t\) 复合。整个方法分四步,下面逐步讲。

3.1 第一步:用一次标量扰动,量出每个 token 对目标的边际推动

为什么不用经典影响函数?

经典影响函数走参数空间:\(-\nabla_\theta J^\top H^{-1}\nabla_\theta \ell_t\),需要对每个 token 算参数梯度、还要解逆曲率 \(H^{-1}\)。对十亿参数的 agentic 模型,这根本跑不动。

ICSD 的洞察:别动参数,直接扰动教师指定的那个标量输出坐标

扰动怎么构造

记策略比 \(\rho_t = \pi_\theta(a_t\mid x_t)/\pi_{\mathrm{old}}(a_t\mid x_t)\)\(\pi_{\mathrm{old}}\) 是固定的 rollout 策略)。ICSD 沿着教师-学生差距 \(\Delta_t\) 的方向,给 \(\log \rho_t\) 加一个微小扰动 \(\varepsilon\)

\[\log \rho_t(\varepsilon) = \log \rho_t + \varepsilon\, \Delta_t, \qquad \rho_t(\varepsilon) = \rho_t \exp(\varepsilon \Delta_t)\]

直观:\(\varepsilon>0\) 表示”朝教师方向轻轻推一下学生的输出概率”。

一阶响应:\(u_t\)

token 对未裁剪 surrogate 的贡献是 \(J_t = \hat{A}_t \rho_t\)教师指向的目标影响力就是它对 \(\varepsilon\) 的一阶导数(在 \(\varepsilon=0\) 处):

\[u_t := \left.\frac{d[\hat{A}_t \rho_t(\varepsilon)]}{d\varepsilon}\right|_{\varepsilon=0} = \hat{A}_t\, \rho_t\, \Delta_t\]

这个形式极简,但含义丰富:

  • 它把信任\(\Delta_t\))和效用\(\hat{A}_t\) 的符号)乘在了一起;
  • 对教师支持的 token(\(\Delta_t>0\)),\(u_t\)符号直接告诉你”提高这个 token 的概率,到底是抬高还是压低局部 surrogate 贡献”。

附录给出显式余项界,证明 \(u_t\)精确的一阶系数(一阶项本身不含近似):

\[\left|J(\varepsilon) - J(0) - \varepsilon u_t\right| \leq \frac{|\hat{A}|\rho\Delta^2}{2}\, \varepsilon^2 e^{|\varepsilon\Delta|}\]

用具体数字验证一下

拿 2.1 表里的时刻 A(fridge)举例:设 \(\rho_t=1.0\)\(\Delta_t=0.6\)\(\hat{A}_t=+0.5\)、扰动 \(\varepsilon=+0.1\)

  • \(u_t = \hat{A}_t \rho_t \Delta_t = 0.5 \times 1.0 \times 0.6 = 0.30\)
  • 精确变化:\(\rho_t(\varepsilon)=1.0\times\exp(0.1\times0.6)=\exp(0.06)\approx 1.0618\)\(J_t(\varepsilon)=0.5\times1.0618=0.5309\)\(J_t(0)=0.5\);精确增量 \(\approx 0.0309\)
  • 一阶预测:\(\varepsilon\, u_t = 0.1\times0.30 = 0.03\)

一阶预测 \(0.03\) 与精确增量 \(0.0309\) 几乎一致——这就是 \(u_t\) 作为”边际推动”的含义。\(u_t>0\) 说明朝教师推一下,目标在涨,该加强

再看时刻 B(microwave):\(\Delta_t=0.6\) 同样,但 \(\hat{A}_t=-0.3\)

  • \(u_t = -0.3 \times 1.0 \times 0.6 = -0.18 < 0\)

\(u_t<0\) 说明朝教师推一下,目标反而在降——尽管教师很信(\(\Delta_t\) 大),这一推是在帮倒忙。ICSD 就是靠这个符号把 B 识别出来、削弱的。

关键一句:算 \(u_t\) 用到的 \(\hat{A}_t\)\(\rho_t\)\(\Delta_t\) 本来就是 RL 更新里要算的量,无需任何额外的前向或反向传播。

3.2 第二步:批量自适应校准——把 \(u_t\) 变成 \([0,1]\) 的相对分数

为什么不能直接拿 \(u_t\) 当权重?

\(u_t\) 的绝对尺度跨 minibatch 漂得厉害——它继承了优势 \(\hat{A}_t\) 和策略比 \(\rho_t\) 的尺度,而这俩在不同 batch、不同训练阶段差异巨大。而且它是三个量的乘积,天然有重尾。直接当权重用,要么被离群点带飞,要么尺度忽大忽小。

怎么办:按 turn 分组 + 中位数 + 双侧分别归一

一个 action turn = 一条轨迹里发出一次 agent 动作的那一段 span。ICSD 把同一个 turn 索引、跨轨迹的 token 汇成一个校准组 \(\mathcal{G}\)(稀疏时退化为全 batch)。这样比的是”同类动作内部”的相对高低,更公平。

对每个 \(\mathcal{G}\)

  • 中位数 \(\hat{\mu}_\mathcal{G}\) 当中心(抗离群点);
  • 左右两侧分别算平均绝对偏差 \(\hat{b}^-_\mathcal{G}\)\(\hat{b}^+_\mathcal{G}\)(承认正负侧尺度可能不对称);

\[\hat{\mu}_\mathcal{G} = \mathrm{median}_{j\in\mathcal{G}}\, u_j, \quad \hat{b}^-_\mathcal{G} = \mathrm{mean}_{u_j<\hat{\mu}} |u_j-\hat{\mu}|, \quad \hat{b}^+_\mathcal{G} = \mathrm{mean}_{u_j\geq\hat{\mu}} |u_j-\hat{\mu}|\]

然后套一个 split 参数 \(\eta=0.5\) 的非对称 Laplace CDF,得到 \([0,1]\) 的相对分数 \(\tilde{m}_t\)

\[\Phi_\mathcal{G}(u) = \begin{cases} \eta\, \exp\!\left((u-\hat{\mu})/\hat{b}^-\right), & u < \hat{\mu} \\ 1 - (1-\eta)\exp\!\left(-(u-\hat{\mu})/\hat{b}^+\right), & u \geq \hat{\mu} \end{cases}\]

\[\tilde{m}_t = \Phi_\mathcal{G}(u_t)\]

注意 \(\tilde{m}_t\) 是”组内相对分数”,不是事件概率——它在组内排序,高的代表”组里更该加强的”。

用 8 个 token 走一遍这个流程

假设某个 turn 的校准组 \(\mathcal{G}\) 有 8 个 token,\(u\) 值为:

\[[0.40,\ 0.35,\ 0.50,\ -0.21,\ 0.10,\ -0.15,\ 0.30,\ 0.25]\]

第 1 步:排序求中位数

排序后:\([-0.21,\ -0.15,\ 0.10,\ 0.25,\ 0.30,\ 0.35,\ 0.40,\ 0.50]\)\(n=8\),中位数取第 4、5 个的平均:

\[\hat{\mu} = (0.25 + 0.30)/2 = 0.275\]

第 2 步:左右两侧尺度

  • 左侧(\(u < 0.275\)):\(-0.21, -0.15, 0.10, 0.25\),偏差 \(0.485, 0.425, 0.175, 0.025\),均值 \(\hat{b}^- = 0.2775\)
  • 右侧(\(u \geq 0.275\)):\(0.30, 0.35, 0.40, 0.50\),偏差 \(0.025, 0.075, 0.125, 0.225\),均值 \(\hat{b}^+ = 0.1125\)

第 3 步:套 CDF 算 \(\tilde{m}\)

  • \(u=0.40\)(右侧,该加强的):\(\tilde{m} = 1 - 0.5\times\exp(-(0.40-0.275)/0.1125) = 1 - 0.5\times\exp(-1.111) \approx 1 - 0.5\times0.329 = 0.836\)(高)
  • \(u=-0.21\)(左侧,该削弱的):\(\tilde{m} = 0.5\times\exp((-0.21-0.275)/0.2775) = 0.5\times\exp(-1.748) \approx 0.5\times0.174 = 0.087\)(低)

看清楚了:\(u=0.40\) 的 token(教师支持且目标同向)拿到 \(0.836\);而 \(u=-0.21\) 的 token(教师支持但目标反向——就是 2.1 里 microwave 那种)只拿到 \(0.087\)同样 \(\Delta_t\) 大、教师都信的 token,ICSD 靠 \(u_t\) 的符号把它们分开了。而信任权重 \(g_t\) 对这两个原本一视同仁。

一个令人安心的性质:仿射不变性

Proposition 1:对校准组内每个分数做正仿射变换 \(u'_j = a u_j + b\)\(a>0\)),中位数仿射等变、侧别保持、单侧尺度变为 \(a\hat{b}^\pm\)、标准化残差不变,最终 \(\tilde{m}'_t = \tilde{m}_t\);进而复合系数 \(\alpha_q\)\(c_t\) 都不变。

直觉:不管这一批优势整体放大 \(a\) 倍、还是整体平移 \(b\),校准结果纹丝不动。这正好对上了”优势与策略比尺度跨 batch 漂移”的麻烦——校准对尺度漂移天然免疫。

3.3 第三步:保守复合——fallback 保护 + 精确 turn 级质量匹配

什么时候校准分数会”骗人”:fallback 集 \(\mathcal{D}\)

辅助损失 \(\hat{\ell}_t^{KD}\) 永远在抬高采样 token 的对数概率;而教师指向的干预在 \(\Delta_t<0\) 时朝指。如果同时 \(\hat{A}_t<0\),二者乘积 \(u_t = \hat{A}_t\rho_t\Delta_t\) 反而为正——但这是两个”打架”的方向硬凑出来的假阳,不是真的”目标同向”。

对这种 token,ICSD 不动它,沿用继承来的 SDAR 系数 \(g_t\)。定义:

\[\mathcal{D} = \{t\in\mathcal{B}: \hat{A}_t<0,\ \Delta_t<0\}, \qquad \mathcal{C} = \mathcal{B}\setminus\mathcal{D}\]

\(\mathcal{D}\) 里的 token 用 \(g_t\)\(\mathcal{C}\) 里的 token 才进入下一步的重新分配。这是”保守”二字的第一层含义:没把握的别乱动

精确 turn 级质量匹配:不是加预算,是重分预算

这是 ICSD 最漂亮的设计。设 \(q\) 为一个 action turn,turn 之间构成 \(\mathcal{B}\) 的不相交划分。对每个 turn \(q\),当 \(\sum_{j\in\mathcal{C}_q} g_j \tilde{m}_j > 0\) 时:

\[\alpha_q = \frac{\sum_{j\in\mathcal{C}_q} g_j}{\sum_{j\in\mathcal{C}_q} g_j\, \tilde{m}_j}, \qquad c_t = \begin{cases} g_t, & t\in\mathcal{D}_q \\ \alpha_q\, g_t\, \tilde{m}_t, & t\in\mathcal{C}_q \end{cases}\]

分母为零时该 turn 内 \(c_t = g_t\)。这个 \(\alpha_q\) 的作用是归一化常数,它保证一个关键不变量:

\[\sum_{t\in q} c_t = \sum_{t\in q} g_t \quad \forall q\in\mathcal{Q}\]

每个 turn 内,ICSD 分配的总质量和 SDAR 完全一样。进而全局 \(\sum_{t\in\mathcal{B}} c_t = \sum_{t\in\mathcal{B}} g_t\)

含义:ICSD 不是在多花一份蒸馏预算,而是把 SDAR 本来就要花掉的那份质量重新分配——从”教师支持但目标反向”的 token 上扣回来,补给”教师支持且目标同向”的 token,总量不变。同 turn 内等信任的 token,\(u_t\leq u_{t'}\Rightarrow c_t\leq c_{t'}\)(单调性继承自 CDF)。

用数字看”重分配”长什么样

接 3.2 的 8-token 例子。假设这 8 个 token 都在同一个 turn \(q\),且都不在 fallback 集(都在 \(\mathcal{C}_q\)),为简化设它们的信任权重都相等 \(g_t=1\)

token \(u_t\) \(\tilde{m}_t\)(校准分数) \(c_t = \alpha\cdot 1\cdot\tilde{m}_t\)
1 0.50 ~0.987
2 0.40 0.836
3 0.35 ~0.764 中高
4 0.30 ~0.610
5 0.25 ~0.500
6 0.10 ~0.236
7 -0.15 ~0.136
8 -0.21 0.087 最低

SDAR 对这 8 个一视同仁,每个分 1 单位,总质量 8。ICSD 算 \(\alpha = \frac{8}{\sum \tilde{m}_j}\),再把 \(\alpha\tilde{m}_t\) 当权重——总质量仍是 8,但重的重、轻的轻\(u\) 高的 token 拿到远超 1 的份额,\(u\) 负的 token(教师支持但目标反向)只拿到 0.087 倍。这就是”保质量重分配”的具象。

3.4 第四步:detached 权重——零额外模型求值

\(c_t\)\(\hat{\ell}_t^{KD}\) 内部的特权对数概率都被 stop-gradient,辅助梯度只流经学生的对数概率。算 \(c_t\) 不需要任何额外的模型前向或反向传播。

开销实测:在 Qwen2.5-1.5B WebShop 上(4×H100),per-token actor 更新时间相对 SDAR 仅增 1.7%;而 actor 更新约占一步时间的 1/5,归一化后端到端开销约 +0.4%。几乎免费。

四、实验:在三个 agentic 基准上稳定胜出

4.1 实验设置

  • 三个基准:ALFWorld(文本家居任务,要长程规划)、WebShop(网购指令跟随,要逐页决策)、Search-QA 的 7 个子集(NQ/Triv/Pop/Hotp/2Wk/MuS/Bam,要检索-问答)——覆盖”规划+决策+检索问答”三类典型 agentic 能力。
  • 模型:Qwen2.5-Instruct(1.5B / 3B / 7B)与 Qwen3(1.7B / 4B),跨两个模型族、跨 1.5B–7B 规模。
  • 优化器:GRPO 与 GiGPO 两种。
  • 超参:蒸馏权重 \(\lambda=0.01\),ratio clip 0.2,尺度下界 \(10^{-4}\),校准组最小 8 token。

4.2 主结果(精选)

模型 / 方法 ALFWorld Avg Search-QA Avg WebShop Score WebShop Acc
Qwen2.5-1.5B · GRPO 65.6 24.1 72.0 60.9
Qwen2.5-1.5B · GRPO+SDAR 72.7 16.1 81.9 64.1
Qwen2.5-1.5B · GRPO+ICSD 73.4 27.7 85.6 75.8
Qwen2.5-1.5B · GiGPO 91.4 17.8 83.9 73.4
Qwen2.5-1.5B · GiGPO+SDAR 92.2 17.3 88.8 71.1
Qwen2.5-1.5B · GiGPO+ICSD 93.8 18.2 92.2 78.1
Qwen2.5-3B · GiGPO+SDAR 93.0 42.6 87.2 74.2
Qwen2.5-3B · GiGPO+ICSD 95.3 43.3 88.7 75.8
Qwen2.5-7B · GiGPO+SDAR 94.5 47.2 88.4 78.9
Qwen2.5-7B · GiGPO+ICSD 96.1 49.1 93.1 84.4
Qwen3-1.7B · GiGPO+SDAR 75.0 41.0 78.4 65.6
Qwen3-1.7B · GiGPO+ICSD 82.8 42.5 81.5 68.0

读这张表,有几个点值得停下来想:

  1. ICSD 在所有匹配的聚合指标上都赢,且在 GRPO 和 GiGPO 两种优化器下都成立——结论不挑优化器。
  2. 一个特别能说明问题的反例:Qwen2.5-1.5B 上,GRPO 在 Search-QA 是 24.1;加了 SDAR(仅信任分配)反而掉到 16.1——信任分配在”目标反向 token”上过度加压,越蒸越糟。ICSD 把它救回到 27.7,甚至超过无蒸馏的基线。这就是”信任不等于效用”在数字上的直接代价与修正。
  3. WebShop Acc 的提升幅度大:GRPO 下 +11.7 个百分点(64.1→75.8),GiGPO 下 +7.0 个百分点(71.1→78.1)。说明在需要精细逐页决策的任务上,校准的收益最明显。

4.3 7B 规模的亮点

7B 下 GiGPO+ICSD 拿到 96.1% ALFWorld 成功率WebShop 得分 93.1 / 准确率 84.4%,甚至超过评估时仍保留检索技能的 Skill-GRPO*(88.3 ALFWorld、87.0 WebShop 得分、81.2 WebShop 准确率)。而 ICSD 在测试时不需要任何特权上下文——它只在训练期用特权自我校准,推理时和普通 GRPO/GiGPO 一模一样。

五、机制诊断:ICSD 到底改变了什么

作者用冻结批次做了一系列诊断,把”为什么 work”讲得相当扎实。这也是本文最值得读的部分。

5.1 信任冲突质量(TCM):60.1% → 37.8%

TCM = 活跃的教师支持质量(\(\Delta_t>0\)\(|u_t|>\varepsilon\))中、被分配到目标反向 token(\(u_t<0\))的比例。跨 4 个匹配的 ALFWorld 批次(54.4 万个有效响应 token):

  • SDAR:60.1%
  • ICSD:37.8%
  • 下降 22.3 个百分点(95% CI [22.1, 22.6]),每个批次都下降。

回到我们放苹果的例子:SDAR 把超过六成的”教师支持”质量压在了像 microwave 这种”教师信但目标反向”的 token 上;ICSD 把这个比例砍到不到四成。

5.2 与 RL 梯度的余弦兼容度:+0.192,而且置换对照只剩 +0.020

跨 16 个冻结批次:

  • ICSD 平均提升余弦兼容度 0.192(95% CI [0.147, 0.240]),16 个批次全部为正

但光这个数还不够说服力——会不会只是因为尺度变了?作者做了最关键的对照:把同样的乘子跨 token 随机置换(保持分布和总质量不变,只打乱”哪个 token 拿哪个权重”的配对)。结果:

  • 置换后提升仅 0.020
  • 配对特异性差异 0.172(95% CI [0.131, 0.217])。

这是论文最漂亮的论证:改进来自 token 级的配对方式,而不是总质量或边际分布。用放苹果的话说——不是给所有 token 都多撒了点权重,而是精准地把权重从 microwave 挪到了 fridge

5.3 连续重分配:2.90× 与 0.79×

在冻结的 GiGPO 批次上,“强信任且目标同向”区域拿到 2.90×(ALFWorld)/ 2.64×(WebShop)的质量,而”信任但目标反向”的 ALFWorld token 拿到 0.79×——与”挪多挪少、总量不变”的直觉完全吻合。

5.4 裁剪审计:没把训练推向病态区

4 个冻结批次中:0.128% 的 token 落在裁剪区间外,0.069% 落在被裁剪 surrogate 局部平坦处;这些 token 拿到 0.103% 的复合系数质量与 0.984% 的绝对加权蒸馏质量。没有 token 触达负优势 dual-clip 上限。策略比分布集中在 1 附近(均值 1.0006,标准差 0.0254)——校准没有把训练推向 clipping 的病态区,这也解释了为什么它能稳定地叠加在 PPO 类算法上。

六、消融:为什么每一步都不能少

6.1 分配方式消融(Qwen2.5-1.5B · GiGPO · ALFWorld)

方法 ALFWorld Avg
GiGPO(无蒸馏) 91.4
GiGPO+SDAR 92.2
+ Fisher 幅值(无符号敏感度) 91.4
+ 仅符号(硬正/负,保留 fallback + 质量匹配) 92.2
+ 仅影响力(带符号分数,无 token 级信任) 93.0
+ ICSD(完整:信任 + 分级带符号影响力) 93.8

逐行读:

  • Fisher 幅值 91.4%:退化到无蒸馏的 vanilla GiGPO——只看敏感度幅值、丢掉符号,等于没用。这正面否定了”敏感度大的 token 就该多学”。
  • 仅符号 92.2%:追平 SDAR 但低 ICSD 1.6 个点——粗粒度的硬符号也不够,需要分级。
  • 仅影响力 93.0%:超 SDAR 但低完整版 0.8 个点——丢掉教师信任也不行
  • 完整 ICSD 93.8%:增益需要教师信任 + 分级带符号影响力两者兼具,缺一不可。

6.2 敏感性分析

  • 中心 CDF split(\(\eta=0.5\))与 \(\lambda=0.01\) 给出最强后期性能;
  • 非对称 Laplace 校准优于 Gaussian 替代;
  • 连续带符号影响力在峰值与后期窗口均值上都高于”仅幅值”或”仅符号”。

6.3 跨优化器

Qwen2.5-1.5B 上,ICSD 在 GRPO 和 GiGPO 下于 ALFWorld、WebShop 都胜过 SDAR;WebShop 准确率差 +11.7 分(GRPO)与 +7.0 分(GiGPO)——结论不依赖 GiGPO 的 step-aware 优势构造。

6.4 符号区域分解

ICSD 相对基线信任在四个符号区域的重分配:

  • $+$6.2 pp 更多质量给 \(\Delta_t>0,\ \hat{A}_t>0\)(教师支持且目标同向——加码)
  • $-$7.5 pp 更少质量给 \(\Delta_t>0,\ \hat{A}_t<0\)(教师支持但目标反向——这正是 mismatch 的重灾区,被精准削减)
  • $-$1.5 pp 更少质量给 \(\Delta_t<0,\ \hat{A}_t>0\)
  • 双负区域(\(\mathcal{D}\)±0.0 pp——按构造 \(c_t=g_t\),不动

这组数字几乎是 trust-utility mismatch 假设的直接验证:削减最狠的,正是”教师支持但目标反向”那一格。

七、总结与启示

把 ICSD 浓缩成一句话:把”教师可信”和”朝教师走有用”拆开,在不增加任何模型求值的前提下,用保质量的批量校准把它们复合。

放回开头的导航员类比:ICSD 不是换个更准的导航员,而是在听导航员的同时,多问一句”这步到底离我的目的地更近还是更远”——而这一问,几乎不花时间(端到端 +0.4% 开销),却把”教师支持但帮倒忙”的 token 质量从 60.1% 砍到 37.8%。

几个对后续工作有启发性的点:

  1. 影响函数可以很轻。经典影响函数的昂贵来自参数空间;一旦换成”教师指定的标量输出坐标”扰动,一阶系数就能用 RL 更新里已有的量(\(\hat{A}_t\)\(\rho_t\)\(\Delta_t\))直接读出。这对 agentic RL 这种 token 数巨大、模型巨大的场景,几乎是唯一可行的路径。
  2. 保质量重分配 > 加新损失。ICSD 严格保证逐 turn、逐 batch 的蒸馏质量守恒,意味着它不是”多花一份预算”,而是”把同一份预算花得更对地方”。这也让它天然能插件式叠在任意信任分配器(如 SDAR)之上。
  3. 置换对照是金标准。余弦兼容度 +0.192、但置换后只剩 +0.020——这种”保持边际、打乱配对”的对照,是论证”改进来自配对而非规模”的最干净写法,值得在所有 token 级权重方法里复用。
  4. trust-utility mismatch 是一类问题。60.1%→37.8% 的 TCM 下降说明,现有大量”用教师对数概率差当权重”的方法都可能在系统性压制目标反向的 token。任何用 \(\Delta\) 单调映射出权重的蒸馏/RLHF 流水线,都值得做一次类似诊断。

资源


ICSD:当"老师可信"不等于"听老师的话有用"——给 On-Policy Self-Distillation 装上影响力校准
https://kissshhot.github.io/2026/08/21/icsd-influence-calibration-self-distillation/
作者
丁一帆
发布于
2026年8月21日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。