ICSD:当"老师可信"不等于"听老师的话有用"——给 On-Policy Self-Distillation 装上影响力校准
你正开车去机场。导航员(老师)说:“前方路口左转有一家加油站。”——这句话本身可信,加油站确实在那儿。但你这趟的目的是赶飞机,不需要加油,而且左转会绕远。照做反而离目的地更远。
这就是论文《Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL》(arXiv:2608.14945)要解决的核心矛盾。作者把它命名为 trust-utility mismatch(信任-效用错配):信任回答”老师的修正靠不靠谱”,效用回答”朝它走是否服务于当前策略改进方向”——两者谁也回答不了谁,但现有方法一直把它们当成一回事。
本文用一个 ALFWorld 里的具体例子,一步步讲清楚问题来龙去脉,以及作者提出的 ICSD(Influence Calibration for Self-Distillation) 如何在几乎零开销下修好它。
一、把场景搭起来:什么是 OPSD
1.1 一个具体例子:在 ALFWorld 里把苹果放进冰箱
ALFWorld 是一个文本家居环境。假设当前任务是 “把一个洗干净的苹果放进冰箱”。智能体已完成:走到台面 → 拿起苹果 → 走到水池 → 用水洗干净苹果。现在它要决定下一步动作。
智能体(学生策略 \(\pi_\theta\))此刻采样出下一个动作的 token
序列,比如
"go to fridge 1"。同时有一个特权版本的自我
\(\pi_{\theta^+}(\cdot\mid x_t, z_t)\)
也在评估同一个 token——它和学生共享同一套 actor
参数,但多看了一眼额外上下文 \(z_t\)(例如从整条轨迹里抽出来的”目标终点是冰箱、冰箱在东边”这类线索)。
直觉上:特权自我因为信息更全,对”该走哪步”判断更准。OPSD(On-Policy Self-Distillation)就是让学生在自己生成的轨迹上、向这个更准的特权自我学,从而把稀疏的 RL 奖励(任务最后成功/失败才给一个信号)变成每个 token 上都有的密集监督。
1.2 两个关键量:教师-学生差距 \(\Delta_t\) 与信任权重 \(g_t\)
对某个 token \(a_t\)(比如
"fridge" 这个
token),定义教师-学生差距:
\[\Delta_t = \mathrm{sg}\!\left[\log \pi_{\theta^+}(a_t\mid x_t, z_t) - \log \pi_\theta(a_t\mid x_t)\right]\]
其中 \(\mathrm{sg}\) 是 stop-gradient(这个差距只当”参考标尺”,不回传梯度)。
- \(\Delta_t > 0\):特权自我比学生更看好这个 token(“教师支持”)。
- \(\Delta_t < 0\):特权自我比学生更不看好(“教师反对”)。
现有方法(如 SDAR)直接拿 \(\Delta_t\) 套一个单调函数,得到 \([0,1]\) 的信任权重:
\[g_t = G_{\mathrm{trust}}(\Delta_t)\]
论文实验里 \(G_{\mathrm{trust}}\) 取 split 参数 0.4 的非对称 Laplace CDF。\(g_t\) 越大,这个 token 上分到的蒸馏强度越大。
1.3 OPSD 的目标函数
设 \(\mathcal{B}\) 为一个 minibatch 里所有有效响应 token 的集合,每个 token 的辅助蒸馏损失为:
\[\hat{\ell}_t^{KD}(\theta) = \mathrm{sg}\!\left[\log \pi_{\theta^+}(a_t\mid x_t, z_t)\right] - \log \pi_\theta(a_t\mid x_t)\]
带 per-token 系数 \(c_t\) 的 OPSD 目标为:
\[\mathcal{L}(\theta) = \mathcal{L}_{RL}(\theta) + \frac{\lambda}{|\mathcal{B}|} \sum_{t\in\mathcal{B}} \mathrm{sg}(c_t)\, \hat{\ell}_t^{KD}(\theta)\]
既有方法里 \(c_t = g_t\)——蒸馏强度只看教师有多信。问题就出在这。
二、核心问题:信任不等于效用
2.1 两个 \(\Delta_t\) 相同的 token,命运却该不同
回到放苹果的例子。假设在两个不同时刻,学生都采样出某个 token,且特权自我都比学生更看好它(\(\Delta_t=+0.6\)):
| 时刻 | token | \(\Delta_t\) | 优势 \(\hat{A}_t\) | 含义 |
|---|---|---|---|---|
| A | fridge(走向冰箱) |
+0.6 | +0.5 | 教师支持,且这一步整体被优势函数奖励(方向对) |
| B | microwave(走向微波炉) |
+0.6 | -0.3 | 教师也支持(微波炉也是常见家电,局部看合理),但这步整体被优势函数惩罚(绕远,离冰箱目标更远) |
注意:两个 token 的 \(\Delta_t\) 完全相同,所以 SDAR 给它们相同的信任权重 \(g_t\),会同等强度地把学生推向教师。可对于”把苹果放进冰箱”这个目标,A 是该加强的好动作,B 是该削弱的坏动作——同等加强显然不对。
这就是 trust-utility mismatch:
信任问”这个修正可不可信”(\(\Delta_t\) 大不大);效用问”朝它走是否服务于当前策略改进方向”(\(\hat{A}_t\) 的符号与大小)。\(\Delta_t\) 完全回答不了 \(\hat{A}_t\) 的事。
2.2 这个问题有多严重
作者在冻结的 ALFWorld 训练批次上做了统计:仅靠信任分配,会把 60.1% 的教师支持质量压在与当前目标相反的 token 上。也就是说,教师信誓旦旦支持的 token 里,超过六成其实是在”拖后腿”。这不是个别 case,而是系统性的。
三、ICSD 的核心思路:在不增模型求值的前提下,给信任加一层”效用校验”
ICSD 不替换 \(g_t\),而是在它之上叠加一层教师指向的目标影响力 \(u_t\),再做保质量的批量归一化,最后和 \(g_t\) 复合。整个方法分四步,下面逐步讲。
3.1 第一步:用一次标量扰动,量出每个 token 对目标的边际推动
为什么不用经典影响函数?
经典影响函数走参数空间:\(-\nabla_\theta J^\top H^{-1}\nabla_\theta \ell_t\),需要对每个 token 算参数梯度、还要解逆曲率 \(H^{-1}\)。对十亿参数的 agentic 模型,这根本跑不动。
ICSD 的洞察:别动参数,直接扰动教师指定的那个标量输出坐标。
扰动怎么构造
记策略比 \(\rho_t = \pi_\theta(a_t\mid x_t)/\pi_{\mathrm{old}}(a_t\mid x_t)\)(\(\pi_{\mathrm{old}}\) 是固定的 rollout 策略)。ICSD 沿着教师-学生差距 \(\Delta_t\) 的方向,给 \(\log \rho_t\) 加一个微小扰动 \(\varepsilon\):
\[\log \rho_t(\varepsilon) = \log \rho_t + \varepsilon\, \Delta_t, \qquad \rho_t(\varepsilon) = \rho_t \exp(\varepsilon \Delta_t)\]
直观:\(\varepsilon>0\) 表示”朝教师方向轻轻推一下学生的输出概率”。
一阶响应:\(u_t\)
token 对未裁剪 surrogate 的贡献是 \(J_t = \hat{A}_t \rho_t\)。教师指向的目标影响力就是它对 \(\varepsilon\) 的一阶导数(在 \(\varepsilon=0\) 处):
\[u_t := \left.\frac{d[\hat{A}_t \rho_t(\varepsilon)]}{d\varepsilon}\right|_{\varepsilon=0} = \hat{A}_t\, \rho_t\, \Delta_t\]
这个形式极简,但含义丰富:
- 它把信任(\(\Delta_t\))和效用(\(\hat{A}_t\) 的符号)乘在了一起;
- 对教师支持的 token(\(\Delta_t>0\)),\(u_t\) 的符号直接告诉你”提高这个 token 的概率,到底是抬高还是压低局部 surrogate 贡献”。
附录给出显式余项界,证明 \(u_t\) 是精确的一阶系数(一阶项本身不含近似):
\[\left|J(\varepsilon) - J(0) - \varepsilon u_t\right| \leq \frac{|\hat{A}|\rho\Delta^2}{2}\, \varepsilon^2 e^{|\varepsilon\Delta|}\]
用具体数字验证一下
拿 2.1 表里的时刻 A(fridge)举例:设 \(\rho_t=1.0\)、\(\Delta_t=0.6\)、\(\hat{A}_t=+0.5\)、扰动 \(\varepsilon=+0.1\)。
- \(u_t = \hat{A}_t \rho_t \Delta_t = 0.5 \times 1.0 \times 0.6 = 0.30\)
- 精确变化:\(\rho_t(\varepsilon)=1.0\times\exp(0.1\times0.6)=\exp(0.06)\approx 1.0618\);\(J_t(\varepsilon)=0.5\times1.0618=0.5309\);\(J_t(0)=0.5\);精确增量 \(\approx 0.0309\)
- 一阶预测:\(\varepsilon\, u_t = 0.1\times0.30 = 0.03\)
一阶预测 \(0.03\) 与精确增量 \(0.0309\) 几乎一致——这就是 \(u_t\) 作为”边际推动”的含义。\(u_t>0\) 说明朝教师推一下,目标在涨,该加强。
再看时刻 B(microwave):\(\Delta_t=0.6\) 同样,但 \(\hat{A}_t=-0.3\):
- \(u_t = -0.3 \times 1.0 \times 0.6 = -0.18 < 0\)
\(u_t<0\) 说明朝教师推一下,目标反而在降——尽管教师很信(\(\Delta_t\) 大),这一推是在帮倒忙。ICSD 就是靠这个符号把 B 识别出来、削弱的。
关键一句:算 \(u_t\) 用到的 \(\hat{A}_t\)、\(\rho_t\)、\(\Delta_t\) 本来就是 RL 更新里要算的量,无需任何额外的前向或反向传播。
3.2 第二步:批量自适应校准——把 \(u_t\) 变成 \([0,1]\) 的相对分数
为什么不能直接拿 \(u_t\) 当权重?
\(u_t\) 的绝对尺度跨 minibatch 漂得厉害——它继承了优势 \(\hat{A}_t\) 和策略比 \(\rho_t\) 的尺度,而这俩在不同 batch、不同训练阶段差异巨大。而且它是三个量的乘积,天然有重尾。直接当权重用,要么被离群点带飞,要么尺度忽大忽小。
怎么办:按 turn 分组 + 中位数 + 双侧分别归一
一个 action turn = 一条轨迹里发出一次 agent 动作的那一段 span。ICSD 把同一个 turn 索引、跨轨迹的 token 汇成一个校准组 \(\mathcal{G}\)(稀疏时退化为全 batch)。这样比的是”同类动作内部”的相对高低,更公平。
对每个 \(\mathcal{G}\):
- 用中位数 \(\hat{\mu}_\mathcal{G}\) 当中心(抗离群点);
- 左右两侧分别算平均绝对偏差 \(\hat{b}^-_\mathcal{G}\)、\(\hat{b}^+_\mathcal{G}\)(承认正负侧尺度可能不对称);
\[\hat{\mu}_\mathcal{G} = \mathrm{median}_{j\in\mathcal{G}}\, u_j, \quad \hat{b}^-_\mathcal{G} = \mathrm{mean}_{u_j<\hat{\mu}} |u_j-\hat{\mu}|, \quad \hat{b}^+_\mathcal{G} = \mathrm{mean}_{u_j\geq\hat{\mu}} |u_j-\hat{\mu}|\]
然后套一个 split 参数 \(\eta=0.5\) 的非对称 Laplace CDF,得到 \([0,1]\) 的相对分数 \(\tilde{m}_t\):
\[\Phi_\mathcal{G}(u) = \begin{cases} \eta\, \exp\!\left((u-\hat{\mu})/\hat{b}^-\right), & u < \hat{\mu} \\ 1 - (1-\eta)\exp\!\left(-(u-\hat{\mu})/\hat{b}^+\right), & u \geq \hat{\mu} \end{cases}\]
\[\tilde{m}_t = \Phi_\mathcal{G}(u_t)\]
注意 \(\tilde{m}_t\) 是”组内相对分数”,不是事件概率——它在组内排序,高的代表”组里更该加强的”。
用 8 个 token 走一遍这个流程
假设某个 turn 的校准组 \(\mathcal{G}\) 有 8 个 token,\(u\) 值为:
\[[0.40,\ 0.35,\ 0.50,\ -0.21,\ 0.10,\ -0.15,\ 0.30,\ 0.25]\]
第 1 步:排序求中位数
排序后:\([-0.21,\ -0.15,\ 0.10,\ 0.25,\ 0.30,\ 0.35,\ 0.40,\ 0.50]\),\(n=8\),中位数取第 4、5 个的平均:
\[\hat{\mu} = (0.25 + 0.30)/2 = 0.275\]
第 2 步:左右两侧尺度
- 左侧(\(u < 0.275\)):\(-0.21, -0.15, 0.10, 0.25\),偏差 \(0.485, 0.425, 0.175, 0.025\),均值 \(\hat{b}^- = 0.2775\)
- 右侧(\(u \geq 0.275\)):\(0.30, 0.35, 0.40, 0.50\),偏差 \(0.025, 0.075, 0.125, 0.225\),均值 \(\hat{b}^+ = 0.1125\)
第 3 步:套 CDF 算 \(\tilde{m}\)
- 对 \(u=0.40\)(右侧,该加强的):\(\tilde{m} = 1 - 0.5\times\exp(-(0.40-0.275)/0.1125) = 1 - 0.5\times\exp(-1.111) \approx 1 - 0.5\times0.329 = 0.836\)(高)
- 对 \(u=-0.21\)(左侧,该削弱的):\(\tilde{m} = 0.5\times\exp((-0.21-0.275)/0.2775) = 0.5\times\exp(-1.748) \approx 0.5\times0.174 = 0.087\)(低)
看清楚了:\(u=0.40\) 的
token(教师支持且目标同向)拿到 \(0.836\);而 \(u=-0.21\) 的
token(教师支持但目标反向——就是 2.1 里 microwave
那种)只拿到 \(0.087\)。同样
\(\Delta_t\) 大、教师都信的 token,ICSD
靠 \(u_t\)
的符号把它们分开了。而信任权重 \(g_t\) 对这两个原本一视同仁。
一个令人安心的性质:仿射不变性
Proposition 1:对校准组内每个分数做正仿射变换 \(u'_j = a u_j + b\)(\(a>0\)),中位数仿射等变、侧别保持、单侧尺度变为 \(a\hat{b}^\pm\)、标准化残差不变,最终 \(\tilde{m}'_t = \tilde{m}_t\);进而复合系数 \(\alpha_q\)、\(c_t\) 都不变。
直觉:不管这一批优势整体放大 \(a\) 倍、还是整体平移 \(b\),校准结果纹丝不动。这正好对上了”优势与策略比尺度跨 batch 漂移”的麻烦——校准对尺度漂移天然免疫。
3.3 第三步:保守复合——fallback 保护 + 精确 turn 级质量匹配
什么时候校准分数会”骗人”:fallback 集 \(\mathcal{D}\)
辅助损失 \(\hat{\ell}_t^{KD}\) 永远在抬高采样 token 的对数概率;而教师指向的干预在 \(\Delta_t<0\) 时朝下指。如果同时 \(\hat{A}_t<0\),二者乘积 \(u_t = \hat{A}_t\rho_t\Delta_t\) 反而为正——但这是两个”打架”的方向硬凑出来的假阳,不是真的”目标同向”。
对这种 token,ICSD 不动它,沿用继承来的 SDAR 系数 \(g_t\)。定义:
\[\mathcal{D} = \{t\in\mathcal{B}: \hat{A}_t<0,\ \Delta_t<0\}, \qquad \mathcal{C} = \mathcal{B}\setminus\mathcal{D}\]
\(\mathcal{D}\) 里的 token 用 \(g_t\);\(\mathcal{C}\) 里的 token 才进入下一步的重新分配。这是”保守”二字的第一层含义:没把握的别乱动。
精确 turn 级质量匹配:不是加预算,是重分预算
这是 ICSD 最漂亮的设计。设 \(q\) 为一个 action turn,turn 之间构成 \(\mathcal{B}\) 的不相交划分。对每个 turn \(q\),当 \(\sum_{j\in\mathcal{C}_q} g_j \tilde{m}_j > 0\) 时:
\[\alpha_q = \frac{\sum_{j\in\mathcal{C}_q} g_j}{\sum_{j\in\mathcal{C}_q} g_j\, \tilde{m}_j}, \qquad c_t = \begin{cases} g_t, & t\in\mathcal{D}_q \\ \alpha_q\, g_t\, \tilde{m}_t, & t\in\mathcal{C}_q \end{cases}\]
分母为零时该 turn 内 \(c_t = g_t\)。这个 \(\alpha_q\) 的作用是归一化常数,它保证一个关键不变量:
\[\sum_{t\in q} c_t = \sum_{t\in q} g_t \quad \forall q\in\mathcal{Q}\]
即每个 turn 内,ICSD 分配的总质量和 SDAR 完全一样。进而全局 \(\sum_{t\in\mathcal{B}} c_t = \sum_{t\in\mathcal{B}} g_t\)。
含义:ICSD 不是在多花一份蒸馏预算,而是把 SDAR 本来就要花掉的那份质量重新分配——从”教师支持但目标反向”的 token 上扣回来,补给”教师支持且目标同向”的 token,总量不变。同 turn 内等信任的 token,\(u_t\leq u_{t'}\Rightarrow c_t\leq c_{t'}\)(单调性继承自 CDF)。
用数字看”重分配”长什么样
接 3.2 的 8-token 例子。假设这 8 个 token 都在同一个 turn \(q\),且都不在 fallback 集(都在 \(\mathcal{C}_q\)),为简化设它们的信任权重都相等 \(g_t=1\)。
| token | \(u_t\) | \(\tilde{m}_t\)(校准分数) | \(c_t = \alpha\cdot 1\cdot\tilde{m}_t\) |
|---|---|---|---|
| 1 | 0.50 | ~0.987 | 高 |
| 2 | 0.40 | 0.836 | 高 |
| 3 | 0.35 | ~0.764 | 中高 |
| 4 | 0.30 | ~0.610 | 中 |
| 5 | 0.25 | ~0.500 | 中 |
| 6 | 0.10 | ~0.236 | 低 |
| 7 | -0.15 | ~0.136 | 低 |
| 8 | -0.21 | 0.087 | 最低 |
SDAR 对这 8 个一视同仁,每个分 1 单位,总质量 8。ICSD 算 \(\alpha = \frac{8}{\sum \tilde{m}_j}\),再把 \(\alpha\tilde{m}_t\) 当权重——总质量仍是 8,但重的重、轻的轻:\(u\) 高的 token 拿到远超 1 的份额,\(u\) 负的 token(教师支持但目标反向)只拿到 0.087 倍。这就是”保质量重分配”的具象。
3.4 第四步:detached 权重——零额外模型求值
\(c_t\) 和 \(\hat{\ell}_t^{KD}\) 内部的特权对数概率都被 stop-gradient,辅助梯度只流经学生的对数概率。算 \(c_t\) 不需要任何额外的模型前向或反向传播。
开销实测:在 Qwen2.5-1.5B WebShop 上(4×H100),per-token actor 更新时间相对 SDAR 仅增 1.7%;而 actor 更新约占一步时间的 1/5,归一化后端到端开销约 +0.4%。几乎免费。
四、实验:在三个 agentic 基准上稳定胜出
4.1 实验设置
- 三个基准:ALFWorld(文本家居任务,要长程规划)、WebShop(网购指令跟随,要逐页决策)、Search-QA 的 7 个子集(NQ/Triv/Pop/Hotp/2Wk/MuS/Bam,要检索-问答)——覆盖”规划+决策+检索问答”三类典型 agentic 能力。
- 模型:Qwen2.5-Instruct(1.5B / 3B / 7B)与 Qwen3(1.7B / 4B),跨两个模型族、跨 1.5B–7B 规模。
- 优化器:GRPO 与 GiGPO 两种。
- 超参:蒸馏权重 \(\lambda=0.01\),ratio clip 0.2,尺度下界 \(10^{-4}\),校准组最小 8 token。
4.2 主结果(精选)
| 模型 / 方法 | ALFWorld Avg | Search-QA Avg | WebShop Score | WebShop Acc |
|---|---|---|---|---|
| Qwen2.5-1.5B · GRPO | 65.6 | 24.1 | 72.0 | 60.9 |
| Qwen2.5-1.5B · GRPO+SDAR | 72.7 | 16.1 | 81.9 | 64.1 |
| Qwen2.5-1.5B · GRPO+ICSD | 73.4 | 27.7 | 85.6 | 75.8 |
| Qwen2.5-1.5B · GiGPO | 91.4 | 17.8 | 83.9 | 73.4 |
| Qwen2.5-1.5B · GiGPO+SDAR | 92.2 | 17.3 | 88.8 | 71.1 |
| Qwen2.5-1.5B · GiGPO+ICSD | 93.8 | 18.2 | 92.2 | 78.1 |
| Qwen2.5-3B · GiGPO+SDAR | 93.0 | 42.6 | 87.2 | 74.2 |
| Qwen2.5-3B · GiGPO+ICSD | 95.3 | 43.3 | 88.7 | 75.8 |
| Qwen2.5-7B · GiGPO+SDAR | 94.5 | 47.2 | 88.4 | 78.9 |
| Qwen2.5-7B · GiGPO+ICSD | 96.1 | 49.1 | 93.1 | 84.4 |
| Qwen3-1.7B · GiGPO+SDAR | 75.0 | 41.0 | 78.4 | 65.6 |
| Qwen3-1.7B · GiGPO+ICSD | 82.8 | 42.5 | 81.5 | 68.0 |
读这张表,有几个点值得停下来想:
- ICSD 在所有匹配的聚合指标上都赢,且在 GRPO 和 GiGPO 两种优化器下都成立——结论不挑优化器。
- 一个特别能说明问题的反例:Qwen2.5-1.5B 上,GRPO 在 Search-QA 是 24.1;加了 SDAR(仅信任分配)反而掉到 16.1——信任分配在”目标反向 token”上过度加压,越蒸越糟。ICSD 把它救回到 27.7,甚至超过无蒸馏的基线。这就是”信任不等于效用”在数字上的直接代价与修正。
- WebShop Acc 的提升幅度大:GRPO 下 +11.7 个百分点(64.1→75.8),GiGPO 下 +7.0 个百分点(71.1→78.1)。说明在需要精细逐页决策的任务上,校准的收益最明显。
4.3 7B 规模的亮点
7B 下 GiGPO+ICSD 拿到 96.1% ALFWorld 成功率、WebShop 得分 93.1 / 准确率 84.4%,甚至超过评估时仍保留检索技能的 Skill-GRPO*(88.3 ALFWorld、87.0 WebShop 得分、81.2 WebShop 准确率)。而 ICSD 在测试时不需要任何特权上下文——它只在训练期用特权自我校准,推理时和普通 GRPO/GiGPO 一模一样。
五、机制诊断:ICSD 到底改变了什么
作者用冻结批次做了一系列诊断,把”为什么 work”讲得相当扎实。这也是本文最值得读的部分。
5.1 信任冲突质量(TCM):60.1% → 37.8%
TCM = 活跃的教师支持质量(\(\Delta_t>0\) 且 \(|u_t|>\varepsilon\))中、被分配到目标反向 token(\(u_t<0\))的比例。跨 4 个匹配的 ALFWorld 批次(54.4 万个有效响应 token):
- SDAR:60.1%
- ICSD:37.8%
- 下降 22.3 个百分点(95% CI [22.1, 22.6]),每个批次都下降。
回到我们放苹果的例子:SDAR 把超过六成的”教师支持”质量压在了像
microwave 这种”教师信但目标反向”的 token 上;ICSD
把这个比例砍到不到四成。
5.2 与 RL 梯度的余弦兼容度:+0.192,而且置换对照只剩 +0.020
跨 16 个冻结批次:
- ICSD 平均提升余弦兼容度 0.192(95% CI [0.147, 0.240]),16 个批次全部为正。
但光这个数还不够说服力——会不会只是因为尺度变了?作者做了最关键的对照:把同样的乘子跨 token 随机置换(保持分布和总质量不变,只打乱”哪个 token 拿哪个权重”的配对)。结果:
- 置换后提升仅 0.020;
- 配对特异性差异 0.172(95% CI [0.131, 0.217])。
这是论文最漂亮的论证:改进来自 token
级的配对方式,而不是总质量或边际分布。用放苹果的话说——不是给所有
token 都多撒了点权重,而是精准地把权重从 microwave 挪到了
fridge。
5.3 连续重分配:2.90× 与 0.79×
在冻结的 GiGPO 批次上,“强信任且目标同向”区域拿到 2.90×(ALFWorld)/ 2.64×(WebShop)的质量,而”信任但目标反向”的 ALFWorld token 拿到 0.79×——与”挪多挪少、总量不变”的直觉完全吻合。
5.4 裁剪审计:没把训练推向病态区
4 个冻结批次中:0.128% 的 token 落在裁剪区间外,0.069% 落在被裁剪 surrogate 局部平坦处;这些 token 拿到 0.103% 的复合系数质量与 0.984% 的绝对加权蒸馏质量。没有 token 触达负优势 dual-clip 上限。策略比分布集中在 1 附近(均值 1.0006,标准差 0.0254)——校准没有把训练推向 clipping 的病态区,这也解释了为什么它能稳定地叠加在 PPO 类算法上。
六、消融:为什么每一步都不能少
6.1 分配方式消融(Qwen2.5-1.5B · GiGPO · ALFWorld)
| 方法 | ALFWorld Avg |
|---|---|
| GiGPO(无蒸馏) | 91.4 |
| GiGPO+SDAR | 92.2 |
| + Fisher 幅值(无符号敏感度) | 91.4 |
| + 仅符号(硬正/负,保留 fallback + 质量匹配) | 92.2 |
| + 仅影响力(带符号分数,无 token 级信任) | 93.0 |
| + ICSD(完整:信任 + 分级带符号影响力) | 93.8 |
逐行读:
- Fisher 幅值 91.4%:退化到无蒸馏的 vanilla GiGPO——只看敏感度幅值、丢掉符号,等于没用。这正面否定了”敏感度大的 token 就该多学”。
- 仅符号 92.2%:追平 SDAR 但低 ICSD 1.6 个点——粗粒度的硬符号也不够,需要分级。
- 仅影响力 93.0%:超 SDAR 但低完整版 0.8 个点——丢掉教师信任也不行。
- 完整 ICSD 93.8%:增益需要教师信任 + 分级带符号影响力两者兼具,缺一不可。
6.2 敏感性分析
- 中心 CDF split(\(\eta=0.5\))与 \(\lambda=0.01\) 给出最强后期性能;
- 非对称 Laplace 校准优于 Gaussian 替代;
- 连续带符号影响力在峰值与后期窗口均值上都高于”仅幅值”或”仅符号”。
6.3 跨优化器
Qwen2.5-1.5B 上,ICSD 在 GRPO 和 GiGPO 下于 ALFWorld、WebShop 都胜过 SDAR;WebShop 准确率差 +11.7 分(GRPO)与 +7.0 分(GiGPO)——结论不依赖 GiGPO 的 step-aware 优势构造。
6.4 符号区域分解
ICSD 相对基线信任在四个符号区域的重分配:
- $+$6.2 pp 更多质量给 \(\Delta_t>0,\ \hat{A}_t>0\)(教师支持且目标同向——加码)
- $-$7.5 pp 更少质量给 \(\Delta_t>0,\ \hat{A}_t<0\)(教师支持但目标反向——这正是 mismatch 的重灾区,被精准削减)
- $-$1.5 pp 更少质量给 \(\Delta_t<0,\ \hat{A}_t>0\)
- 双负区域(\(\mathcal{D}\))±0.0 pp——按构造 \(c_t=g_t\),不动
这组数字几乎是 trust-utility mismatch 假设的直接验证:削减最狠的,正是”教师支持但目标反向”那一格。
七、总结与启示
把 ICSD 浓缩成一句话:把”教师可信”和”朝教师走有用”拆开,在不增加任何模型求值的前提下,用保质量的批量校准把它们复合。
放回开头的导航员类比:ICSD 不是换个更准的导航员,而是在听导航员的同时,多问一句”这步到底离我的目的地更近还是更远”——而这一问,几乎不花时间(端到端 +0.4% 开销),却把”教师支持但帮倒忙”的 token 质量从 60.1% 砍到 37.8%。
几个对后续工作有启发性的点:
- 影响函数可以很轻。经典影响函数的昂贵来自参数空间;一旦换成”教师指定的标量输出坐标”扰动,一阶系数就能用 RL 更新里已有的量(\(\hat{A}_t\)、\(\rho_t\)、\(\Delta_t\))直接读出。这对 agentic RL 这种 token 数巨大、模型巨大的场景,几乎是唯一可行的路径。
- 保质量重分配 > 加新损失。ICSD 严格保证逐 turn、逐 batch 的蒸馏质量守恒,意味着它不是”多花一份预算”,而是”把同一份预算花得更对地方”。这也让它天然能插件式叠在任意信任分配器(如 SDAR)之上。
- 置换对照是金标准。余弦兼容度 +0.192、但置换后只剩 +0.020——这种”保持边际、打乱配对”的对照,是论证”改进来自配对而非规模”的最干净写法,值得在所有 token 级权重方法里复用。
- trust-utility mismatch 是一类问题。60.1%→37.8% 的 TCM 下降说明,现有大量”用教师对数概率差当权重”的方法都可能在系统性压制目标反向的 token。任何用 \(\Delta\) 单调映射出权重的蒸馏/RLHF 流水线,都值得做一次类似诊断。
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。