AI 能否用自己的数据训练自己?从 NEON 到潜在能力再浮现
生成式 AI 面临一个越来越现实的瓶颈:高质量真实数据有限,而互联网中的合成内容越来越多。既然模型可以廉价地产生海量文本和图像,一个自然的问题是:模型能不能用自己生成的数据继续训练自己?
朴素答案通常是否定的。模型反复学习自己的输出,会强化已有偏差、丢失长尾模式,最终发生模型崩塌。但 ICLR 2026 的 NEON 论文给出了一个反直觉思路:既然自训练造成的退化具有方向,就沿这个方向反着走。随后,同一团队又在语言模型上研究了更极简的问题:完全不提供任务提示、教师、验证器或奖励,只用模型从 BOS 开始生成的普通文本继续微调,能否激活模型已有但没有充分表现的能力?
本文串联这两项工作。核心结论是:合成数据既不是天然有害,也不是天然有用。它的价值取决于训练方式,以及数据来源与学生模型之间的兼容关系。
1. 为什么自训练会导致模型崩塌
一个典型的自消耗循环是:
- 模型生成合成数据;
- 使用这些数据训练新一代模型;
- 新模型继续生成下一轮数据;
- 重复上述过程。
常见推理方法,例如 classifier-free guidance、低温度、top-k、top-p 和截断采样,都倾向于选择模型已经赋予较高概率的区域。结果是合成数据不能完整反映原始数据分布,而会越来越集中于模型本来就擅长的模式。
这种正反馈会造成:
- 低频样本和长尾特征逐渐消失;
- 生成多样性与召回率下降;
- 模型对已有偏差越来越自信;
- 合成伪影被逐代放大;
- 生成分布不断远离真实数据分布。
这一现象又称模型自噬障碍(Model Autophagy Disorder,MAD)或 model collapse。
2. NEON:先故意退化,再沿反方向外推
NEON 的完整标题是 Negative Extrapolation From Self-Training Improves Image Generation。它的关键洞见是:模型在自生成数据上训练产生的退化不是纯随机噪声,而是一种可利用的方向信号。
典型的模式偏好采样会使合成数据梯度与真实数据梯度出现可预测的反对齐:
- 沿合成数据训练方向移动,会强化模型已有模式并进一步丢失多样性;
- 沿退化方向反向移动,则可能重新覆盖被忽略的真实模式。
2.1 三步算法
NEON 的操作非常简单:
- 使用基础模型生成少量合成样本;
- 在这些样本上短暂微调,故意得到一个略微退化的模型;
- 从基础模型出发,沿这次参数变化的相反方向外推。
其参数合并公式为:
\[ \theta_{\mathrm{NEON}} =\theta_r-w(\theta_s-\theta_r) =(1+w)\theta_r-w\theta_s,\qquad w>0, \]
其中 \(\theta_r\) 是原始模型参数,\(\theta_s\) 是在合成数据上短暂微调后的退化参数,\(w\) 控制反向外推强度。
“把梯度反过来”是一种便于理解的说法。严格来说,NEON 并不逐步倒放 SGD,而是先测出自训练造成的整体参数偏移,再通过一次训练后的权重合并向相反方向外推。
2.2 实验结果
论文报告 NEON:
- 不需要新增真实训练数据;
- 不需要额外验证器;
- 约 1,000 个合成样本即可产生效果;
- 通常增加不到 1% 的训练计算;
- 不修改正常推理流程;
- 适用于扩散、Flow Matching、自回归图像生成和 Inductive Moment Matching 模型;
- 在 ImageNet 256×256 上,以约 0.36% 的额外训练计算,把 xAR-L 的 FID 从约 1.28 改善到 1.02。
NEON 的主要收益来自恢复召回率和生成多样性。生成精度有时会轻微下降,但综合 FID 改善,说明模型重新覆盖了此前被忽略的模式。
2.3 NEON 没有研究文本大语言模型
NEON 实验中的“自回归模型”是自回归图像生成模型,不等于文本 LLM。论文使用 ImageNet、CIFAR-10 和 FFHQ 等视觉数据,没有直接验证负向参数外推对语言模型是否有效。
因此,不能从 NEON 推出“LLM 也可以把自训练梯度反过来提升推理能力”。这一问题仍需独立实验。
3. 后续 LLM 研究:不是所有合成数据都适合你
同一研究团队随后发布了预印本 Not All Synthetic Data Is Yours to Learn From。这项工作确实研究了语言模型,但它不是把 NEON 原样迁移到 LLM,而是考察另一个问题:
基础语言模型能否通过普通的正向微调,从无提示、无标签、无验证的自生成文本中得到改善?
作者将其解释为潜在能力再浮现(Latent Capability Resurfacing)。
4. 潜在能力再浮现假说
该假说包含三个主张:
- 预训练模型已经拥有一些能力,但这些能力没有在基础模型的直接行为中被充分表达。
- 当合成语料与学生模型兼容时,弱自训练可以放大这些已有结构;兼容性是“数据来源—学生模型”的关系,而不是数据自身的绝对质量。
- 在合适区间内,被放大的是分布式、可泛化的任务结构,而非对具体训练句子的机械复述。
这里的“再浮现”非常关键。论文没有声称模型能从无到有地创造新能力或获取新事实,而是认为训练把预训练期间已经形成、但尚未充分表现的能力重新放大了。
5. 极简 BOS-only 自训练
论文有意移除所有常见外部信号:
- 不提供任务提示;
- 不使用教师模型给答案;
- 不使用验证器筛选样本;
- 不使用奖励模型;
- 不提供人工标签。
主实验流程如下:
- 从未经指令微调的基础模型开始,例如 Qwen2.5-0.5B 或 LLaMA-3.2-1B。
- 只输入序列开始符 BOS,让模型无条件生成普通文本。
- 每条样本至少 50 token,最多 1,024 token。
- 使用 \(\tau\in\{0.75,1.0,1.25\}\) 三种温度,不使用 top-k 或 top-p。
- 每个条件生成约 500 万 token。
- 使用 8-gram 去污染,排除与评测集测试样本直接重合的片段。
- 使用全参数 AdamW 微调 40 个 epoch;主实验学习率为 \(10^{-6}\),有效 batch size 为 64。
- 在 MMLU、ARC-Challenge、GSM8K、HellaSwag、TruthfulQA、Minerva-MATH 和 HumanEval 上评测。
论文还构造了等量真实数据回放基线:从 Common Corpus 中抽取同样约 500 万 token,使用完全相同的超参数训练。这可以排除“任何低学习率继续预训练都会提升”的解释。
6. 一条具体路径:Qwen 如何从自己的文本中获益
以 Qwen2.5-0.5B、\(\tau=1.25\) 为例:
- 模型只接收 BOS,不收到“解一道数学题”等提示;
- 从自身无条件分布采样 50~1,024 token 的文本,总计约 500 万 token;
- 进行 8-gram 去污染,并用语义嵌入审计与 GSM8K 等测试题的相似度;
- 以 \(10^{-6}\) 学习率全参数微调 40 个 epoch;
- ARC-Challenge 和 HellaSwag 的提升在约 20~30 个 epoch 内逐渐饱和;
- GSM8K 在高温度下先明显上升,随后向基线回落;
- HumanEval 获得幅度较小的改善。
等量 Common Corpus 在 GSM8K 上持平或下降,在 Minerva-MATH 上基本没有帮助,在 HumanEval 上持续退化。因此,这不是普通继续预训练的通用正则化效果。
同时,高温度条件清楚展示了这种方法的边界:覆盖范围扩大能短期激活更多模式,但噪声也更强,继续训练最终会覆盖最初的收益。论文研究的是短期、选择性的改善,不是无限递归自我提升。
7. 能力提升高度依赖学生模型
相同协议在 Qwen2.5-0.5B 与 LLaMA-3.2-1B 上产生了明显不同的结果:
- Qwen 在推理、数学和代码任务上出现较广泛的短期提升;
- LLaMA 在 GSM8K 和 Minerva-MATH 上没有可靠改善;
- LLaMA 的 HumanEval 在合成数据和 Common Corpus 条件下都会明显下降;
- LLaMA 的小幅收益主要集中在 MMLU、ARC-Challenge、HellaSwag 和部分 TruthfulQA 等理解型任务。
这更符合“能力再浮现”而非“能力导入”:如果学生的预训练没有充分形成某种结构化生成能力,无提示自生成文本不能稳定地替它创造这种能力。
8. 数据价值是一种关系属性
论文固定 Qwen2.5-0.5B 为学生,并让它学习不同来源、token 数相同的语料。效果排序为:
- Qwen2.5-0.5B 自己生成的数据最好;
- 同谱系的 Qwen2.5-7B 排名第二;
- 能力更强、但训练配方不同的 Qwen3-8B 更弱;
- 跨家族的 LLaMA-3.2-1B 最弱,经常损害数学、代码和知识任务。
这意味着“教师越强,数据越好”并不成立。对特定学生来说,能诱导出兼容更新方向的数据,可能比更强模型生成的文本更有价值。
8.1 几个直观指标为何失效
作者逐一排除了常见解释:
- 教师能力:让 LLaMA 学生反过来学习 Qwen 数据时,Qwen 数据也没有普遍优于 LLaMA 自生成数据。
- 测试题相似度:把高温度语料按与 GSM8K 的最大语义相似度是否超过 0.35 分组,两组训练曲线几乎一致。
- 学生平均似然:Qwen 自生成语料与 LLaMA 跨家族语料在 Qwen 学生下的逐 token NLL 分别约为 9.10 和 9.01,几乎相同,但训练结果截然不同。
- 单向评分偏差:在 LLaMA 学生下,自有语料与 Qwen 跨家族语料的平均 NLL 约为 8.88 和 8.93,仍然接近,效用差异却依旧存在。
因此,流畅度、教师规模、与基准题的相似度以及平均 NLL,都不能单独预测语料是否能帮助一个学生。
论文推测,同谱系模型生成的数据更可能在高阶序列结构和内部表示上与学生兼容,从而诱导有益更新。不过作者没有直接测量梯度夹角或更新几何,所以“兼容性”仍是有实验支持的解释假说,不是已经证明的底层机制。
9. 能力提升与逐字记忆下降
论文使用预训练数据记录完整的 Pythia-1B 和 Pythia-6.9B,研究自训练对记忆提取的影响:
- BOS-only、\(\tau=1.25\);
- 约 500 万 token;
- 训练 40 个 epoch;
- 比较 \(10^{-5}\) 和 \(10^{-6}\) 两个学习率;
- 从 Wikipedia、Enron、Pile-CC 和 GitHub 各选 10,000 条预训练序列,共 40,000 条;
- 给模型每条序列的前 50 token,检查能否逐字生成真实后续。
学习率为 \(10^{-5}\) 时,文本逐字提取显著下降:
- Pythia-1B:约 184 条降至接近 0,下降约 97%;
- Pythia-6.9B:约 540 条降至约 34,下降约 94%。
代码提取也明显减少:
- Pythia-1B:约 1,900 条降至约 950;
- Pythia-6.9B:约 2,660 条降至约 1,390。
与此同时,Pythia-6.9B 在 \(10^{-5}\) 条件下的 ARC-Challenge 约提升 2.5 个百分点,HellaSwag 约提升 1.5 个百分点。也就是说,至少在这个实验区间,能力与逐字记忆朝相反方向移动。
9.1 不只是解码方式发生变化
作者进一步用教师强制计算真实后续文本的概率变化:
\[ \Delta\log p(x\mid y) =\log p_{\theta_t}(x\mid y) -\log p_{\theta_{\mathrm{base}}}(x\mid y), \]
其中 \(y\) 是 50-token 前缀,\(x\) 是真实续写。当逐字提取下降时,\(\Delta\log p\) 也稳定为负,说明模型确实把概率质量从原始预训练序列上移开,而不只是贪心解码结果改变。
学习率仍然是决定性变量:Pythia-6.9B 在 \(10^{-6}\) 下,无论能力还是记忆都几乎不变;Pythia-1B 在 \(10^{-5}\) 下虽然记忆持续减少,能力却会经历短暂提升后退化。因此,这不是一个无条件成立的免费去记忆方案。
10. NEON 与 LLM 后续工作的区别
| 维度 | NEON | Not All Synthetic Data Is Yours to Learn From |
|---|---|---|
| 研究对象 | 图像生成模型 | 基础语言模型 |
| 合成数据作用 | 故意制造可测量的退化方向 | 直接作为继续微调语料 |
| 更新方式 | 对参数变化做负向外推 | 普通正向全参数微调 |
| 是否反转更新方向 | 是,通过训练后参数合并实现 | 否 |
| 机制解释 | 合成梯度与真实梯度反对齐 | 学生—来源兼容性与潜在能力再浮现 |
| 主要风险 | 外推过强可能损伤精度 | 收益短暂、学生依赖、训练过久可能退化 |
后续论文证明的是“某些基础 LLM 可以从兼容的自生成文本中获得选择性改善”,不是“NEON 已在 LLM 上得到验证”。
11. 局限与我的判断
论文作者明确承认:
- 主实验只覆盖少量开放模型家族和规模,不能直接外推到更大模型;
- 没有直接测量梯度对齐或更新方向几何;
- 逐字提取和真实续写概率不构成完整隐私审计;
- 能力评价仍主要依赖静态标准基准。
在此基础上,还需要注意五个边界。
11.1 短期改善不等于持续自我提升
论文只研究一次、短周期的继续微调。它不能证明多代递归训练不会崩塌,更不能证明模型能无限产生知识。
11.2 逐字记忆下降也可能是非定向遗忘
提取率下降可能具有隐私价值,但也可能代表模型遗忘有用事实、低频知识或代码细节。没有目标化评估时,不能把它直接称为机器遗忘方法。
11.3 再浮现不是新知识学习
结果更接近重新组织和放大已有能力,而不是从外部世界吸收新事实。模型仍然受预训练能力边界约束。
11.4 兼容性暂时无法低成本预测
教师规模、文本相似度和平均 NLL 都预测失败。实践中可能仍要进行昂贵的小规模试训,才能知道哪一来源适合哪一学生。
11.5 高温度是一种权衡
提高温度能够覆盖更多潜在模式,也会提高噪声和后期退化风险。最佳温度、学习率与早停点依赖具体学生和任务。
12. 可能的改进方向
- 直接计算不同语料在学生模型上诱导的梯度夹角、Fisher 几何和表示变化,把兼容性变成可测量指标。
- 根据能力、记忆提取率和参数移动距离联合早停,捕获短期收益并避免后期退化。
- 在 7B、70B 和不同预训练配方上构建完整的来源—学生兼容性矩阵。
- 使用动态数学题、实时知识和真实代理任务,区分潜在能力再浮现与真正的新知识学习。
- 扩展隐私评估到成员推断、近似复述、个人信息泄露和语义级记忆。
13. 最终结论
关于“AI 能否用自己生成的数据训练自己”,目前更准确的回答不是简单的是或否,而是:
- 朴素、多代的递归自训练仍然容易发生模型崩塌;
- 对视觉生成模型,NEON 可以把结构化退化当作信号,通过负向参数外推改善模型;
- 对语言模型,兼容的 BOS-only 自生成文本可以短期激活部分已有能力;
- 数据效用取决于学生—来源关系,能力最强的教师不一定产生最有用的数据;
- 这种方法不能可靠创造模型原本缺少的能力,也不能输入新的外部知识;
- Pythia 实验展示了能力与逐字记忆解耦的可能性,但还不是成熟的隐私或机器遗忘方案。
真正值得关注的变化是:我们不应再把合成数据看成带有固定质量标签的静态商品。未来的数据选择问题可能必须写成:
这份数据会在这个特定学生模型上诱导怎样的更新?
点赞与评论
喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。
如果评论无法加载,请检查网络连接后刷新页面。