技术报告解读|GPT-6 Astra:长程 Agent、对齐泛化与可监测性的矛盾 结合 GPT-6 Astra System Card、官方评测与 API 文档,解释长程任务执行、异步工具调用、对齐泛化,以及能力提升后仍然存在的监测与复现问题。 2026-09-15 基础模型与后训练 #技术报告 #后训练 #GPT-6 Astra #OpenAI #Agent #对齐 #Computer Use
从 VLA 到 WAM:具身基础模型的代表方法,以及与 LLM、推理和强化学习的交叉 大语言模型学会了用语言描述任务,视觉语言模型学会了把描述与图像对应起来。机器人还需要跨过另外两道门槛:把目标变成可执行的运动,以及预测运动会造成什么后果。 VLA(Vision-Language-Action,视觉语言动作模型)与 WAM(World Action Model,世界动作模型)分别从动作生成和世界—动作联合建模切入这两个问题。 本文面向有 LLM、Agent 或强化学习背景的读者,梳 2026-09-12 世界模型 #LLM #Agentic RL #world model #VLA #WAM #具身智能 #flow matching
DASH:自蒸馏如何利用分歧序列调整监督权重?从反向递推到真实梯度 教师与学生在某个 token 上的分歧很小,就说明这里不值得关注吗?未必:相同大小的局部分歧,可能出现在完全不同的推理路径中。DASH 因而不再给每个 token 的蒸馏损失相同系数,而是根据整条 rollout 的分歧变化,构造一组自适应权重。 但理解这篇论文,最重要的是区分反向递推的数值与实际更新的梯度。DASH 并没有把未来错误作为策略梯度奖励分配给早期动作;它对已有的局部蒸馏梯度重新加权。 2026-09-11 OPD #DASH #OPSD #Forward KL #Token Reweighting #Adaptive Supervision #LoRA
SOPD:不接管学生轨迹,如何用完整步骤修复 OPD 的碎片化监督? 用一道算错的题,逐步看清学生轨迹、两次独立教师调用、训练输入与监督目标,再理解 SOPD 与 SFT、OPD 的区别。 2026-09-11 Long Horizon #SFT #On-Policy Distillation #SOPD #Black-Box Distillation #ALFWorld #Step-Level Supervision
RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化 把数学题上的 RL 训练流程接到交互环境上,Agent 就会越来越会规划吗?RAGEN 的实验给出了一个不那么乐观的答案:模型可能先涨分,随后反复使用几套被奖励过的推理模板,探索减少,梯度出现尖峰,最终性能崩溃。即使没有崩溃,输出里存在 <think> 也不代表模型正在准确理解环境。 这篇论文的价值,是将多轮 Agent RL 的训练闭环、采样设计与失败诊断放在一起研究:不仅问“学会了 2026-09-10 Agentic RL #PPO #GRPO #RAGEN #StarPO #Multi-Turn RL #Echo Trap #推理退化
从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon 大语言模型执行长任务时,可能一直收不到成功奖励,也可能偶尔成功,却学不会哪些步骤值得保留。这两种失败需要不同的解决方法。回看 LLM 兴起之前的研究,奖励重分配、目标重标注、时间抽象和历史压缩,提供了几条值得重新实验的路线。 本文收集 1991—2019 年的 12 篇论文,涵盖早期神经网络与深度强化学习,并补入两篇非深度学习的理论基础。优先推荐 RUDDER、HER、FeUdal Network 2026-09-08 Long Horizon #Long-Horizon Agent #信用分配 #稀疏奖励 #分层强化学习 #论文清单
OPDVR:用答案正确性过滤蒸馏信号,如何把 OPD 与可验证奖励结合? 学生已经答对了,但某个 token 的概率比教师更高,蒸馏仍可能要求学生降低它的概率。学生答错了,但教师更偏好其中某个 token,蒸馏又可能提高它的概率。模仿教师的分布,与优化最终答案正确率,并不总是同一个方向。 OPDVR 给出一个很小的修改:用最终答案的对错,过滤掉方向不一致的 sampled-token OPD 信号。不是额外加一项加权 RL 损失,而是让 verifier 决定允许的符号 2026-09-08 OPD #GRPO #RLVR #On-Policy Distillation #OPDVR #GRPD #奖励门控
Synaptic Intelligence:沿训练轨迹衡量参数重要性,让神经网络少忘旧任务 一个网络学会区分数字 0 和 1,接着学习 2 和 3,为什么可能连先前的二分类都不会了?旧数据不能重新拿出来训练时,能否只保存少量参数级信息,就减轻这种遗忘? Synaptic Intelligence(SI,突触智能)的思路是:记录每个参数沿训练轨迹为降低损失做了多少贡献,之后对重要参数的改变施加更强约束。 网络不是全部冻结,而是尽量利用对旧任务不重要的参数学习新任务。 本文精读 Contin 2026-09-08 持续学习与自进化 #Continual Learning #Synaptic Intelligence #灾难性遗忘 #参数正则化 #EWC
从 CPT 到 Agentic CPT:大语言模型持续预训练研究综述 持续预训练如何改变模型的知识、能力与后训练起点?本文沿着数据、优化与评估三条线,整理 12 篇论文与技术报告,梳理从领域适配到 Hephaestus、AgentFounder 和 SPT 的研究脉络。 检索截至 2026 年 9 月 8 日。文中区分论文结果、研究判断与教学示例,附一手来源链接。 关于 FAS、HAS 与训练流程的更详细分析,可继续阅读本站的 AgentFounder 精读。 2026-09-08 基础模型与后训练 #AgentFounder #Continual Pre-training #数据合成 #工具使用 #LLM #Agentic CPT
AgentFounder:用继续预训练扩展 Agent 能力,FAS 与 HAS 如何把经验变成训练数据 如果训练 Agent 总要在线搜索、访问网页、执行代码,再筛选少量成功轨迹,数据规模很快就会被环境调用成本卡住。那些没有完成任务的轨迹,以及海量没有“行动格式”的网页知识,能不能也用来训练 Agent? AgentFounder 的答案是:先把它们改造成适合继续预训练的数据,让基座提前接触行动、决策与反馈,再做下游 SFT。 它的重点不是新的奖励函数,而是如何低成本扩大 Agent 训练数据,以及 2026-09-08 基础模型与后训练 #AgentFounder #Continual Pre-training #数据合成 #Deep Research #工具使用 #长程推理