PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界 一个 Agent 知道每条合成配方,为什么还是做不完长任务?一个教师自己能拿满分,为什么蒸馏反而损害学生?三个领域专家依次教同一个学生,什么时候会发生知识迁移,什么时候又会互相覆盖? PlanPhys 用从零训练的小模型和完全可控的合成环境,把这三个问题放到同一套实验中。它最重要的区分是:具体的规划知识,与可复用的规划方式,并不是同一种能力;预训练、OPD 和 MOPD 对它们的作用也不同。 本文 2026-09-07 Long Horizon #Long-Horizon Agent #GRPO #世界模型 #预训练 #On-Policy Distillation #MOPD #组合泛化
Long-Horizon Agent 训练论文地图:20 篇工作、七条路线与一个完整训练例子 Long-horizon 不只是把上下文窗口扩大,也不只是让 Agent 多运行一会儿。真正需要训练的问题是:模型能否从有限的成功和大量的失败中,学会持续规划、正确执行、保存关键信息,并在偏离目标后恢复? 这篇文章整理 20 篇涉及模型参数更新的代表性论文,按训练对象和训练信号分成七条路线:能力底座、失败轨迹学习、课程与跨度缩减、层次策略、局部信用分配、记忆训练,以及训练系统。重点是 LLM Ag 2026-09-07 Long Horizon #Agentic RL #Long-Horizon Agent #信用分配 #论文综述 #监督微调 #课程学习 #记忆训练
长程 Agent 为什么越训越差?Horizon Length 实证研究与两种缩短训练跨度的方法 一道题所需的解题规则没有变,只是必须连续操作更多次,RL 训练就可能从稳定进步变成崩溃。这篇论文通过数独和 Rush Hour 的受控实验研究这个问题,并验证两种办法:让一次决策执行多个底层动作,以及在可验证的子目标处切断回报计算。两者都能缩短训练需要处理的有效跨度。 本文精读 On Training Large Language Models for Long-Horizon Tasks: An 2026-09-07 Long Horizon #Agentic RL #Long-Horizon Agent #信用分配 #课程学习 #宏动作 #REINFORCE #ICML 2026
SMOPD 深度解读:多奖励强化学习的“先专门化,再蒸馏合并” 大模型后训练经常同时优化多个目标:工具调用既要选对函数和参数,也要满足严格格式;对话模型既要 helpful,也要 harmless。一个自然做法是把多个 reward 加权求和,但当 reward 的密度不同,逐维归一化仍然可能失败:dense reward 几乎每组都有排序信号,binary sparse reward 却经常整组相同,根本没有可用 advantage。 本文精读 SMOPD: 2026-09-07 MOPD #LLM #GRPO #SMOPD #GDPO #On-Policy-Distillation #多奖励优化
从“会回答”到“会预演”:2026 年大语言模型世界模型的主流范式与前沿进展 写在前面 “世界模型”正在成为 2026 年 LLM Agent 研究中最拥挤、也最容易被泛化使用的概念之一。有人用它指视频生成器,有人用它指机器人动力学模型,也有人只要发现 LLM 能表示地图、规则或物体关系,就称模型“拥有世界模型”。这些工作彼此相关,但如果讨论的是大语言模型 Agent,真正有操作性的定义应该更严格: 给定 Agent 当前可见的状态或交互历史 \(h_t\),以及候选动作 2026-09-01 世界模型 #AI Agent #LLM #world model #text world model #model-based reinforcement learning
2026 年大模型 PPO:前沿进展、主流范式与论文地图 更新日期:2026-09-07 关键词:PPO、RLHF、RLVR、GRPO、Critic、Trust Region、LLM Agent、Long-Horizon、Turn/Step-Level Credit Assignment 写在前面 如果只看算法名称,2026 年的大模型强化学习似乎已经从 PPO 转向了 GRPO、DAPO、GSPO 和各种 -PO。但从目标函数看,事情并没有这么简单 2026-09-01 Long Horizon #LLM #PPO #GRPO #RLVR #Agent #RLHF #Credit Assignment #Long-Horizon
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题 写在前面 当 Agent 要连续搜索几十轮、修改代码、读报错、管理记忆,甚至跨多个环境工作时,人们常把失败统一归因于“奖励太稀疏”。这只说对了一部分。 Long-horizon Agentic RL 与细粒度奖励其实是两个不同问题: Long horizon 问的是:怎样让 Agent 在很长、部分可观测、可能中途失败的轨迹中,仍能探索到成功、维持任务状态、执行分层计划并恢复错误; 细粒度奖励与 2026-09-01 Long Horizon #强化学习 #Agentic RL #Long-Horizon Agent #PPO #GRPO #信用分配 #细粒度奖励 #奖励塑形
AI 能否用自己的数据训练自己?从 NEON 到潜在能力再浮现 生成式 AI 面临一个越来越现实的瓶颈:高质量真实数据有限,而互联网中的合成内容越来越多。既然模型可以廉价地产生海量文本和图像,一个自然的问题是:模型能不能用自己生成的数据继续训练自己? 朴素答案通常是否定的。模型反复学习自己的输出,会强化已有偏差、丢失长尾模式,最终发生模型崩塌。但 ICLR 2026 的 NEON 论文给出了一个反直觉思路:既然自训练造成的退化具有方向,就沿这个方向反着走。随后 2026-09-01 持续学习与自进化 #LLM #synthetic data #model collapse #self-training #ICLR 2026
从静态大模型到终身智能体:LLM 持续学习与持续强化学习的主流范式 写在前面 今天的大语言模型大多仍然是“训练一次、部署一段时间、再离线升级一次”的静态系统。它们可以在上下文中临时适应新任务,也可以通过搜索、RAG 和工具调用获取新信息,但一旦会话结束,这些经验通常不会自动沉淀为以后可复用的能力。 持续学习(Continual Learning, CL)试图改变这一点:让模型面对持续到来的知识、任务、偏好和环境变化时,既能学会新东西,又不轻易遗忘旧能力。持续强化学 2026-09-01 持续学习与自进化 #AI Agent #LLM #continual learning #continual reinforcement learning #curriculum learning
从 LLM 到 VLA:机器人如何把语言模型接到动作空间|相关工作与主流范式 一句话结论:VLA 与大语言模型的结合并不是“给 LLM 接一只机械臂”这么简单。真正的技术分水岭,是语言模型负责到哪一层、动作如何表示、语义推理与高频控制怎样解耦,以及模型能否在真实世界的闭环反馈中持续纠错。 截至 2026 年,主流路线可以归纳为四类:LLM 做高层规划器、VLM/LLM 直接生成离散动作、语言视觉主干连接连续动作专家、快慢双系统协同控制。它们不是互斥替代关系,而是越来越多地被 2026-09-01 具身智能 #LLM #VLA #具身智能 #flow matching #机器人学习 #多模态