Long Horizon
14
技术报告解读|GPT-6 Astra:长程 Agent、对齐泛化与可监测性的矛盾
SOPD:不接管学生轨迹,如何用完整步骤修复 OPD 的碎片化监督?
RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化
从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon
PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界
Long-Horizon Agent 训练论文地图:20 篇工作、七条路线与一个完整训练例子
长程 Agent 为什么越训越差?Horizon Length 实证研究与两种缩短训练跨度的方法
2026 年大模型 PPO:前沿进展、主流范式与论文地图
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权
More...
信用分配
14
从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO
EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权
TRIAGE:给 Agent 动作标注语义角色——修正成功中的倒退与失败中的探索
Success Visitation Matching:用成功/失败访问比把稀疏奖励变成稠密过程奖励
G2PO:把多条 Agent 轨迹合成状态图——用全局边增益分配长程信用
VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配
FlowTracer:把注意力变成守恒信息流——定位通向答案的 token 推理骨干
Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token
More...
基础模型与后训练
9
技术报告解读|GPT-6 Astra:长程 Agent、对齐泛化与可监测性的矛盾
从 CPT 到 Agentic CPT:大语言模型持续预训练研究综述
AgentFounder:用继续预训练扩展 Agent 能力,FAS 与 HAS 如何把经验变成训练数据
主流基座模型技术报告横评:从 DeepSeek-V3 到 Kimi K3,两年里基模卷了什么
论文精读|GLM-5.3:纯后训练 scaling 带来的涌现网络安全能力
论文精读|GLM-4.5 后训练阶段详解:专家模型迭代与混合推理
论文精读|Kimi K3 后训练阶段详解:三阶段范式与多领域强化学习
Neural Thickets:预训练权重周围密集的任务专家
基模全流程:预处理、训练与推理使用
Agentic 数据合成与环境合成
9
从 CPT 到 Agentic CPT:大语言模型持续预训练研究综述
AgentFounder:用继续预训练扩展 Agent 能力,FAS 与 HAS 如何把经验变成训练数据
Training Needs Trustworthy Worlds:先验证合成网站,再让 Web Agent 学习
AgentInstruct (Orca-3):用 agentic 流做生成式教学,25M 对合成数据
ToolACE:工具调用数据的自演化合成与双层验证
AgentOmnia:双向环境-任务合成 + PRD 自演化,全场景 agentic scaling
Environment-free:让 LLM 当世界模型,零执行环境造 API 调用轨迹
ScaleEnv:从零合成全交互环境,靠工具依赖图保证可解
综述:Agentic 环境工程——建模、合成、评测与共演化的全生命周期
世界模型
7
从 VLA 到 WAM:具身基础模型的代表方法,以及与 LLM、推理和强化学习的交叉
从“会回答”到“会预演”:2026 年大语言模型世界模型的主流范式与前沿进展
论文精读|Code as Worlds:让 Agent 用可执行代码反推物理世界
Bridging the Agent-World Gap:LLM Agent 文本世界模型全景综述
From Word to World:LLM 能否成为 Agent 的文本世界模型?
论文精读|Neural Computers:把计算、内存与 I/O 压进一个学出来的 runtime
Environment-free:让 LLM 当世界模型,零执行环境造 API 调用轨迹