共计 14 篇文章
2026
技术报告解读|GPT-6 Astra:长程 Agent、对齐泛化与可监测性的矛盾
SOPD:不接管学生轨迹,如何用完整步骤修复 OPD 的碎片化监督?
RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化
从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon
PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界
Long-Horizon Agent 训练论文地图:20 篇工作、七条路线与一个完整训练例子
长程 Agent 为什么越训越差?Horizon Length 实证研究与两种缩短训练跨度的方法
2026 年大模型 PPO:前沿进展、主流范式与论文地图
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权