共计 7 篇文章
2026
从 VLA 到 WAM:具身基础模型的代表方法,以及与 LLM、推理和强化学习的交叉
Long-Horizon Agent 训练论文地图:20 篇工作、七条路线与一个完整训练例子
长程 Agent 为什么越训越差?Horizon Length 实证研究与两种缩短训练跨度的方法
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
ICSD:当"老师可信"不等于"听老师的话有用"——给 On-Policy Self-Distillation 装上影响力校准
论文精读|Kimi K3 后训练阶段详解:三阶段范式与多领域强化学习
论文速读|OpenClaw-RL:用对话训练任意 AI 智能体