共计 11 篇文章
2026
RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化
OPDVR:用答案正确性过滤蒸馏信号,如何把 OPD 与可验证奖励结合?
PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界
SMOPD 深度解读:多奖励强化学习的“先专门化,再蒸馏合并”
2026 年大模型 PPO:前沿进展、主流范式与论文地图
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
TTPO:多数票不可靠时,如何在测试阶段继续训练模型?
HCAPO:用结局反看关键动作——长程 LLM Agent 的事后信用分配
Neural Thickets:预训练权重周围密集的任务专家
论文速读|Youtu-Agent:自动化构建 + 混合策略优化的 LLM 智能体框架