共计 8 篇文章
2026
RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化
2026 年大模型 PPO:前沿进展、主流范式与论文地图
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
Training Needs Trustworthy Worlds:先验证合成网站,再让 Web Agent 学习
SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO
VC-PPO 详解:PPO 在长 CoT 上为什么崩?价值优化才是命门
Neural Thickets:预训练权重周围密集的任务专家
GRPO 去掉 Critic Model 会带来哪些问题?