共计 39 篇文章
2026
从 VLA 到 WAM:具身基础模型的代表方法,以及与 LLM、推理和强化学习的交叉
从 CPT 到 Agentic CPT:大语言模型持续预训练研究综述
SMOPD 深度解读:多奖励强化学习的“先专门化,再蒸馏合并”
从“会回答”到“会预演”:2026 年大语言模型世界模型的主流范式与前沿进展
2026 年大模型 PPO:前沿进展、主流范式与论文地图
AI 能否用自己的数据训练自己?从 NEON 到潜在能力再浮现
从静态大模型到终身智能体:LLM 持续学习与持续强化学习的主流范式
从 LLM 到 VLA:机器人如何把语言模型接到动作空间|相关工作与主流范式
TTPO:多数票不可靠时,如何在测试阶段继续训练模型?
Training Needs Trustworthy Worlds:先验证合成网站,再让 Web Agent 学习