共计 66 篇文章
2026
技术报告解读|GPT-6 Astra:长程 Agent、对齐泛化与可监测性的矛盾
从 VLA 到 WAM:具身基础模型的代表方法,以及与 LLM、推理和强化学习的交叉
DASH:自蒸馏如何利用分歧序列调整监督权重?从反向递推到真实梯度
SOPD:不接管学生轨迹,如何用完整步骤修复 OPD 的碎片化监督?
RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化
从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon
OPDVR:用答案正确性过滤蒸馏信号,如何把 OPD 与可验证奖励结合?
Synaptic Intelligence:沿训练轨迹衡量参数重要性,让神经网络少忘旧任务
从 CPT 到 Agentic CPT:大语言模型持续预训练研究综述
AgentFounder:用继续预训练扩展 Agent 能力,FAS 与 HAS 如何把经验变成训练数据