共计 66 篇文章
2026
SAO: 面向智能体强化学习的单轨迹异步优化
论文精读|GLM-5.3:纯后训练 scaling 带来的涌现网络安全能力
PowerOPD:用有界幂变换稳定 On-Policy Distillation
SimpleOPD:跨tokenizer的长上下文推理蒸馏方法
论文精读|GLM-4.5 后训练阶段详解:专家模型迭代与混合推理
论文精读|Kimi K3 后训练阶段详解:三阶段范式与多领域强化学习
Neural Thickets:预训练权重周围密集的任务专家
On-Policy Distillation:让学生在自己的轨迹上向老师学习
12-Factor Agents:构建可靠 LLM Agent 的十二条原则
基模全流程:预处理、训练与推理使用