共计 39 篇文章
2026
PowerOPD:用有界幂变换稳定 On-Policy Distillation
Neural Thickets:预训练权重周围密集的任务专家
On-Policy Distillation:让学生在自己的轨迹上向老师学习
12-Factor Agents:构建可靠 LLM Agent 的十二条原则
基模全流程:预处理、训练与推理使用
论文速读|MetaClaw:让 AI 智能体在生产环境中持续进化
论文速读|Youtu-Agent:自动化构建 + 混合策略优化的 LLM 智能体框架
论文速读|OpenClaw-RL:用对话训练任意 AI 智能体
GRPO 去掉 Critic Model 会带来哪些问题?