SAO: 面向智能体强化学习的单轨迹异步优化 论文: Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning 作者: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong (智源研究院/清华) arXiv: 2607.07508 背景与挑战 在大语言模型(LLM)的后训练阶段,强化学习(RL)已成为提升模型 2026-08-18 Agentic RL #LLM #强化学习 #智能体 #基模后训练 #异步训练
论文精读|GLM-5.3:纯后训练 scaling 带来的涌现网络安全能力 原论文:GLM-5.3: Frontier Coding with Emergent Cyber Capabilities 作者:Z.ai(智谱AI团队) 发布时间:2026 年 8 月 2026-08-18 基础模型与后训练 #强化学习 #后训练 #RL #GLM-5.3 #代码生成 #网络安全 #智能体 #slime #长程任务
PowerOPD:用有界幂变换稳定 On-Policy Distillation On-Policy Distillation(OPD)通过让学生模型在自己的生成轨迹上向教师学习,有效缓解了传统离线蒸馏的曝光偏差问题。然而,标准 OPD 使用 log-ratio 作为奖励信号,这一看似自然的构造却隐藏着严重的训练不稳定性——梯度方差爆炸。 来自 Sea AI Lab 和西湖大学的研究团队提出 PowerOPD,通过 Box-Cox 幂变换将有界性内建到奖励设计中,从根本上解决了 2026-08-18 OPD #LLM #强化学习 #知识蒸馏 #On-Policy Distillation #方差缩减
SimpleOPD:跨tokenizer的长上下文推理蒸馏方法 SimpleOPD 提出了一种tokenizer无关的 on-policy 蒸馏框架,成功将长上下文推理教师模型 SU-01(30B-A3B,IMO 金牌级数学能力)的推理能力迁移到短上下文学生模型,在 Intern-S2-Preview 上实现了 ProofBench 21.2 分的提升,超越 Gemini-2.5-Pro。 2026-08-18 OPD #知识蒸馏 #长上下文 #推理模型 #OPD #Tokenizer
论文精读|GLM-4.5 后训练阶段详解:专家模型迭代与混合推理 原论文:GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models 作者:GLM-4.5 Team(智谱AI团队,共170位作者) 发布时间:2025 年 8 月 2026-08-17 基础模型与后训练 #强化学习 #GLM-4.5 #后训练 #RL #SFT #专家模型迭代 #混合推理
论文精读|Kimi K3 后训练阶段详解:三阶段范式与多领域强化学习 原论文:Kimi K3: Open Frontier Intelligence 作者:Kimi Team 发布时间:2026 年 7 月 2026-08-17 基础模型与后训练 #强化学习 #Agentic RL #后训练 #RL #SFT #Kimi K3 #MOPD
Neural Thickets:预训练权重周围密集的任务专家 论文: Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights 作者: Yulu Gan, Phillip Isola (MIT) arXiv: 2603.12228 代码: https://github.com/sunrainyg/RandOpt 传统的后训练(Post-Training)方法——无论 2026-08-17 基础模型与后训练 #LLM #PPO #GRPO #RL #Post-Training #Scaling Law
On-Policy Distillation:让学生在自己的轨迹上向老师学习 On-Policy Distillation(OPD)正在成为 LLM 后训练的核心范式之一。Qwen3、MiMo、GLM-5 等主流模型都已将其纳入后训练流水线,而 2026 年 4 月密集发布的综述和分析论文,则标志着这个领域从”散点式探索”走向系统化成熟。 本文基于以下几篇代表性工作,系统梳理 OPD 的核心思路、方法分类、机制分析和实践建议: - A Survey of On-Policy 2026-04-21 OPD #LLM #强化学习 #RLHF #知识蒸馏 #模型压缩
12-Factor Agents:构建可靠 LLM Agent 的十二条原则 12-Factor Agents 是 HumanLayer 的 Dex Horthy 发起的一个开源项目,灵感来自经典的 12-Factor App 方法论,专注于为构建生产级 LLM Agent 提供可落地的工程原则。 这套框架的核心观点很朴素:大多数成功的 AI 产品并不是”纯 Agentic”的。它们是确定性代码与策略性 LLM 决策点的结合体,而不是把一切都交给 Agent 框架自动运转。 2026-04-14 Agent 工程与工具 #AI Agent #LLM #工程实践 #软件架构 #Prompt Engineering
基模全流程:预处理、训练与推理使用 本文记录基模(Base Model)从原始数据到可用模型的完整流程,涵盖数据预处理、预训练及推理使用三个核心阶段。 2026-04-14 基础模型与后训练 #LLM #基础模型 #数据预处理 #模型训练 #推理