DYcoder
  • 首页
  • 归档
  • 分类
  • 标签
  • 关于
  • LeetCode
首页
归档
分类
标签
关于
LeetCode
搜索
关灯
Long Horizon 14
技术报告解读|GPT-6 Astra:长程 Agent、对齐泛化与可监测性的矛盾 SOPD:不接管学生轨迹,如何用完整步骤修复 OPD 的碎片化监督? RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化 从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界 Long-Horizon Agent 训练论文地图:20 篇工作、七条路线与一个完整训练例子 长程 Agent 为什么越训越差?Horizon Length 实证研究与两种缩短训练跨度的方法 2026 年大模型 PPO:前沿进展、主流范式与论文地图 2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题 EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权 More...
信用分配 14
从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon 2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题 SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权 TRIAGE:给 Agent 动作标注语义角色——修正成功中的倒退与失败中的探索 Success Visitation Matching:用成功/失败访问比把稀疏奖励变成稠密过程奖励 G2PO:把多条 Agent 轨迹合成状态图——用全局边增益分配长程信用 VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配 FlowTracer:把注意力变成守恒信息流——定位通向答案的 token 推理骨干 Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token More...
基础模型与后训练 9
技术报告解读|GPT-6 Astra:长程 Agent、对齐泛化与可监测性的矛盾 从 CPT 到 Agentic CPT:大语言模型持续预训练研究综述 AgentFounder:用继续预训练扩展 Agent 能力,FAS 与 HAS 如何把经验变成训练数据 主流基座模型技术报告横评:从 DeepSeek-V3 到 Kimi K3,两年里基模卷了什么 论文精读|GLM-5.3:纯后训练 scaling 带来的涌现网络安全能力 论文精读|GLM-4.5 后训练阶段详解:专家模型迭代与混合推理 论文精读|Kimi K3 后训练阶段详解:三阶段范式与多领域强化学习 Neural Thickets:预训练权重周围密集的任务专家 基模全流程:预处理、训练与推理使用
Agentic 数据合成与环境合成 9
从 CPT 到 Agentic CPT:大语言模型持续预训练研究综述 AgentFounder:用继续预训练扩展 Agent 能力,FAS 与 HAS 如何把经验变成训练数据 Training Needs Trustworthy Worlds:先验证合成网站,再让 Web Agent 学习 AgentInstruct (Orca-3):用 agentic 流做生成式教学,25M 对合成数据 ToolACE:工具调用数据的自演化合成与双层验证 AgentOmnia:双向环境-任务合成 + PRD 自演化,全场景 agentic scaling Environment-free:让 LLM 当世界模型,零执行环境造 API 调用轨迹 ScaleEnv:从零合成全交互环境,靠工具依赖图保证可解 综述:Agentic 环境工程——建模、合成、评测与共演化的全生命周期
世界模型 7
从 VLA 到 WAM:具身基础模型的代表方法,以及与 LLM、推理和强化学习的交叉 从“会回答”到“会预演”:2026 年大语言模型世界模型的主流范式与前沿进展 论文精读|Code as Worlds:让 Agent 用可执行代码反推物理世界 Bridging the Agent-World Gap:LLM Agent 文本世界模型全景综述 From Word to World:LLM 能否成为 Agent 的文本世界模型? 论文精读|Neural Computers:把计算、内存与 I/O 压进一个学出来的 runtime Environment-free:让 LLM 当世界模型,零执行环境造 API 调用轨迹
OPD 7
DASH:自蒸馏如何利用分歧序列调整监督权重?从反向递推到真实梯度 SOPD:不接管学生轨迹,如何用完整步骤修复 OPD 的碎片化监督? OPDVR:用答案正确性过滤蒸馏信号,如何把 OPD 与可验证奖励结合? ICSD:当"老师可信"不等于"听老师的话有用"——给 On-Policy Self-Distillation 装上影响力校准 PowerOPD:用有界幂变换稳定 On-Policy Distillation SimpleOPD:跨tokenizer的长上下文推理蒸馏方法 On-Policy Distillation:让学生在自己的轨迹上向老师学习
多源奖励信号 6
OPDVR:用答案正确性过滤蒸馏信号,如何把 OPD 与可验证奖励结合? SMOPD 深度解读:多奖励强化学习的“先专门化,再蒸馏合并” 2026 年大模型 PPO:前沿进展、主流范式与论文地图 EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权 TRIAGE:给 Agent 动作标注语义角色——修正成功中的倒退与失败中的探索 论文速读|OpenClaw-RL:用对话训练任意 AI 智能体
Agentic RL 5
RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化 Agentic-R:为 agentic search 训练检索器,用全局答案正确性反传 SAO: 面向智能体强化学习的单轨迹异步优化 论文速读|Youtu-Agent:自动化构建 + 混合策略优化的 LLM 智能体框架 论文速读|OpenClaw-RL:用对话训练任意 AI 智能体
强化学习 4
2026 年大模型 PPO:前沿进展、主流范式与论文地图 VC-PPO 详解:PPO 在长 CoT 上为什么崩?价值优化才是命门 GRPO 去掉 Critic Model 会带来哪些问题? DAPO 与 GSPO 相对于 GRPO 的改进
持续学习与自进化 4
Synaptic Intelligence:沿训练轨迹衡量参数重要性,让神经网络少忘旧任务 AI 能否用自己的数据训练自己?从 NEON 到潜在能力再浮现 从静态大模型到终身智能体:LLM 持续学习与持续强化学习的主流范式 论文速读|MetaClaw:让 AI 智能体在生产环境中持续进化
MOPD 4
PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界 SMOPD 深度解读:多奖励强化学习的“先专门化,再蒸馏合并” Open-MOPD:诊断并修复多教师 On-Policy 蒸馏中的能力失衡 论文精读|Kimi K3 后训练阶段详解:三阶段范式与多领域强化学习
Agent 工程与工具 2
12-Factor Agents:构建可靠 LLM Agent 的十二条原则 Claude Code 国内使用指南
Test-Time RL 2
TTPO:多数票不可靠时,如何在测试阶段继续训练模型? Test-Time RL 全景:让模型在“考试时”用自己的答案继续学习
具身智能 2
从 VLA 到 WAM:具身基础模型的代表方法,以及与 LLM、推理和强化学习的交叉 从 LLM 到 VLA:机器人如何把语言模型接到动作空间|相关工作与主流范式

搜索

Hexo Fluid