DYcoder
  • 首页
  • 归档
  • 分类
  • 标签
  • 关于
  • LeetCode
首页
归档
分类
标签
关于
LeetCode
搜索
关灯

共计 11 篇文章


2026

09-10
RAGEN:多轮 Agent RL 为什么会崩溃?StarPO、Echo Trap 与推理退化
09-08
OPDVR:用答案正确性过滤蒸馏信号,如何把 OPD 与可验证奖励结合?
09-07
PlanPhys:长程规划从哪里来?预训练、OPD 与多教师蒸馏的能力边界
09-07
SMOPD 深度解读:多奖励强化学习的“先专门化,再蒸馏合并”
09-01
2026 年大模型 PPO:前沿进展、主流范式与论文地图
09-01
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
09-01
TTPO:多数票不可靠时,如何在测试阶段继续训练模型?
08-20
HCAPO:用结局反看关键动作——长程 LLM Agent 的事后信用分配
08-17
Neural Thickets:预训练权重周围密集的任务专家
04-14
论文速读|Youtu-Agent:自动化构建 + 混合策略优化的 LLM 智能体框架
12

搜索

Hexo Fluid