DYcoder
  • 首页
  • 归档
  • 分类
  • 标签
  • 关于
  • LeetCode
首页
归档
分类
标签
关于
LeetCode
搜索
关灯

共计 27 篇文章


2026

09-01
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
08-31
Test-Time RL 全景:让模型在“考试时”用自己的答案继续学习
08-27
主流基座模型技术报告横评:从 DeepSeek-V3 到 Kimi K3,两年里基模卷了什么
08-27
VC-PPO 详解:PPO 在长 CoT 上为什么崩?价值优化才是命门
08-21
Agentic-R:为 agentic search 训练检索器,用全局答案正确性反传
08-21
ICSD:当"老师可信"不等于"听老师的话有用"——给 On-Policy Self-Distillation 装上影响力校准
08-20
EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权
08-20
TRIAGE:给 Agent 动作标注语义角色——修正成功中的倒退与失败中的探索
08-20
Success Visitation Matching:用成功/失败访问比把稀疏奖励变成稠密过程奖励
08-20
G2PO:把多条 Agent 轨迹合成状态图——用全局边增益分配长程信用
123

搜索

Hexo Fluid