DYcoder
  • 首页
  • 归档
  • 分类
  • 标签
  • 关于
  • LeetCode
首页
归档
分类
标签
关于
LeetCode
搜索
关灯

共计 14 篇文章


2026

09-08
从早期深度学习寻找新思路:12 篇论文看 LLM 稀疏奖励与 Long Horizon
09-01
2026 Long-Horizon Agentic RL 与细粒度奖励:两条主线、一个交叉问题
08-31
SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO
08-20
EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权
08-20
TRIAGE:给 Agent 动作标注语义角色——修正成功中的倒退与失败中的探索
08-20
Success Visitation Matching:用成功/失败访问比把稀疏奖励变成稠密过程奖励
08-20
G2PO:把多条 Agent 轨迹合成状态图——用全局边增益分配长程信用
08-20
VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配
08-20
FlowTracer:把注意力变成守恒信息流——定位通向答案的 token 推理骨干
08-20
Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token
12

搜索

Hexo Fluid