DYcoder
  • 首页
  • 归档
  • 分类
  • 标签
  • 关于
  • LeetCode
首页
归档
分类
标签
关于
LeetCode
搜索
关灯

共计 27 篇文章


2026

08-20
VIMPO:策略本身就是隐式价值函数——无 critic 的 Bellman 信用分配
08-20
Temporal Scheduling for RLVR:信用不只分给谁,还要决定何时纳入哪些 token
08-20
SCRL:从推理链生成可验证子问题——让失败 rollout 也产生细粒度信用
08-20
DelTA:从隐式判别器到 token 级信用分配——方法、公式与完整数值推演
08-20
综述|From Reasoning to Agentic:LLM 强化学习信用分配的统一地图与识别边界
08-20
Open-MOPD:诊断并修复多教师 On-Policy 蒸馏中的能力失衡
08-18
SAO: 面向智能体强化学习的单轨迹异步优化
08-18
论文精读|GLM-5.3:纯后训练 scaling 带来的涌现网络安全能力
08-18
PowerOPD:用有界幂变换稳定 On-Policy Distillation
08-17
论文精读|GLM-4.5 后训练阶段详解:专家模型迭代与混合推理
123

搜索

Hexo Fluid