共计 39 篇文章
2026
Test-Time RL 全景:让模型在“考试时”用自己的答案继续学习
From Word to World:LLM 能否成为 Agent 的文本世界模型?
SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO
主流基座模型技术报告横评:从 DeepSeek-V3 到 Kimi K3,两年里基模卷了什么
VC-PPO 详解:PPO 在长 CoT 上为什么崩?价值优化才是命门
Environment-free:让 LLM 当世界模型,零执行环境造 API 调用轨迹
ScaleEnv:从零合成全交互环境,靠工具依赖图保证可解
综述:Agentic 环境工程——建模、合成、评测与共演化的全生命周期
EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权
TRIAGE:给 Agent 动作标注语义角色——修正成功中的倒退与失败中的探索