共计 9 篇文章
2026
From Word to World:LLM 能否成为 Agent 的文本世界模型?
AgentOmnia:双向环境-任务合成 + PRD 自演化,全场景 agentic scaling
ScaleEnv:从零合成全交互环境,靠工具依赖图保证可解
综述:Agentic 环境工程——建模、合成、评测与共演化的全生命周期
EFCA:把环境反馈变成多时间尺度信用——长程 Agent 的轻量 return 重加权
TRIAGE:给 Agent 动作标注语义角色——修正成功中的倒退与失败中的探索
G2PO:把多条 Agent 轨迹合成状态图——用全局边增益分配长程信用
综述|From Reasoning to Agentic:LLM 强化学习信用分配的统一地图与识别边界
HCAPO:用结局反看关键动作——长程 LLM Agent 的事后信用分配