共计 66 篇文章
2026
TTPO:多数票不可靠时,如何在测试阶段继续训练模型?
论文精读|Code as Worlds:让 Agent 用可执行代码反推物理世界
Training Needs Trustworthy Worlds:先验证合成网站,再让 Web Agent 学习
Test-Time RL 全景:让模型在“考试时”用自己的答案继续学习
Bridging the Agent-World Gap:LLM Agent 文本世界模型全景综述
From Word to World:LLM 能否成为 Agent 的文本世界模型?
SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO
主流基座模型技术报告横评:从 DeepSeek-V3 到 Kimi K3,两年里基模卷了什么
VC-PPO 详解:PPO 在长 CoT 上为什么崩?价值优化才是命门
论文精读|Neural Computers:把计算、内存与 I/O 压进一个学出来的 runtime