TTPO:多数票不可靠时,如何在测试阶段继续训练模型? 一句话结论:TTPO 不把多数票伪标签当成真值,而只把它当作“训练信号路由器”:与多数答案一致的 rollout 用 On-Policy Self-Distillation(OPSD)学习细粒度 token 分布,与多数答案不一致的 rollout 用 Grouped RL 做选择性惩罚。这个不对称设计把错误伪标签的影响限制在较小范围内,让模型能直接在无标注测试题上继续训练。 论文:TTPO: T 2026-09-01 Test-Time RL #LLM #GRPO #OPSD #Test-Time RL #Test-Time Training #自蒸馏
论文精读|Code as Worlds:让 Agent 用可执行代码反推物理世界 原论文:Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning 作者:Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo 2026-09-01 世界模型 #世界模型 #物理推理 #可执行代码 #Agentic Discovery #VLM
Training Needs Trustworthy Worlds:先验证合成网站,再让 Web Agent 学习 一句话结论:训练 Web Agent 的关键不是让合成网页“看起来像真的”,而是保证任务在一致的后端状态中确实可完成。本文把页面、导航、数据库、状态变更 marker 和任务约束组成可审计 scaffold,经符号检查、多 agent 验证和定向修复后,再用后端谓词生成稠密奖励训练 PPO。任务可行率由 48.6% 提升到 94.8%,最终小于 10M 参数的策略无需在评测时调用 LLM。 论文信 2026-09-01 Agentic 数据合成与环境合成 #LLM #environment synthesis #PPO #web agent #verified environment
Test-Time RL 全景:让模型在“考试时”用自己的答案继续学习 一句话结论:Test-Time Reinforcement Learning(TTRL,测试时强化学习)让模型在没有测试标签的情况下,对测试问题多次采样,用多数投票、置信度或外部工具构造伪奖励,再通过 RL 更新模型参数。它的核心能力是把预训练模型“已经会、但不稳定”的知识压到更高概率;它的核心风险也来自同一机制——如果初始偏好是错的,RL 会把错误共识越练越自信。 本文聚焦 2025 年以来 L 2026-08-31 Test-Time RL #LLM #survey #强化学习 #Test-Time RL #Test-Time Training
Bridging the Agent-World Gap:LLM Agent 文本世界模型全景综述 一句话结论:文本世界模型的本质是“给定状态与候选动作,预测动作发生后的文本状态”。这篇综述用“表示形式 × grounding domain”描述它是什么,再用“构建 → 训练时使用 → 推理时使用 → 评价”的生命周期解释它如何进入 agent 系统,从而把网页、代码、工具、用户模拟和规划研究放进同一张地图。 论文信息 标题:Bridging the Agent-World Gap: Text 2026-08-31 世界模型 #AI Agent #environment synthesis #survey #text world model #planning
From Word to World:LLM 能否成为 Agent 的文本世界模型? 一句话结论:经过足量、覆盖多种行为的轨迹微调后,LLM 可以在结构化文本环境中充当高保真的下一状态预测器,并用于动作验证、合成经验和 RL warm-start;但这种能力高度依赖环境复杂度、行为覆盖与真实观测锚定,在 WebShop 等开放环境中仍存在明显模拟漂移。 论文信息 标题:From Word to World: Can Large Language Models be Implici 2026-08-31 世界模型 #LLM #agentic RL #synthetic data #text world model #environment simulation
SPPO:把长程推理折叠成序列级上下文赌博机,单样本也能稳定做 PPO 一句话结论:SPPO 不再要求 critic 给几千个推理 token 分别估值,而是把“prompt → 完整回复 → 终局奖励”看成一步上下文赌博机,只预测题目本身的可解概率,再把同一个序列级优势广播给整条回复。它以单条采样保留 PPO 的样本效率,在论文实验中超过标准 PPO,并以约 5.9 倍训练加速达到 GRPO 的峰值表现。 论文信息 标题:SPPO: Sequence-Level 2026-08-31 信用分配 #长程推理 #LLM #PPO #credit assignment #RLVR
主流基座模型技术报告横评:从 DeepSeek-V3 到 Kimi K3,两年里基模卷了什么 过去两年,开源基座模型经历了一轮疯狂的迭代:2024 年底 DeepSeek-V3 用 557 万美元的训练成本震惊业界,2025 年 R1 带火了 RL 推理范式,Qwen3 / Kimi K2 / GLM-4.5 / GPT-OSS 密集发布;进入 2026 年,Kimi K3、DeepSeek-V4、MiniMax M3 又把总参数量推到万亿级、上下文推到百万 token。 这篇文章把有正式 2026-08-27 基础模型与后训练 #LLM #强化学习 #基座模型 #技术报告 #MoE #预训练
VC-PPO 详解:PPO 在长 CoT 上为什么崩?价值优化才是命门 2024 年底到 2025 年,DeepSeek-R1 带火了”用 RL 训练长思维链(Long CoT)“这条路线。当时社区里一个流行的印象是:PPO 在长 CoT 任务上不行了,GRPO 才是正解——GRPO 直接砍掉 critic,用组内相对奖励当优势,简单稳定,效果还好。 字节 Seed 团队 2025 年 3 月的这篇论文(也是 DAPO 同一拨人)提出了一个不同的诊断:PPO 不是不行 2026-08-27 强化学习 #LLM #强化学习 #PPO #RLVR #value function
论文精读|Neural Computers:把计算、内存与 I/O 压进一个学出来的 runtime 原论文:Neural Computers 作者:Mingchen Zhuge, Changsheng Zhao, Haozhe Liu, Zijian Zhou, Shuming Liu, Wenyi Wang, Ernie Chang, Gael Le Lan, Junjie Fei, Wenxuan Zhang, Yasheng Sun, Zhipeng Cai, Zechun Liu, Y 2026-08-21 世界模型 #世界模型 #智能体 #Neural Computer #Video Model #World Model #计算范式 #rollout #Schmidhuber