从“会回答”到“会预演”:2026 年大语言模型世界模型的主流范式与前沿进展

写在前面

“世界模型”正在成为 2026 年 LLM Agent 研究中最拥挤、也最容易被泛化使用的概念之一。有人用它指视频生成器,有人用它指机器人动力学模型,也有人只要发现 LLM 能表示地图、规则或物体关系,就称模型“拥有世界模型”。这些工作彼此相关,但如果讨论的是大语言模型 Agent,真正有操作性的定义应该更严格:

给定 Agent 当前可见的状态或交互历史 \(h_t\),以及候选动作 \(a_t\),模型能够预测动作会让环境发生什么变化,即近似环境的状态转移与观测生成过程。

形式上,可以把它写成:

\[ \hat{o}_{t+1},\hat{r}_t \sim \hat{P}_{\phi}(\cdot\mid h_t,a_t), \]

其中 \(h_t=(o_1,a_1,\ldots,o_t)\)\(o_{t+1}\) 可以是网页变化、终端输出、工具返回、用户响应或文本游戏中的下一状态。模型的价值不在于复述关于世界的知识,而在于回答反事实问题:“如果我现在这样做,接下来会怎样?”

本文检索并核验截至 2026 年 9 月 1 日的相关工作,重点覆盖文本、Web、GUI、工具调用、软件工程和抽象规划环境,不把纯视频生成、自动驾驶或机器人控制论文混入核心清单。2026 年相关 arXiv 检索结果接近 300 篇,严格按上述定义筛选后,本文整理的是其中最能代表方法演进的一组论文,而不是穷尽式目录。多数工作仍是未经同行评议的预印本,文中的数字应理解为各论文在自身设置下的报告结果,不能直接横向排名。

本文的核心判断是:2026 年的关键进展不是“证明 LLM 里存在一个世界模型”,而是把世界模型接入 Agent 的完整闭环——用真实交互学习动作后果,用模型生成想象轨迹,再让策略从想象与真实的差异中更新。当前最有希望的系统是混合式的:神经文本模型负责覆盖开放世界,结构化状态或可执行代码负责一致性,少量真实交互负责校准,策略与世界模型则通过在线数据共同演化。

1. 世界模型与普通语言模型有什么不同

普通语言模型学习的是下一个 token:

\[ p(x_{i+1}\mid x_{\le i}). \]

语言世界模型学习的目标则带有明确的干预条件:

\[ \hat{P}_{\phi}(o_{t+1}\mid h_t,a_t). \]

两者都可以由 Transformer 实现,区别主要在数据、接口和使用方式。世界模型训练样本不是任意文本续写,而是环境中真实发生的 \((h_t,a_t,o_{t+1})\) 转移;推理时也不是只生成听起来合理的回答,而是预测某个动作的后果。

在部分可观测环境中,Agent 看不到真实状态 \(s_t\),只能维护信念状态 \(b_t\)

\[ b_{t+1}=g_{\phi}(b_t,a_t,o_{t+1}), \qquad \hat{o}_{t+1}=f_{\phi}(b_t,a_t). \]

这一区别很重要。网页可能只显示当前页面而隐藏后端数据库;抽屉关闭时,Agent 不知道里面有什么;终端只暴露命令输出而不直接暴露整个操作系统状态。一个实用世界模型必须同时处理“动作如何改变世界”和“Agent 到底知道多少”。

因此,以下三件事不能简单画等号:

能力 它说明什么 它还没有说明什么
LLM 记得世界知识 参数中包含事实与常识 能否预测具体工具或环境的状态转移
探针能解码地图、规则或状态 隐表示中存在相关信息 推理时能否稳定调用这些表示来规划
单步下一状态预测准确 局部动力学拟合良好 多步滚动是否稳定、是否真的改善决策

2026 年的多篇反例论文恰恰表明,世界知识的存在、预测能力和决策能力是三个不同层次。

2. 2026 年代表性论文地图

下面按发布时间列出与 LLM Agent 世界模型直接相关的代表作。分类是本文为了理解技术路线所做的归纳,不是论文作者统一采用的标签。

时间 论文 主要范式 核心问题
1 月 Current Agents Fail to Leverage World Model as Tool for Foresight 推理时模拟器 即使给 Agent 高质量世界模型,它会不会正确调用和利用?
1 月 Aligning Agentic World Models via Knowledgeable Experience Learning 世界模型对齐 如何让模拟经验更贴近目标 Agent 的知识与行为分布?
1 月 World of Workflows 基准与企业环境 如何在企业工作流中评估可交互世界模型?
1 月 DynaWeb Web 文本世界模型 + MBRL 能否用网页状态差分进行想象 rollout 并训练 Web Agent?
2 月 Reinforcement World Model Learning for LLM-based Agents 语义奖励的世界模型 RL 如何绕过 token 级 SFT 的表面措辞和模型坍塌问题?
2 月 Debugging Code World Models 可执行代码世界模型 如何定位并修复由 LLM 合成的转移程序?
2 月 Agent World Model 程序化环境生成 能否大规模生成带数据库、工具与可验证任务的训练环境?
2 月 Affordances Enable Partial World Modeling with LLMs 局部/可供性建模 不恢复完整世界,只建模与当前行动有关的部分是否足够?
2 月 World-Model-Augmented Web Agents with Action Correction 推理时校正 能否用预测后果在提交动作前发现并纠正错误?
5 月 ECHO: Terminal Agents Learn World Models for Free 联合训练 能否直接复用 Agent RL 轨迹,把下一状态预测作为附加监督?
5 月 PatchWorld 可执行信念状态 + 程序修复 能否从离线文本轨迹归纳可检查、可局部修复的 Python 世界模型?
6 月 CoMap 策略—世界模型协同演化 固定世界模型如何跟上不断变化的 on-policy 分布?
6 月 Policy and World Modeling Co-Training for Language Agents 同参数、同阶段联合训练 如何不增加部署成本,把世界建模监督加入常规 Agent RL?
6 月 A Close Look at World Model Recovery in Supervised Fine-Tuned LLM Planners 能力诊断 规划器成功是否真的意味着模型恢复了正确动力学?
6 月 Bridging the Agent-World Gap 综述与分类 如何统一文本世界模型的构造、使用和评估框架?
6 月 Can LLM Agents Infer World Models? 自动机归纳 Agent 能否从交互中识别隐藏状态和转移规则?
6 月 Qwen-AgentWorld 通用语言世界模型 能否跨工具、搜索、代码、终端和 GUI 建立统一下一观测模型?
6 月 Agent vs. Parametric World Models 混合规划 何时信任参数化模拟器,何时让 Agent 自己推演或访问真实环境?
7 月 When a Verified World Model Still Loses 决策导向验证 单步转移近乎全对,为何仍会在规划中系统性失败?
7 月 Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL 扩散式文本世界模型 非自回归生成能否带来更可控的文本环境模拟?
8 月 EnvACE 世界排演与模型内化 能否让同一个策略同时扮演 Agent 和环境?
8 月 Transformers Struggle to Use Their Emergent World Models 机制可解释性 模型是没有学会动力学,还是规划过程中丢失了内部表征?
8 月 How do World Models and Policies Compose in LLM Agents? 参数空间与行为分析 世界知识与策略能力在参数更新中如何组合、冲突和保留?

如果只想先读六篇,我建议从 DynaWeb、Reinforcement World Model Learning、PatchWorld、Qwen-AgentWorld、EnvACE 和 When a Verified World Model Still Loses 开始。它们分别覆盖了文本差分、语义目标、可执行程序、规模化基础模型、世界模型内化和决策导向验证。

3. 主流范式一:LLM 作为参数化文本世界模型

最直接的路线是用真实交互轨迹训练一个条件语言模型:

\[ \mathcal L_{\text{WM}} = -\sum_i \log p_{\phi} \left(o_{t+1}^{(i)}\mid h_t,a_t,o_{t+1}^{(<i)}\right). \]

它的优势是能够处理开放词表、自然语言与异构工具返回,并直接复用 LLM 训练基础设施。主要分成三种预测目标。

3.1 完整下一观测

模型生成完整的下一页面、终端输出、API 返回或用户回复。Qwen-AgentWorld 就采用统一的下一观测接口:

\[ \hat{o}_{t+1}=f_{\theta}(c,o_{\le t},a_{\le t}). \]

论文收集了超过 1000 万条真实环境交互轨迹,覆盖 MCP、Search、SWE、Terminal、Android、Web 和 OS 七个域,并使用 CPT、SFT、RL 三阶段训练。其 AgentWorldBench 包含 2170 个评测样本,按格式、事实性、一致性、真实感和总体质量五个维度评分。

完整观测的好处是可以把预测直接喂回 Agent,形成多步模拟;缺点是输出空间巨大。一个页面只有购物车数字变化,模型却要重新生成整棵页面树,绝大多数 token 都是与动作无关的复制。

3.2 只预测状态差分

DynaWeb 观察到 Web 操作通常只改变页面的一小部分,于是让模型预测:

\[ \Delta_t=\Delta(o_t,o_{t+1}), \qquad \hat{o}_{t+1}=\operatorname{Apply}(o_t,\hat{\Delta}_t). \]

例如点击“加入购物车”后,模型不必重写完整 accessibility tree,只需输出类似“购物车数量从 0 变为 1,按钮状态变为已添加”的差分。这样既降低生成难度,又把监督集中在动作真正引起的变化上。

在论文报告中,DynaWeb-8B 在 WebArena 上达到 31.0% 成功率,高于 WebRL 的 26.7%、Qwen2.5-32B 的 17.3% 和 GPT-4o 的 14.3%。但消融也给出一个重要边界:只用想象轨迹不如监督微调;把约 40% 的真实轨迹混入训练能带来明显提升,随后增加真实数据的边际收益递减。论文还报告,专门训练的 8B 世界模型作为模拟器,优于冻结的 GPT-oss-120B:WebArena 分别为 31.0% 和 20.9%。这说明通用模型规模不能替代目标环境中的状态转移训练。

3.3 从 token 对齐转向语义与行为对齐

同一个环境状态可以有多种正确描述。若只做 token 级交叉熵,模型会因措辞不同而受罚,也可能学会复制模板而没有学到因果变化。

Reinforcement World Model Learning 用句向量中的 sim-to-real 距离构造二值奖励:

\[ d(\hat{o},o)=1-\cos(E(\hat{o}),E(o)), \]

\[ r^{\text{WM}}= \mathbb{1}\left[d(\hat{o},o)<\tau\right]. \]

世界模型先通过无专家的交互数据学习动作后果,再与任务成功奖励结合做策略 RL。论文报告,单独做 world-model SFT 在 ALFWorld 上只有 2.8,而语义奖励的世界模型 RL 达到 32.6;与策略 RL 串联后达到 87.9,高于直接策略 RL 的 81.0。在 \(\tau^2\)-Bench 上,对应结果是 43.7 对 38.0。

这组结果不意味着“语义相似度就是最终解法”。embedding 也可能把关键数字、否定词或权限状态压平。但它代表了一个明确趋势:训练目标从复原文本,转向保留与行动有关的环境语义。

4. 主流范式二:代码和结构化状态作为可执行世界模型

另一条路线不让 LLM 在每一步充当模拟器,而是让 LLM 编写模拟器。世界模型变成 Python、PDDL、HTML、有限状态机或数据库规则:

\[ \hat{s}_{t+1}=f_c(\hat{s}_t,a_t), \qquad \hat{o}_{t+1}=\rho_c(\hat{s}_{t+1}), \]

其中 \(c\) 是可执行程序。它的优势是确定、快速、可检查、可局部修复,还能交给 MCTS 等传统规划器反复调用。

4.1 从生成代码到“反例驱动修复”

PatchWorld 从离线 \((o_t,a_t,o_{t+1})\) 文本轨迹中合成一个显式信念状态程序。程序包含四个接口:解析观测、更新信念、根据动作预测信念、把信念渲染为下一观测。随后系统重放轨迹,把失败归类成解析错误、信念更新错误、状态不匹配或读出错误,并让 LLM 只提出局部补丁;补丁只有在独立验证轨迹上改善时才被接受。

在七个 AgentGym 环境上,PatchWorld-Simple 的实时单步前瞻宏平均成功率达到 76.4%,是论文评测中表现最好的代码式方法,而且世界模型推理阶段不再调用 LLM。更值得注意的是,加入残差记忆虽然提高了表面文本复原,却削弱了决策效用。这说明“说得更像真实环境”和“更会区分好坏动作”并不总是一致。

4.2 大规模程序化环境生成

Agent World Model(AWM)把“世界模型”扩展成整套可交互训练环境:数据库保存状态,工具调用触发代码转移,任务结果由执行器验证。论文生成了 1000 个日常场景;平均每个环境包含 18.5 张数据库表、129.3 条记录、35.1 个工具和约 1985 行环境代码。

这种方案适合 Agentic RL,因为它能提供便宜、可重复、可验证的多轮交互。但“可执行”不等于“正确”。论文自己的质量分析中,两个强模型审查分别将 74% 和 83% 的生成环境判为含有 bug,约 11.5%–14.0% 的任务会被环境问题阻塞。这个结果不应被藏在平均性能后面:代码世界模型的主要瓶颈已经从“能不能生成”转为“怎样系统验证”。

4.3 验证通过,也可能在真正规划时失败

When a Verified World Model Still Loses 给出了最有警示性的反例:一个 LLM 合成的代码世界模型可以在采样验证集上达到 100% 转移准确率,在规划器实际访问的状态分布上也达到至少 98% 准确率,却因为不到 1% 的错误正好落在决定胜负的稀有规则上而系统性输棋。

论文把风险写成:

\[ \operatorname{danger} = \operatorname{play\_cost} \times(1-\operatorname{rarity})^N, \]

其中 rarity 是随机轨迹触发关键规则的概率,\(N\) 是验证轨迹数。验证集越偏向常见状态,就越可能遗漏规划器主动寻找的稀有关键状态。

这带来一个比“提高准确率”更深的原则:世界模型必须在策略的搜索分布上验证,或直接用最终决策效用验证。 随机状态上的 99% 可能不如关键分支上的 90%。

5. 主流范式三:世界模型作为想象环境和推理工具

训练好世界模型后,最经典的用法是在内部“做梦”。Agent 不立即执行动作,而是在模拟器里比较候选未来:

\[ a_t^{*} = \arg\max_{a_t} \mathbb E_{\hat{P}_{\phi}} \left[ \sum_{k=0}^{H-1}\gamma^k\hat{r}_{t+k} \right]. \]

它可以有三种形态:

  1. 训练时 imagined rollout:世界模型代替昂贵网站、工具或用户,生成大量合成轨迹;
  2. 推理时 shallow lookahead:预测一个或几个候选动作的下一状态,用于排序、校验或改写;
  3. 树搜索:在代码或参数化世界模型上执行 MCTS、beam search 或图搜索。

Qwen-AgentWorld 展示了规模化模拟路线。用其 397B-A17B 模型模拟 OpenClaw 环境进行 Sim RL,论文报告被训练的 Qwen3.5-35B-A3B 在 Claw-Eval 上从 65.4 提升到 69.7,在 QwenClawBench 上从 47.9 提升到 55.0;换成没有专门世界模型训练的 Qwen3.6-Plus 模拟器,收益很小。这支持“专门训练的环境动力学模型比通用强模型扮演环境更可靠”。

但 1 月的 Current Agents Fail to Leverage World Model as Tool for Foresight 给出了相反侧的证据:在多种 Agent 和视觉问答任务中,一些模型主动调用模拟器的比例低于 1%,约 15% 的预测 rollout 被错误使用;即使提供或强制使用世界模型,性能最高可下降 5%。论文在 Agent 任务中使用的是接近 oracle 的真实环境克隆,因此瓶颈不只是模拟器不准,而是 Agent 不知道何时模拟、如何解释、怎样把模拟结果整合进决策。

所以,给模型挂一个 world-model tool 并不等于获得规划能力。还需要学习一个“前瞻控制器”:

\[ g(h_t) \rightarrow \{\text{直接执行},\text{调用世界模型},\text{访问真实环境}\}, \]

并根据模型不确定性、真实交互成本和动作风险动态路由。

6. 主流范式四:把世界模型内化进策略参数

外置模拟器会增加部署延迟,而且策略可能根本不会使用它。2026 年另一条快速发展的路线是让同一个模型既学动作,又学动作后果。

6.1 把 RL 轨迹一份两用

标准 Agent RL 已经产生了 \((h_t,a_t,o_{t+1},r_t)\)。PaW 指出,同一条转移可以同时提供两种监督:

  • \((h_t,a_t,A_t)\) 用于策略优化;
  • \((h_t,a_t,o_{t+1})\) 用于世界模型学习。

其目标可概括为:

\[ \mathcal L = \mathcal L_{\text{RL}} +\lambda_t\mathcal L_{\text{WM}}. \]

PaW 只选择动作熵较高、决策更不确定的转移来计算世界模型损失,并使用抗噪损失与奖励自适应权重。动作 token 和观测 token 在同一次训练前向中用不同 mask 计算损失。训练完成后模型仍然只输出动作,不需要额外模拟器,也不改变部署接口。

论文报告,在 Qwen2.5-7B 上,GRPO 加 PaW 把 ALFWorld 总体成功率从 77.6% 提高到 80.6%;WebShop 平均得分从 75.4 提高到 84.5,成功率从 66.5% 提高到 70.5%。搜索增强 QA 的平均提升较小,例如 Qwen2.5-3B 上 GRPO 从 47.9 提高到 48.8。说明辅助世界建模对强环境动力学任务更有帮助,但不是所有任务都同样受益。

6.2 世界排演:同一个模型轮流扮演 Agent 与环境

EnvACE 更进一步。共享策略在每个时间步先以 Act 角色产生动作,再以 Rehearse 角色生成动作会触发的环境响应:

\[ a_t\sim\pi_{\theta}(\cdot\mid h_t,\textsc{Act}), \]

\[ \hat{o}_t\sim\pi_{\theta}(\cdot\mid h_t,a_t,\textsc{Rehearse}). \]

两个角色共享参数,并用任务成功奖励做 role-wise GRPO。推理时还可以先进行几次私有排演,汇总风险和建议,再向真实环境提交一次动作。

论文在 BFCL-v4、\(\tau^2\)-Bench、VitaBench 三组基准上的总体平均为 32.91,略高于 EnvScaler-8B 的 31.92 和 AWM-14B 的 32.54;在 FinMCP-Bench 上 TF1 为 46.78,高于论文列出的对比方法。优势是摆脱训练时外部环境调用,风险则同样明显:当模型同时编写动作和虚构反馈时,奖励可能鼓励它创造一个更容易成功、但并不真实的世界。论文使用任务结果和 LLM judge 约束它,但真实部署仍需要 sim-to-real 校准。

6.3 先学世界,再学策略

Qwen-AgentWorld 还把世界模型训练视为 Agent 基础能力的 warm-up。单轮下一状态预测 RL 后,不再额外微调,模型直接在七个多轮工具任务上评测,论文报告平均分从 62.29 提高到 71.25;其中 Terminal-Bench 2.0 从 33.25 提高到 39.55,SWE-Bench Verified 从 64.47 提高到 67.86,三个训练外基准也全部提升。

8 月的参数分析论文进一步发现,世界模型更新往往是低秩的,与策略更新共享输入特征子空间,却写入近乎正交的输出方向。其 ALFWorld 复现实验中,直接策略 RL 平均为 78.3,先做世界模型 RL 再做策略 RL 达到 84.4;在策略 RL 中继续加入在线下一状态监督达到 85.0。作者的解释是:世界知识与任务技能并非同一能力,后训练流程需要主动保留两者,而不是指望策略优化自然吸收全部世界知识。

7. 主流范式五:策略与世界模型共同演化

固定世界模型面临一个经典问题:策略越强,访问的状态越偏离世界模型最初的训练分布。模型在旧数据上很准,在新策略真正关心的状态上却可能最不准。

CoMap 将它改造成闭环:

  1. 世界模型为候选动作预测未来状态;
  2. 策略评估预测是否可信,并根据未来反馈反思和修改动作;
  3. 新的 on-policy 轨迹反过来蒸馏和更新世界模型;
  4. 两者重复迭代。

论文在 ALFWorld、ScienceWorld、WebShop 和 StableToolBench 上报告,Qwen3-4B 的平均分由普通 on-policy 训练的 76.00 提升到 85.40,Qwen3-8B 由 83.98 提升到 90.29。

这类共演化方法更接近 Dyna 式模型强化学习的理想形态,但也会引入反馈回路:策略只访问它已经偏好的状态,世界模型只在这些状态上变准,然后策略变得更偏。未来系统需要主动探索、分布覆盖和不确定性估计,避免两个模型共同确认同一种错误。

8. 一个具体数值例子:为什么单步 97% 仍不够

下面是一个教学用的简化例子,数字用于解释机制,不是把论文指标重新解释成真实概率。

假设一个 Web 世界模型预测局部页面变化的“单步正确率”为 97%。如果各步错误近似独立,那么连续 10 步都正确的概率是:

\[ 0.97^{10}\approx 0.737. \]

连续 30 步都正确的概率只有:

\[ 0.97^{30}\approx 0.401. \]

也就是说,单步看起来很高的 97%,在 30 步无校正 rollout 中可能只剩约 40% 的全程正确概率。现实中错误还会相关:第 3 步把购物车状态预测错,后面 27 步都在错误状态上继续展开,结果可能更差。

再看语义奖励。真实下一状态是“商品 A 已加入购物车,数量为 1”。两个预测分别是:

  • 预测甲:“购物车现在包含商品 A,共 1 件”,与真实状态 embedding 余弦相似度 0.92,距离 \(1-0.92=0.08\)
  • 预测乙:“商品 A 已从购物车删除,数量为 0”,余弦相似度 0.61,距离 \(1-0.61=0.39\)

若教学示例中取阈值 \(\tau=0.15\),甲得到世界模型奖励 1,乙得到 0。相比要求逐 token 完全一致,这能容忍同义改写;但如果 embedding 没有充分区分“加入”和“删除”,奖励仍会出错。因此稳健系统通常需要同时检查:

\[ \text{语义相似度} + \text{结构化字段约束} + \text{真实环境抽查} + \text{下游决策效果}. \]

9. 2026 年真正的前沿进展

9.1 从单域小模型走向跨域世界模型基础设施

早期语言世界模型多集中在文本游戏或单一网页环境。Qwen-AgentWorld 将训练扩大到七类数字环境和 1000 万级真实轨迹,说明“环境转移预训练”正在形成独立于普通网页语料和指令数据的新数据层。前沿问题从能否预测一个环境,转为能否建立跨工具、跨界面、跨任务的通用环境先验。

9.2 从重建观测走向决策充分性

DynaWeb 的差分预测、语义奖励的 world-model RL、PatchWorld 的动作区分能力,以及 verified-vs-correct gap 都在指向同一件事:完整复原所有 token 不是最终目标。世界模型应该保留对决策有因果意义的变量、罕见但关键的规则,以及不同动作之间的后果差异。

因此,未来更合理的评测层级是:

层级 问题 典型指标
单步表面 输出像不像真实观测 Token F1、BLEU、格式正确率
单步语义 关键事实和状态是否一致 embedding、字段匹配、规则检查
多步动力学 自回归滚动是否稳定 rollout consistency、状态约束违反率
策略分布 在 Agent 真正访问的状态上是否可靠 on-policy error、罕见关键状态覆盖
决策效用 是否帮助完成任务而非误导 success rate、regret、风险与真实交互成本

9.3 从外置模块走向内化与联合训练

PaW、ECHO、EnvACE、CoMap 和参数组合分析把世界模型从一个单独产品变成 Agent 后训练的一部分。趋势不是简单地“取消模拟器”,而是形成两个速度不同的层次:

  • 内化的动力学先验让策略在普通推理中更少犯常识性环境错误;
  • 外置世界模型在高风险、昂贵或需要搜索的动作前提供更深的模拟。

9.4 从静态模型走向持续校准

网页、API、用户和软件仓库都会变化,世界模型一经离线训练就会过时。CoMap 的 on-policy 自蒸馏、PatchWorld 的反例修补和真实/想象轨迹混合,都体现了持续校准思想。未来的世界模型更像一个不断维护的运行时组件,而不是训练完就冻结的 checkpoint。

9.5 从“有没有表征”走向“能不能稳定使用表征”

对 Tower of Hanoi 的机制研究发现,Qwen3.6-27B 与 DeepSeek-R1-Distill-Qwen-32B 在提示结束处几乎完美编码了任务的 Sierpiński 结构,但在 \(N\ge4\) 时仍大量失败;探针显示,规划过程中世界模型表征逐渐衰减,把提示阶段的表示注回模型能部分恢复性能。

这与“Agent 拿到模拟器仍不会用”的结果互相呼应:2026 年的瓶颈正在从世界模型的获得转向世界模型的保持、调用和决策整合

10. 尚未解决的关键问题

10.1 开放世界没有唯一正确的下一状态

API 可能超时,用户可能改变主意,搜索结果随时间变化,同一个动作存在多个合理后果。只训练确定性文本续写会把多模态未来压成一个平均答案。需要显式概率、多个假设、可校准置信度和风险敏感规划。

10.2 部分可观测与隐藏状态

真实 Agent 往往只有日志和页面,而没有数据库或服务器真值。模型必须区分已知、未知和推断状态,不能把自己的猜测写成事实。结构化信念状态、可回滚记忆和观测校正接口会比无限延长上下文更可靠。

10.3 模拟器偏差与奖励利用

如果策略只在模拟器中训练,它可能学会利用模拟器漏洞,而不是解决真实任务;如果同一模型既演 Agent 又演环境,这一风险更大。需要真实环境锚点、对抗式验证、随机化和 sim-to-real 路由。

10.4 世界模型准确率与任务收益不一致

文本复原、动力学准确、规划收益是不同目标。最危险的不是平均误差大,而是错误集中在不可逆、高价值或安全关键动作上。评测必须按动作风险和策略访问分布加权。

10.5 成本与延迟

为每个候选动作调用几十亿乃至几千亿参数的模拟器并做多步搜索,可能比直接访问真实 API 更贵。程序化模型、短视界 rollout、缓存、蒸馏和按不确定性路由会成为系统级关键技术。

10.6 证据仍偏向封闭基准

目前最强结果主要来自 ALFWorld、WebShop、ScienceWorld、Terminal、工具沙箱和合成工作流。这些环境比真实企业系统更稳定、更容易重置、更容易获得奖励。跨时间、跨组织、涉及真实用户和不可逆操作的开放世界证据仍然不足。

11. 一个实用的系统范式

综合 2026 年的证据,一个相对稳妥的 LLM Agent 世界模型栈可以设计成五层:

  1. 真实转移缓冲区:保存高价值 \((h_t,a_t,o_{t+1})\),特别关注失败、罕见状态和不可逆动作;
  2. 混合世界模型:文本模型预测开放语义,结构化字段追踪关键状态,代码执行器处理确定规则;
  3. 短视界想象:默认只展开少量步骤,并在置信度下降时停止,不追求无限“做梦”;
  4. 策略联合训练:用真实 RL 奖励学习行动,同时用下一状态目标维持环境动力学知识;
  5. 决策导向验证:在 on-policy、对抗和高风险状态上检查模型,并保留访问真实环境的回退路径。

闭环可以写成:

\[ \text{真实交互} \rightarrow \text{转移数据} \rightarrow \text{世界模型} \rightarrow \text{想象轨迹} \rightarrow \text{策略更新} \rightarrow \text{新的 on-policy 状态} \rightarrow \text{再校准}. \]

这里最重要的工程选择不是“用不用世界模型”,而是四个问题:模拟多深、何时停止、何时信任、何时转向真实环境。

12. 总结

2026 年的语言世界模型研究已经形成五条主流范式:

  1. 用 LLM 预测完整下一观测、状态差分或语义后果;
  2. 用 LLM 合成可执行代码和结构化信念状态;
  3. 把世界模型当作训练环境、推理时模拟器或动作校正器;
  4. 把下一状态学习内化进策略模型,作为 Agent 后训练的一部分;
  5. 让策略与世界模型在 on-policy 数据上共同演化。

真正的前沿已经不再是“生成得像不像”,而是三个更难的问题:

  • 模型能否在长时交互中维持因果一致的信念状态;
  • 策略能否在正确的时机调用并利用模型,而不是被看似合理的模拟误导;
  • 世界模型能否在策略真正关心、尤其是稀有且关键的状态上可靠。

因此,世界模型不会简单取代真实环境,也不会只是 Agent 旁边的另一个大模型。更可能的终局是:真实世界提供锚点,神经模型提供覆盖,代码与结构提供约束,策略学习提供目标,持续校准把它们连接成闭环。 当这个闭环稳定工作时,LLM Agent 才会从“看到反馈再反应”,真正走向“行动之前先预演”。

参考阅读


从“会回答”到“会预演”:2026 年大语言模型世界模型的主流范式与前沿进展
https://kissshhot.github.io/2026/09/01/llm-world-models-2026/
作者
丁一帆
发布于
2026年9月1日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。