从 VLA 到 WAM:具身基础模型的代表方法,以及与 LLM、推理和强化学习的交叉

大语言模型学会了用语言描述任务,视觉语言模型学会了把描述与图像对应起来。机器人还需要跨过另外两道门槛:把目标变成可执行的运动,以及预测运动会造成什么后果。 VLA(Vision-Language-Action,视觉语言动作模型)与 WAM(World Action Model,世界动作模型)分别从动作生成和世界—动作联合建模切入这两个问题。

本文面向有 LLM、Agent 或强化学习背景的读者,梳理经典方法和截至 2026 年 9 月 12 日公开的一组代表工作。重点讨论机器人操作;人形机器人用于说明系统结构,不试图覆盖全部导航、自动驾驶和运动控制研究。年份按首次公开时间标注,2026 年论文包含预印本。文中的路线划分和研究建议是本文归纳,实验数字则明确归属于各论文的特定设置。

一个贯穿全文的判断是:VLA 与 WAM 可以交叉。动作生成、世界预测、语言推理和 RL 是不同的设计维度,不应该仅凭模型名称把它们分成互斥阵营。

1. 先区分三个问题:做什么、会怎样、怎样选

设机器人在时刻 \(t\) 收到多相机图像 \(I_t\)、本体状态 \(q_t\) 和任务指令 \(\ell\)。本体状态可以包含关节角、末端位姿、夹爪状态;历史 \(h_t\) 汇总截至当前的可见信息。机器人输出一个动作块:

\[ A_t=(a_t,a_{t+1},\ldots,a_{t+H-1}). \]

动作块中的元素可以是末端位姿增量、关节目标或其他控制量,必须结合具体机器人的动作定义理解。

1.1 VLA:学习给定目标和观察时如何行动

典型 VLA 学习条件策略:

\[ A_t\sim\pi_\theta(A_t\mid h_t,\ell). \]

RT-2 和 OpenVLA 代表复用 VLM 的自回归生成能力来输出动作;π₀ 代表在 VLM 上连接连续动作生成模块。VLA 的定义不要求输出必须是离散 token,也不要求必须显式生成一段思考。RT-2OpenVLAπ₀

1.2 世界模型:学习一个动作会造成什么后果

动作条件世界模型学习:

\[ \hat O_{t+1:t+H}\sim P_\phi(O_{t+1:t+H}\mid h_t,A_t). \]

这里的输出可以是图像、视频潜变量或任务相关状态。它回答的是“如果执行这段动作,接下来可能看到什么”。只具备这个接口的模型不一定能自己选择动作。 DreamDojo 是本文中理解这一角色的重要例子。DreamDojo

1.3 WAM:把动作与未来世界放进同一个学习问题

WAM 还没有完全统一的架构标准。以 DreamZero 的用法为代表,它强调利用视频生成先验,联合建模未来观察与机器人动作。可以用下面的概念式表示:

\[ (A_t,\hat O_{t+1:t+H})\sim p_\theta(A_t,O_{t+1:t+H}\mid h_t,\ell). \]

这不是所有 WAM 的逐字实现公式,而是描述其联合建模目标。具体模型可能共享主干、使用模态专用模块,也可能训练时联合预测、部署时只保留动作路径。DreamZeroSelfWAM

类型 核心接口 是否天然提供动作 是否必须在线搜索
VLA 策略 观察、指令 → 动作
动作条件世界模型 观察、候选动作 → 未来观察 否,可作为搜索工具
联合世界动作模型 观察、指令 → 动作与未来 是,取决于具体接口
基于模型的规划系统 候选动作 → 预测后果 → 评分选择 是,由规划器选出 通常进行候选评估或搜索

联合预测未来不等于已经执行了规划;能够生成视频也不等于已经学会动作条件动力学。 判断一篇论文时,需要继续追问:模型是否真的接收候选动作?是否比较多个未来?预测误差是否会改变最后选出的动作?

2. VLA 的代表路线:从动作 token 到连续动作专家

工作 首发 方法位置 对 LLM 研究者的意义
RT-2 2023 视觉语言与机器人数据联合微调,动作作为 token 输出 证明网页语义知识能够部分迁移到机器人控制
OpenVLA 2024 开放的 7B VLA,基于预训练视觉语言模型学习机器人策略 提供研究动作微调和迁移的开放基线
π₀ 2024 VLM + flow-matching 动作专家 语义表示可复用,动作分布可由专门的连续生成机制处理
FAST 2025 基于频域压缩的动作 tokenizer 动作词表的设计会改变序列长度和学习难度
π₀.₅ 2025 异构数据共同训练、高层语义预测与低层动作结合 通用化依赖数据组合和任务分解,不只依赖模型规模
GR00T N1 2025 视觉语言理解与 diffusion 动作生成组成双系统 慢速语义计算与快速运动生成可以分工

2.1 RT-2 / OpenVLA:动作成为新的输出模态

这条路线把连续动作分量量化成离散符号,再用自回归模型预测。示意为:

\[ p_\theta(A_t\mid h_t,\ell) =\prod_i p_\theta(z_i\mid h_t,\ell,z_{<i}), \qquad A_t=\operatorname{Decode}(z_{1:N}). \]

对 LLM 而言,训练形式很熟悉;真正新增的是动作的数值含义、坐标系和时间尺度。语言里意思近似的两个词可能可以互换,但夹爪在错误时刻闭合、位移符号相反,可能直接导致任务失败。互联网语义先验不能替代动作标定和机器人数据。RT-2OpenVLA

2.2 π₀:用连续生成机制承接语言视觉表示

π₀ 将预训练 VLM 与 flow-matching 动作专家结合。以一个简化的 flow matching 目标为例:令 \(A\) 为真实动作块,\(\epsilon\) 为噪声,\(u\in[0,1]\) 为生成过程时间,构造

\[ X_u=(1-u)\epsilon+uA, \]

\[ \mathcal L_{\mathrm{flow}} =\mathbb E\left[\|v_\theta(X_u,u,h_t,\ell)-(A-\epsilon)\|^2\right]. \]

推理时,从噪声开始沿学习到的向量场生成连续动作块。这是解释 flow matching 的通用写法,不是声称 π₀ 的所有实现细节都与此相同。它说明了一种重要分工:VLM 提供条件信息,动作专家处理连续轨迹分布。π₀

2.3 FAST:自回归路线也可以改进动作表示

FAST 没有把动作序列当作互相独立的每时刻、每维度数值,而是用离散余弦变换等压缩步骤利用轨迹的时间结构,再得到可供自回归模型处理的符号。由此,比较“自回归还是 diffusion/flow”时不能忽略 tokenizer:过长、冗余或失真的动作表示,会先把学习问题变难。FAST

2.4 π₀.₅ / GR00T N1:异构数据与分层计算

π₀.₅ 关注开放环境泛化,将不同来源的机器人与视觉语言数据共同用于学习,并结合高层语义与低层动作。GR00T N1 则以双系统结构结合视觉语言推理和动作生成。π₀.₅GR00T N1

这里“慢思考、快动作”首先是一种计算与控制设计:不是每个电机控制周期都需要重新运行完整语言推理。评估时要分别报告模型生成延迟、动作块覆盖时长、重新观察频率和底层控制频率,不能把它们都简称为一个 Hz。

3. 世界模型与 WAM 的代表工作:未来如何进入控制

工作 首发 学习内容 世界模型的作用
WorldVLA 2025-06 在自回归框架中联合动作与图像理解、生成 用动作与未来图像的相互监督改善表示和策略
Cosmos Policy 2026-01 将动作、未来状态和价值编码进视频模型的潜在帧 同一生成框架支持控制与测试时规划
DreamDojo 2026-02 从大规模人类视频学习通用先验,再适配动作条件机器人预测 提供可受机器人动作控制的预测环境
DreamZero 2026-02 预训练视频 diffusion 主干联合生成视频与动作 将视频先验直接转化为机器人策略
SelfWAM 2026-08 动作、动作条件未来 RGB、机器人自身掩码联合训练 强化动作后果建模,同时保留快速动作推理路径
OpenWAM 2026,项目页 模块化比较主干、视觉表示、信息流、数据和去噪方式 分离哪些设计真正带来世界—动作协同

3.1 WorldVLA:VLA 与世界模型可以共用一个框架

WorldVLA 把动作生成与未来图像生成纳入同一自回归框架:动作信息帮助预测图像,视觉变化的学习又反过来帮助动作生成。论文还研究动作块自回归生成中的误差传播,并通过选择性屏蔽先前动作的注意力策略改善表现。WorldVLA

它在方法谱系中的位置很清楚:VLM/LLM 路线并不排斥世界预测,视频主干也不是联合世界动作建模的唯一实现。 因而,“VLA 都不懂动力学、WAM 都不需要语言”都不是严谨的分类。

3.2 DreamZero:以视频生成先验为起点构造策略

DreamZero 将预训练视频 diffusion 主干用于联合视频与动作建模。其论文报告,经过模型与系统优化,14B 模型可实现 7 Hz 的闭环控制,并展示视频示范和少量目标本体数据带来的迁移。DreamZero

这里最值得研究的是:没有精确机器人动作标签的视频,也可能提供物体交互与运动的先验;随后通过机器人数据将它与可执行动作对应起来。但标题中的 zero-shot 不能读成“从未看过机器人数据,接上任意硬件就能工作”。新任务泛化、新场景泛化和新本体适配是不同的评估设置。

3.3 Cosmos Policy:把策略、未来和价值放进统一生成过程

Cosmos Policy 将动作编码为视频模型中的潜在帧,也以类似方式表示未来状态图像与价值,使预训练 Cosmos-Predict2 能在机器人数据上适配控制任务。它还能利用 rollout 数据改进世界模型与价值函数,再通过基于模型的规划选择动作。Cosmos Policy

它与 LLM Agent 的 test-time search 有直接的结构联系:先提出候选,再预测后果,然后按任务价值选择。区别在于,这里的候选是连续动作轨迹,未来包含物理观察,而不是候选文本答案。

3.4 DreamDojo:世界模型可以先成为可控预测环境

DreamDojo 从大规模人类视频中学习先验,再使用目标机器人数据进行后训练以建立动作可控性。它主要回答“如何让世界预测覆盖更丰富的现实交互”,而不应仅因与 DreamZero 名字相近,就被归类为同一种直接动作策略。DreamDojo

对 Agent RL 来说,这个位置对应环境模型:可以支持策略评估、想象或后续控制系统,但“有一个模拟器”与“已经用模拟器做了 RL”仍是两件事。是否形成模型内策略学习闭环,需要查看具体训练流程。

3.5 SelfWAM:未来必须依赖实际动作

假设指令是“把杯子拿起来”。一个只靠指令生成未来的模型,可能不管输入动作如何,都生成“杯子被拿起”的视频。它学到的可能是常见任务进程,而不是当前动作的后果。

SelfWAM 在联合训练中,让未来视觉分支读取干净的示范动作,并预测机器人自身的未来掩码,突出与身体运动相关的变化。部署时则可以保持仅生成动作的快速路径。SelfWAM

这提出了一个也适用于语言世界模型的诊断:保持当前观察不变,换一个动作,预测是否随之发生合理变化? 能生成合理未来只是第一步,动作敏感性才决定它是否适合辅助决策。

3.6 OpenWAM:把模型比较变成设计因素比较

OpenWAM 提供模块化研究框架,对视觉表示、生成主干、动作容量、世界到动作的信息流、数据组合和联合去噪进行控制实验。项目页强调,世界预测与动作预测并列存在,并不自动产生协同。OpenWAM

这对复现很有价值:当更大模型取得更高成功率时,应进一步区分增加参数、扩大视频覆盖、增加机器人数据,以及改变信息流各自贡献了多少。

4. 与 LLM 的关系:六条具体交叉路线

4.1 LLM 做规划器,机器人技能作为工具

SayCan 把语言模型对技能的任务相关性评分,与机器人当前状态下的可执行性评分结合。用简化形式表示:

\[ k^*=\arg\max_k p_{\mathrm{LM}}(k\mid\ell,h_t)\,V_k(h_t). \]

Code as Policies 让语言模型生成调用感知、控制接口的程序;VoxPoser 则把语言与视觉信息转为三维价值图,用于运动规划。这些是 LLM 与具身控制的代表交叉工作,但不都属于直接输出低层动作的 VLA。

它们与软件 Agent 的共同点是工具组合和执行反馈;不同点是一个机器人技能是否可执行,取决于当前几何、接触和运动约束,不能只由语言模型判断“听起来合理”。

4.2 预训练迁移:从传感器到多模态语言表示

PaLM-E 将连续的视觉、状态等信息接入语言模型,研究具身多模态推理;RT-2 再把机器人动作纳入输出空间。二者共同说明 LLM 与机器人结合有多个层次:输入接地、语义规划、动作生成并不是同一步。RT-2

对研究者而言,应把泛化拆开衡量:识别新物体、理解新指令、适应新动力学、迁移到新机器人,需要的知识和数据并不相同。语义泛化提升不能直接替代物理技能泛化的证据。

4.3 Tokenization:动作空间也需要合适的“词表”

FAST 对应一个非常直接的 LLM 交叉问题:怎样把原始信号编码成容易学习的序列?文本 tokenizer 压缩常见字符模式,动作 tokenizer 则可以利用时间平滑性与轨迹冗余。FAST

但动作 token 带有实际单位和本体约束。统一词表并不自动解决跨本体对齐:同一个数字在不同机械臂、坐标系、控制频率下可能意味着不同运动。研究动作离散化时应同时报告重建误差与闭环任务成功率。

4.4 Chain-of-Thought:推理需要落到空间和运动上

ECoT 在预测动作前生成计划、子任务、运动以及物体框、末端位置等具身信息,而不只写抽象的任务分解。其训练还包含合成推理数据的构造。

ThinkAct 用目标完成与轨迹一致性等动作相关视觉奖励训练多模态推理,再把计划压缩成视觉计划潜变量,条件化下游动作模型。这连接了推理 RL、潜在计划和低层控制。

两条路线适合一起读:ECoT 让中间表示更显式,ThinkAct 研究如何把推理变成执行模块可利用的潜变量。评价具身推理时,核心问题是中间表示是否改变并改善实际动作,而不只是文本是否详细。

4.5 Agentic RL:从模仿示范到利用交互结果

许多 VLA/WAM 的基础训练主要来自示范或预测目标。模型能够执行动作、预测未来,并不代表它已经接受了强化学习。

RIPT-VLA 使用稀疏二元成功奖励对预训练 VLA 做交互式后训练。π*₀.₆ / RECAP 则将示范、自主执行和人类干预数据纳入学习,通过价值估计和优势条件策略利用实际经验。这是与 LLM 后训练相连的两个具体入口。

问题 LLM 工具 Agent 机器人 VLA/WAM
动作 查询、代码、工具参数 连续动作、动作块或离散技能
反馈 搜索结果、测试日志、API 返回 图像、本体状态、接触与任务变化
信用分配 哪次调用帮助了最终成功 哪段轨迹或哪次接触影响了成败
数据采集 可并行工具或沙箱,成本依任务而异 受硬件、重置、人工与物理时间约束
更新接口 文本 token 的概率较直接 diffusion/flow 策略需要相应的优化构造

最后一行尤其重要:不能把连续生成模型简单当作离散语言模型,直接套用 token 级 PPO/GRPO 比率。具体方法必须说明策略概率如何定义、优化的是哪个模块、奖励对应哪个时间尺度。

4.6 世界模型与测试时计算:让推理通过候选后果比较发生

在概念上,一个规划器可以做:

\[ A^{(i)}\sim\pi_\theta(\cdot\mid h_t,\ell),\quad \hat O^{(i)}\sim P_\phi(\cdot\mid h_t,A^{(i)}), \]

\[ i^*=\arg\max_i S(h_t,A^{(i)},\hat O^{(i)},\ell). \]

这是通用的候选评估示意,不是某一论文的完整算法。Cosmos Policy 给出了统一生成动作、未来与价值并用于规划的实际路径;SelfWAM 则说明,也可以把世界预测的收益主要放在训练阶段,部署时保留快速动作生成。Cosmos PolicySelfWAM

因此,“加入世界模型”至少有三种不同用法:作为辅助训练目标、作为在线规划工具、作为产生想象经验的训练环境。研究结论应该明确是哪一种。

5. 用一个抽屉任务串起这些方法

以下是教学示例,数字为人为设定,不是论文实验或可直接执行的机器人参数。

任务是“拉开抽屉,取出红色积木”。机器人当前只看到关闭的抽屉,无法确认积木的位置。

高层语义规划可以先选择“抓住把手并拉开抽屉”;执行后再根据新观察确定积木位置。这对应 SayCan 式技能组合或具身 Agent 的分层规划。它不能在抽屉未打开时把内部位置当成已知事实。

VLA 执行根据画面、指令和本体状态产生动作块。假设动作序列频率为 20 Hz,一个动作块包含 10 步,即覆盖 0.5 秒。系统若只先执行 2 步就重新观察,则每 0.1 秒重新决策一次。这说明动作块长度不必等于开环执行长度。

世界模型辅助比较可以预测两段候选动作的后果:一段沿抽屉轴向拉动,另一段偏向侧面。教学评分设为 \(S=p_{\mathrm{success}}-2p_{\mathrm{collision}}\)

候选 预测成功概率 预测碰撞概率 教学评分
沿轴向拉动 0.80 0.05 0.70
偏向侧面拉动 0.65 0.20 0.25

如果候选评估器经过校准,就会倾向第一段动作。但如果模型把卡住的抽屉也“想象”为顺利打开,评分会误导控制。实际执行后的新观察必须用于纠正预测,而不是让生成视频覆盖真实反馈。

交互后训练则把成功、失败和纠正经历变成数据:抓错把手、夹爪打滑、拉开后遮挡目标等失败,都是单纯成功示范可能覆盖不足的情况。RL 要解决的不只是最终拿到积木,还包括如何把结果归因到早先的动作选择。

这个例子把几个层次接起来:语言负责目标和子任务;策略负责可执行动作;世界模型提供候选后果;真实反馈负责验证;后训练负责从经验改进。

6. 读实验结果时,哪些比较才成立

以下数字用于展示论文各自证明了什么,不能横向组成排行榜。

工作 论文报告的结果 可以支持的解读 不能直接推出
ECoT 所测泛化任务上,相对 OpenVLA 的成功率提高 28 个百分点 具身中间推理在该设置中有助于泛化 任何任务增加长 CoT 都有效
DreamZero 14B 模型实现 7 Hz 闭环控制 大视频主干经过系统优化可以进入机器人控制回路 所有硬件均有相同延迟,或底层伺服频率只有 7 Hz
Cosmos Policy LIBERO / RoboCasa 平均成功率分别为 98.5% / 67.1% 视频先验适配控制在其评测配置中有效 WAM 在所有任务和预算下优于 VLA

来源:ECoTDreamZeroCosmos Policy

实际比较至少需要核对五项条件:

  1. 数据相同吗? 视频预训练、机器人预训练与目标任务示范是否都计入预算?
  2. 泛化维度相同吗? 新物体、新背景、新指令、新运动和新本体不是同一问题。
  3. 闭环配置相同吗? 动作块长度、执行步数、模型延迟与相机更新率都会影响结果。
  4. 恢复成本计入了吗? 人工重置、干预次数、失败重试和任务吞吐量应与成功率一起看。
  5. 世界模型确实影响决策吗? 应增加动作扰动、反事实候选排序和真实执行验证,而不只看视频观感。

其中第五点连接了具身与语言世界模型:预测得像,并不必然意味着能够区分导致成功或失败的动作。

7. 对 LLM / Agentic RL 研究者,有哪些可做的交叉问题

以下是基于前述工作的研究建议,不是已经由这些论文证明的结论。

方向一:把语言推理变成可验证的具身中间表示。 从 ECoT / ThinkAct 出发,比较自然语言计划、目标图像、对象关系图和计划潜变量。保持动作模块与数据预算一致,测中间表示是否真正改善失败恢复,而不仅是可读性。

方向二:让世界预测服务于信用分配。 结合 SelfWAM 的动作敏感性思路,在相同观察下比较替代动作,研究预测差异能否辅助识别关键动作块。需要用真实执行校准,否则可能只是让策略迎合世界模型的偏差。

方向三:研究慢推理与快动作之间的计算分配。 不是每一步都生成长推理或完整视频:在接触前、任务切换、出现新观察或预测不确定性升高时增加计算,在稳定运动阶段复用已有计划。评价指标应包含端到端延迟与任务吞吐量。

方向四:统一经验回放,但保留物理接口。 借鉴 LLM Agent 的轨迹记录、异步采样和反馈管理,把机器人观察、动作块、干预与最终奖励对齐。统一的是数据协议和训练调度,坐标、时钟和动作单位仍需显式保留。

方向五:比较世界模型的三种部署角色。 在相同参数、训练数据和在线计算预算下,比较“仅辅助训练”“在线候选评估”“模型内生成经验”。这能回答世界建模的收益究竟来自表征、测试时搜索还是更多训练样本。

8. 建议阅读顺序

阅读目标 推荐顺序 阅读时抓住的问题
从 LLM 进入机器人 SayCan → PaLM-E → RT-2 → OpenVLA 语言知识在哪个接口接入物理系统?
理解动作生成 OpenVLA → FAST → π₀ → GR00T N1 token、连续生成和计算分层分别解决什么?
理解 WAM WorldVLA → Cosmos Policy → DreamZero → SelfWAM 世界预测如何参与训练与决策?
做推理与 RL 交叉 ECoT → ThinkAct → RIPT-VLA → RECAP 推理监督、交互奖励和人类纠正如何影响策略?
做环境与基础设施 DreamDojo → OpenWAM 动作可控性、数据迁移与模块化实验如何组织?

本文共整理上述 20 项代表工作。所有论文或官方项目入口均已在相应段落给出;后续可沿官方页面查代码、模型和训练数据的实际公开范围。

与本站已有文章衔接:先看《从 LLM 到 VLA》了解语言模型接入机器人控制的基本范式,再结合《2026 年大语言模型世界模型》比较文本环境与物理环境中的状态转移学习。本文进一步关注的,是这两条路线如何在世界预测、动作生成和经验学习的闭环中相遇。


从 VLA 到 WAM:具身基础模型的代表方法,以及与 LLM、推理和强化学习的交叉
https://kissshhot.github.io/2026/09/12/vla-wam-llm-embodied-intelligence/
作者
丁一帆
发布于
2026年9月12日
许可协议

点赞与评论

喜欢这篇文章?点个赞,或留下你的想法。登录 GitHub 后即可参与。

如果评论无法加载,请检查网络连接后刷新页面。