如果你最近关注机器人、具身智能或者智能驾驶,应该会经常看到这些缩写:VLM、VLN、VA、VLA、WM、WAM、VLX。它们背后其实指向同一条技术主线:
具身智能要做的事,是让模型从「看懂世界」,走向「能在世界里行动」,再走向「行动前能预判后果」。
七个核心概念速览
理解这些概念,关键不是先记住缩写,而是看清它们分别处理什么输入、产生什么输出。
| 概念 | 全称 | 核心问题 | 典型输入 | 典型输出 |
|---|---|---|---|---|
| VLM | Vision-Language Model | 看懂图像/视频 | 图像 + 文本 | 描述、问答、检测 |
| VLN | Vision-Language Navigation | 按指令导航到目标 | 第一视角图像 + 路线指令 | 路径、航点、导航动作 |
| VA | Vision-Action | 从视觉直接到动作 | 图像 + 状态 | 轨迹、控制量 |
| VLA | Vision-Language-Action | 按指令完成动作 | 图像 + 语言 + 状态 | 动作 token、轨迹 |
| WM | World Model | 预测世界变化 | 当前状态 + 候选动作 | 未来状态/视频 |
| WAM | World Action Model | 动作与未来联合建模 | 状态 + 目标/动作 | 未来变化 + 对应动作 |
| VLX | Vision-Language-X | 向更多任务扩展 | 图像 + 文本 + X 模态 | 导航、动作、控制等 |
这七个概念并不处在同一层:VLM 偏感知理解,VLN 把视觉语言放进导航任务,VA 和 VLA 开始输出动作,WM 和 WAM 则关注动作发生后世界会怎样变化。
VLM:机器如何理解图像和语言
VLM(Vision-Language Model)负责把图像、视频和语言放到同一个语义空间里理解。输入通常是图像或视频加文本提示,输出可以是图像描述、视觉问答答案、目标位置或空间关系。
比如给机器人一张厨房图,问它「桌上有什么」「红色杯子在哪里」「前方有没有障碍物」,VLM 不只是给图像贴标签,还能理解物体、位置、关系和场景含义。

VLM 的边界也很清楚:它负责理解,不直接负责控制。导航和动作要交给后面的 VLN、VA、VLA 继续处理。代表工作包括 CLIP、PaLM-E、Gemini Robotics 等。
VLN:按语言指令在空间里导航
VLN(Vision-Language Navigation)关注的是智能体能不能一边看环境,一边按自然语言指令走到目标位置。相比 VLM,VLN 多了「移动」和「停下」。
VLM 可能回答「门在前方」,VLN 要进一步判断:现在该往哪里走、走到哪里转弯、什么时候停下来。比如在 Room-to-Room 任务中,智能体会收到类似「上楼,穿过正前方的拱门,经过钢琴,在挂在墙上的麋鹿鹿角旁等待」这样的指令。

VLN 的核心难点:语言和视觉要对齐、局部视野下判断方向、长路线中的进度记忆、环境变化后的重新规划。可以理解为:VLM 让机器知道「眼前有什么」,VLN 让机器知道「该往哪里走」。
VA:不靠语言,直接从视觉到动作
VA(Vision-Action)即「视觉直接到动作」。模型看到图像、视频和当前状态后,直接预测动作、轨迹或控制量,不一定需要语言参与。
自动驾驶里的端到端驾驶策略就接近这条路线:摄像头看到道路、车辆、行人和车道线,模型直接输出未来轨迹、转向、加速度或刹车。

VA 的特点是链路短、延迟低,适合任务边界清楚的实时控制。但局限也明显:能输出动作但不一定能解释依据,遇到训练里没覆盖的长尾场景时泛化和安全性会成问题。
VLA:把视觉、语言和动作接起来
VLA(Vision-Language-Action)是机器人基础模型里很常见的一类。基本形式是:图像/视频 + 语言指令 + 机器人状态 → 机器人动作。
相比 VA,VLA 多了语言条件,可以处理更开放的任务。真实机器人任务往往不是固定控制问题,而是用户用自然语言说「把红色杯子放到水槽旁边」「打开抽屉把勺子拿出来」。

几项代表工作:RT-2 把机器人动作离散成 token,让视觉语言模型直接输出动作(一句话概括:把动作当成另一种 token);OpenVLA 提供了完整的开源 VLA 基线;π0/π0.7 强调连续动作和通用机器人策略,用 flow matching 输出连续控制。
VLA 的主要难点:动作怎么表示、数据从哪里来、跨本体怎么做、实时性和安全怎么保证。现在很受关注,但远没有到「一个模型解决所有机器人任务」的程度。
WM:世界模型,让机器先预演未来
WM(World Model)要回答的问题是:如果现在这样做,接下来会发生什么?核心形式是当前状态 + 候选动作 → 未来状态/视频/奖励/风险。
VLA 关心「下一步动作是什么」,世界模型更关心「如果做这个动作,世界会怎么变」。比如机器人拿起杯子时预测杯子会不会滑,智能车变道时预测旁边车辆会不会减速。

代表工作包括 V-JEPA 2、NVIDIA Cosmos 等。
WAM:把世界模型和动作模型合起来
WAM(World Action Model)想把「动作生成」和「未来预测」放进同一个模型里。三个概念放到一起:
- VLA:看见什么 + 想做什么 → 下一步动作
- WM:当前世界 + 一个动作 → 未来会怎样
- WAM:目标 + 当前状态 → 未来世界变化 + 对应动作
一句话概括 WAM:它不只学习「动作是什么」,还学习「动作如何改变世界」。
比如机器人把杯子放进洗碗机:VLA 像直接输出动作序列,WM 像评估某个动作会不会让杯子倾斜,WAM 则希望在生成动作时就带着对未来结果的判断。代表工作包括 World Action Models: The Next Frontier in Embodied AI、NVIDIA World Action Model 等。
VLX:X 代表扩展,也代表边界还没定型
VLX(Vision-Language-X)重点在最后这个 X。它可以是 action、navigation、grounding、detection,也可以是 video、control、tool use,甚至更复杂的具身任务输出。

VLX 更像是一个扩展视角:视觉语言模型正在从「看图问答」向更多任务接口扩展。它还不是一个完全统一的学术类别,更适合用来理解趋势——视觉语言能力正在继续外接到更多任务。
苏米注
这些概念其实在回答同一个问题:模型如何从看懂图像和语言,走向在真实世界里移动、操作,并预判行动后的结果。VLA、世界模型和 WAM 经常被放在一起讨论,说明重心已经从聊天能力转向物理世界里的感知、动作和后果预测。对于开发者来说,理解这条技术主线比记住缩写更重要。