10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI智能体

具身智能 7 个核心概念通俗讲解:从 VLM、VLN 到世界模型

1小时前 AI智能体 9 0

如果你最近关注机器人、具身智能或者智能驾驶,应该会经常看到这些缩写:VLM、VLN、VA、VLA、WM、WAM、VLX。它们背后其实指向同一条技术主线:

具身智能要做的事,是让模型从「看懂世界」,走向「能在世界里行动」,再走向「行动前能预判后果」。

七个核心概念速览

理解这些概念,关键不是先记住缩写,而是看清它们分别处理什么输入、产生什么输出。

概念 全称 核心问题 典型输入 典型输出
VLM Vision-Language Model 看懂图像/视频 图像 + 文本 描述、问答、检测
VLN Vision-Language Navigation 按指令导航到目标 第一视角图像 + 路线指令 路径、航点、导航动作
VA Vision-Action 从视觉直接到动作 图像 + 状态 轨迹、控制量
VLA Vision-Language-Action 按指令完成动作 图像 + 语言 + 状态 动作 token、轨迹
WM World Model 预测世界变化 当前状态 + 候选动作 未来状态/视频
WAM World Action Model 动作与未来联合建模 状态 + 目标/动作 未来变化 + 对应动作
VLX Vision-Language-X 向更多任务扩展 图像 + 文本 + X 模态 导航、动作、控制等

这七个概念并不处在同一层:VLM 偏感知理解,VLN 把视觉语言放进导航任务,VA 和 VLA 开始输出动作,WM 和 WAM 则关注动作发生后世界会怎样变化。

VLM:机器如何理解图像和语言

VLM(Vision-Language Model)负责把图像、视频和语言放到同一个语义空间里理解。输入通常是图像或视频加文本提示,输出可以是图像描述、视觉问答答案、目标位置或空间关系。

比如给机器人一张厨房图,问它「桌上有什么」「红色杯子在哪里」「前方有没有障碍物」,VLM 不只是给图像贴标签,还能理解物体、位置、关系和场景含义。

图片 1

VLM 的边界也很清楚:它负责理解,不直接负责控制。导航和动作要交给后面的 VLN、VA、VLA 继续处理。代表工作包括 CLIP、PaLM-E、Gemini Robotics 等。

VLN:按语言指令在空间里导航

VLN(Vision-Language Navigation)关注的是智能体能不能一边看环境,一边按自然语言指令走到目标位置。相比 VLM,VLN 多了「移动」和「停下」。

VLM 可能回答「门在前方」,VLN 要进一步判断:现在该往哪里走、走到哪里转弯、什么时候停下来。比如在 Room-to-Room 任务中,智能体会收到类似「上楼,穿过正前方的拱门,经过钢琴,在挂在墙上的麋鹿鹿角旁等待」这样的指令。

图片 2

VLN 的核心难点:语言和视觉要对齐、局部视野下判断方向、长路线中的进度记忆、环境变化后的重新规划。可以理解为:VLM 让机器知道「眼前有什么」,VLN 让机器知道「该往哪里走」。

VA:不靠语言,直接从视觉到动作

VA(Vision-Action)即「视觉直接到动作」。模型看到图像、视频和当前状态后,直接预测动作、轨迹或控制量,不一定需要语言参与。

自动驾驶里的端到端驾驶策略就接近这条路线:摄像头看到道路、车辆、行人和车道线,模型直接输出未来轨迹、转向、加速度或刹车。

图片 3

VA 的特点是链路短、延迟低,适合任务边界清楚的实时控制。但局限也明显:能输出动作但不一定能解释依据,遇到训练里没覆盖的长尾场景时泛化和安全性会成问题。

VLA:把视觉、语言和动作接起来

VLA(Vision-Language-Action)是机器人基础模型里很常见的一类。基本形式是:图像/视频 + 语言指令 + 机器人状态 → 机器人动作。

相比 VA,VLA 多了语言条件,可以处理更开放的任务。真实机器人任务往往不是固定控制问题,而是用户用自然语言说「把红色杯子放到水槽旁边」「打开抽屉把勺子拿出来」。

图片 4

几项代表工作:RT-2 把机器人动作离散成 token,让视觉语言模型直接输出动作(一句话概括:把动作当成另一种 token);OpenVLA 提供了完整的开源 VLA 基线;π0/π0.7 强调连续动作和通用机器人策略,用 flow matching 输出连续控制。

VLA 的主要难点:动作怎么表示、数据从哪里来、跨本体怎么做、实时性和安全怎么保证。现在很受关注,但远没有到「一个模型解决所有机器人任务」的程度。

WM:世界模型,让机器先预演未来

WM(World Model)要回答的问题是:如果现在这样做,接下来会发生什么?核心形式是当前状态 + 候选动作 → 未来状态/视频/奖励/风险。

VLA 关心「下一步动作是什么」,世界模型更关心「如果做这个动作,世界会怎么变」。比如机器人拿起杯子时预测杯子会不会滑,智能车变道时预测旁边车辆会不会减速。

图片 5

代表工作包括 V-JEPA 2、NVIDIA Cosmos 等。

WAM:把世界模型和动作模型合起来

WAM(World Action Model)想把「动作生成」和「未来预测」放进同一个模型里。三个概念放到一起:

  • VLA:看见什么 + 想做什么 → 下一步动作
  • WM:当前世界 + 一个动作 → 未来会怎样
  • WAM:目标 + 当前状态 → 未来世界变化 + 对应动作

一句话概括 WAM:它不只学习「动作是什么」,还学习「动作如何改变世界」。

比如机器人把杯子放进洗碗机:VLA 像直接输出动作序列,WM 像评估某个动作会不会让杯子倾斜,WAM 则希望在生成动作时就带着对未来结果的判断。代表工作包括 World Action Models: The Next Frontier in Embodied AI、NVIDIA World Action Model 等。

VLX:X 代表扩展,也代表边界还没定型

VLX(Vision-Language-X)重点在最后这个 X。它可以是 action、navigation、grounding、detection,也可以是 video、control、tool use,甚至更复杂的具身任务输出。

图片 6

VLX 更像是一个扩展视角:视觉语言模型正在从「看图问答」向更多任务接口扩展。它还不是一个完全统一的学术类别,更适合用来理解趋势——视觉语言能力正在继续外接到更多任务。

苏米注

这些概念其实在回答同一个问题:模型如何从看懂图像和语言,走向在真实世界里移动、操作,并预判行动后的结果。VLA、世界模型和 WAM 经常被放在一起讨论,说明重心已经从聊天能力转向物理世界里的感知、动作和后果预测。对于开发者来说,理解这条技术主线比记住缩写更重要。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:具身智能 7 个核心概念通俗讲解:从 VLM、VLN 到世界模型
#具身智能 #VLM #VLA #世界模型 #WAM #机器人 #AI教程 
收藏 1
Google Gemini Spark 开放 AI Pro 订阅:20 美元/月的个人 AI 智能体
这是最后一篇
推荐阅读
  • OpenClaw + 飞书机器人初始化 SOP 配置详细教程
  • LangChain Deep Agent 全流程评估方案:解决 Agent 上线前的核心痛点
  • Product Manager Skills 开源:46 个实战技能 +6 个工作流,产品经理的实战 MBA
  • 腾讯系 WorkBuddy :一键部署 OpenClaw 并接入微信,扫码即用,体验丝滑
  • Anthropic长时运行Agent框架:让AI像人类工程师一样交接班
评论 (0)
请登录后发表评论
分类精选
Multi-Agent(多智能体)实战:OpenClaw x 飞书机器人,为每个业务场景打造专属多Agent项目协作群
6991 5月前
微信 iLink Bot 协议深度拆解:开发者必备实战手册
5963 4月前
微信官方 ClawBot 插件多Agent如何绑定多个微信号?让全家人都用上了OpenClaw!
4930 3月前
即梦CLI:如何用OpenClaw搭建AI工作流实现24小时自动化生图、生视频创作
4643 3月前
OpenClaw 升级到 2026.3.24 后,微信 ClawBot 插件更新指南
4355 4月前
Star-Office-UI:用像素办公室实时可视化 OpenClaw(小龙虾)的工作状态
4039 4月前
腾讯系 WorkBuddy :一键部署 OpenClaw 并接入微信,扫码即用,体验丝滑
3772 4月前
OpenClaw 飞书多 Agent 实战:一只龙虾不够用?教你养一池子龙虾
3689 4月前
7 个高质量前端UI设计的 Skills(技能包),让 AI 编程生成高质量UI代码
3492 3月前
新手入门小龙虾(OpenClaw)完整配置指南
3363 4月前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 具身智能 7 个核心概念通俗讲解:从 VLM、VLN 到世界模型
2 LangChain、AgentScope、Mem0 深度横评:谁才是 Agent 的真正记忆系统?
3 10 个 Claude Code Skill 帮你跑通一人公司创业链路
4 WorkBuddy 生图 Skill 怎么选?7个工具和 5大模型一次讲清
5 marketingskills:3.8 万 Star 的开源营销技能库,给 AI Agent 装上营销专家大脑
6 大模型解决智能问题,Harness解决交付问题
7 让AI自己写策略跑回测:基于Loop Engineering的量化开发范式
8 AI Agent 实战:从建站到数据分析,AI 如何从文本对话转向自主行动
9 herdr:专为多 Agent 协作设计的终端管理神器,1.3 万 Star 开源项目
10 Hermes Agent 接入 OpenViking 外部记忆库:长期经验沉淀与检索全指南
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联