大语言模型、视觉语言模型、视觉语言动作模型、世界模型和具身智能经常出现在同一段讨论中,但它们并不处于同一个分类层级。LLM、VLM、VLA 描述模型处理的信息和输出形式;世界模型描述对环境动态的建模方式;具身智能描述智能体通过身体与环境持续交互的研究方向;真实世界与仿真则是数据产生和系统运行的环境。

区分这些术语,最有效的方法不是比较模型名称,而是依次确认四件事:系统接收什么输入、产生什么输出、输出是否会改变环境、动作之后是否还会根据新观测继续决策。

一、完整技术框架

具身系统的基本运行方式是闭环:传感器获取当前观测,系统理解任务和环境状态,规划下一步行动,机器人执行动作,随后再次观察动作造成的结果。只要环境会变化、观测存在误差或动作可能失败,这个循环就不能省略。

具身智能的感知—决策—行动闭环

在工程系统中,这个闭环通常包含以下层次:

  1. 传感器层采集 RGB 图像、深度图、点云、关节位置、末端位姿、力觉和触觉等数据。
  2. 感知与理解层识别对象、空间关系、可操作区域、任务条件和当前执行状态。
  3. 任务规划层把自然语言目标拆成子目标,选择技能,并决定执行顺序。
  4. 策略层根据观测和任务生成动作或一段动作序列。
  5. 运动规划与控制层处理碰撞约束、逆运动学、轨迹跟踪、速度、位置或力矩控制。
  6. 执行与反馈层检查动作结果,识别失败并触发重试、纠正或重新规划。

这些功能可以由一个端到端模型承担一部分,也可以由多个专用模块组合完成。VLA 是其中的一类策略模型,不是整个机器人系统的同义词。

二、LLM:以语言序列为核心的大模型

LLM 是 Large Language Model 的缩写,中文通常写作大语言模型。它通过大规模文本训练学习语言序列的统计结构,现代 LLM 大多采用 Transformer 架构。其核心接口可以写成:

模型根据已有 token 序列预测后续 token,再通过连续生成完成问答、摘要、代码生成和任务分解等工作。Transformer 论文给出了以注意力机制为核心的序列建模架构,GPT-3 则展示了扩大自回归语言模型后形成的少样本任务能力。

LLM 可以为机器人生成高层步骤,也可以调用外部工具,但普通 LLM 并不天然接收相机图像、关节状态和力觉数据,也不天然输出满足机器人动力学约束的控制量。语言计划与物理动作之间仍然存在感知落地、状态估计、动作生成和安全控制等环节。

MLLM 与 LMM

MLLM 通常展开为 Multimodal Large Language Model,强调以语言模型为核心接入图像、视频、音频等模态。LMM 展开为 Large Multimodal Model,范围更宽,不一定把语言置于绝对中心。论文和产品文档中经常混用这两个名称,因此阅读时应优先看模型的输入、输出和训练目标,而不是只看缩写。

三、VLM:视觉信息与语言对齐

VLM 是 Vision-Language Model 的缩写,中文为视觉语言模型。它联合处理图像或视频与文本,使视觉内容能够被语言查询、描述或用于推理。常见接口包括:

VLM 的输出并不局限于自然语言。CLIP 通过图像与文本的对比学习获得共享表示,适合开放词汇分类和检索;带生成式语言模型的 VLM 可以完成图像描述、视觉问答、OCR、目标定位和视觉推理。PaLM-E 进一步把视觉和连续状态估计编码接入语言模型,能够处理机器人规划等具身任务,但它在论文中的定位仍是具身多模态语言模型,并不等同于直接输出低层控制动作的 VLA。

对机器人而言,VLM 的主要价值是把任务语言与视觉场景关联起来。它可以判断目标物体、关系和语义条件,也可以生成操作步骤。若输出仍是文本计划、目标标签或坐标,系统还需要策略、运动规划和控制模块才能执行。

四、VLA:多模态模型直接预测动作

VLA 是 Vision-Language-Action Model 的缩写,中文为视觉语言动作模型。RT-2 论文把这类模型定义为同时利用视觉、语言和机器人动作数据,并把机器人动作纳入统一建模过程的模型。其典型接口是:

VLM 与 VLA 的输入输出边界

RT-2 将连续机器人动作离散化为 token,使动作数据可以与视觉语言任务共同训练。OpenVLA 采用视觉编码器与 Llama 2 语言模型组成 7B 参数模型,在 Open X-Embodiment 的 97 万条真实机器人轨迹上训练,并同样预测离散化动作。这里的动作可表示末端执行器的位姿增量、旋转、夹爪开合或其他机器人相关控制维度。

离散动作 token 只是 VLA 的一种实现。VLA 也可以预测连续动作,用扩散模型生成动作分布,或一次预测多个时间步的动作块。决定模型是否属于 VLA 的关键不是动作是否文本化,而是模型是否把视觉、语言条件与可执行动作映射放在同一个策略中学习。

VLA 相比 VLM 多完成了从语义理解到动作选择的一段映射,但仍不代表模型输出可以不经处理直接写入电机。实际部署通常还要加入动作反归一化、坐标系转换、可达性检查、碰撞检测、速度与力矩限制、急停逻辑和底层控制器。

五、具身智能

具身智能不是某一种模型,而是一类研究问题:智能体具有可感知和可行动的身体,在环境中通过连续交互完成任务,并让行动结果影响后续观测与决策。

这个定义有三个边界需要明确。

第一,具身智能不等于人形机器人。机械臂、移动机器人、无人机、自动驾驶系统和带虚拟身体的仿真智能体都可以构成具身系统。身体形态会决定传感器、动作空间、可达范围和动力学约束,研究中常用 embodiment 表示这种载体及其能力边界。

第二,机器人不一定具有具身智能。按照固定轨迹重复焊接的工业机器人具备物理身体,但如果它不根据环境变化进行感知和闭环决策,通常不会被作为具身智能系统讨论。

第三,具身智能并不要求所有模块都由神经网络实现。学习模型可以负责感知、技能选择或策略,传统运动规划、状态估计和反馈控制仍然可以承担关键功能。系统是否具身,取决于它是否通过身体与环境形成感知—决策—行动闭环,而不是取决于模型数量或端到端程度。

六、真实世界与仿真

真实世界在机器人学习中通常指物理机器人、真实传感器、真实物体和真实场地组成的运行环境。真实世界数据来自实际执行过程,因此会包含传感器噪声、照明变化、相机标定误差、摩擦、柔性、接触不确定性、通信延迟、执行器磨损和人为干扰。训练或评估时还必须考虑设备成本、操作安全、恢复时间和数据采集速度。

仿真环境由物理引擎、渲染器和任务逻辑构成。它可以快速生成大量交互数据,精确读取系统状态,方便重置场景,也允许测试危险动作。MuJoCo、Isaac Sim、Gazebo、PyBullet、Habitat 和 ManiSkill 都属于常见仿真平台或生态,但它们覆盖的物理精度、传感器模拟、任务类型和计算效率并不相同。

MuJoCo 中的 body、geom 与 site 元素

仿真不等于真实世界的完整复制。仿真模型省略或近似了材料形变、摩擦变化、相机噪声、线缆干扰和硬件老化等因素,由此形成 sim-to-real gap,也称仿真到现实差距。常用缩小方法包括:

  • 系统辨识:用真实测量估计质量、摩擦、延迟和执行器参数。
  • 域随机化:在训练时随机改变纹理、光照、相机、物理参数和物体布局,减少策略对单一仿真条件的依赖。
  • 域适配:对齐仿真数据与真实数据的特征或分布。
  • 真实数据微调:先在仿真中获得基础能力,再用少量真实轨迹适配。
  • 混合训练:同时使用仿真数据、真实数据和模型生成的数据。

MuJoCo 中的程序化地形生成

​ MuJoCo 中的程序化地形生成示例

域随机化论文展示了只用随机纹理仿真图像训练的目标定位模型向真实抓取任务迁移的结果。这个方法说明增加仿真变化有助于迁移,但不能推出真实数据已经不再需要。接触丰富、柔性物体、精细装配和长期运行等任务仍然高度依赖真实系统校准与评估。

七、世界模型:学习环境如何随动作变化

世界模型是对环境动态的可学习表示。它根据当前状态或观测以及候选动作,预测下一状态、下一观测、奖励、终止概率或这些量的潜在表示。一个常见形式是:

当高维图像先被编码为潜在状态时,模型也可以在潜在空间中预测未来。Ha 与 Schmidhuber 的 World Models 将环境压缩表示、时间动态模型和控制器组合起来;DreamerV3 则在学习到的环境模型中预测未来并改进策略。

世界模型可以支持多种用途:

  • 在执行前模拟多个动作后果,辅助规划和模型预测控制。
  • 在潜在空间中生成训练轨迹,降低真实交互成本。
  • 预测碰撞、失败、奖励或任务终止。
  • 估计不可直接观测的状态,帮助策略利用历史信息。

世界模型与 VLA 不是互斥概念,也不是上下位关系。VLA 可以完全不显式预测未来,只学习观测到动作的映射;也可以在内部或外部接入世界模型,对候选动作进行评估。能够生成视频的模型也不自动成为机器人世界模型,只有当它能在动作条件下提供对决策有用的环境动态预测时,这个称呼才更准确。

八、策略、规划与控制

这三个词都与行动有关,但处理的时间尺度和约束不同。

策略

策略 policy 描述在给定状态、观测和任务条件下如何选择动作:

其中 是当前及历史观测, 是任务条件。策略可以是确定性的,也可以输出动作概率分布。VLA、Diffusion Policy 和 RT-1 都可以作为策略模型。策略学习关注从数据或交互中获得动作映射。

任务规划与运动规划

任务规划决定做什么以及先后顺序,例如定位目标、接近目标、抓取、移动和放置。SayCan 使用语言模型给出的技能相关性与技能价值函数结合,在机器人已有技能中选择可行步骤。

运动规划决定身体怎样从当前构型移动到目标构型,通常要满足关节限制、碰撞约束、速度限制和动力学条件。它的输出可能是关节路径、末端轨迹或带时间参数的运动序列。

控制

控制器负责让真实机器人跟踪目标位置、速度、轨迹或力。位置控制、速度控制、阻抗控制和力矩控制都属于这一层。控制频率通常高于高层规划和视觉策略频率,但具体数值由机器人、传感器和任务决定。

任务规划、策略和控制可以组成分层系统,也可以由端到端模型跨越部分边界。工程上仍应保留明确的接口,因为安全约束、实时性和故障诊断通常需要独立处理。

九、机器人模型如何训练

1. 自监督与多模态预训练

模型先在文本、图像—文本对、视频或无标注机器人数据上学习通用表示。CLIP 的图文对比学习、VLM 的生成式视觉语言训练都属于这一类。预训练可以提高语义能力和视觉泛化,但网络数据不会自动提供准确的机器人动作知识。

2. 模仿学习与行为克隆

行为克隆把专家轨迹中的观测—动作对作为监督数据,直接训练策略预测专家动作。数据可以由人工遥操作、示教器、脚本控制器、传统规划器或已有策略产生。

行为克隆的主要问题是训练时看到的状态来自专家,部署时的状态却会被模型自身误差逐步改变。DAgger 通过迭代收集当前策略访问到的状态并请求专家标注,缓解这种分布偏移。实践中还会使用数据重采样、噪声注入、失败恢复轨迹和在线纠正来覆盖偏离状态。

3. 强化学习

强化学习根据环境反馈优化累计回报。它适合目标可以通过奖励表达、但难以逐步标注正确动作的任务。训练可以发生在真实机器人、仿真环境或学习到的世界模型中。机器人强化学习必须额外处理探索安全、样本效率、奖励设计和硬件损耗。

4. 离线学习

离线模仿学习或离线强化学习只使用预先收集的数据集训练,不在训练过程中持续访问真实环境。它便于复用大规模轨迹并降低在线风险,但策略容易在数据覆盖范围之外失真,因此需要谨慎评估分布外动作。

5. 联合训练与协同微调

RT-2 同时使用机器人轨迹和互联网视觉语言任务进行协同微调,把动作离散化后与文本 token 放入统一输出空间。OpenVLA 则从预训练 VLM 出发,在多来源真实机器人演示上训练动作预测。联合训练的目标是保留视觉语言语义能力,同时建立观测到动作的映射。

6. 跨机器人数据与动作对齐

不同机器人拥有不同关节数、相机位置、工作空间和控制接口,不能直接把原始动作拼接到同一数据集中。Open X-Embodiment 将 22 种机器人数据整理为标准格式,并训练 RT-X 研究跨机器人迁移。实际处理通常包括统一坐标约定、动作归一化、时间对齐、缺失模态处理和机器人身份条件化。

7. 微调、参数高效适配与量化

通用策略部署到新机器人或新场景时,通常仍需任务数据。全量微调会更新全部参数,参数高效方法只训练少量适配参数,量化则降低显存和推理成本。OpenVLA 提供了 LoRA 微调和量化部署方案,但模型许可证、基础模型许可证、数据许可证和代码许可证需要分别检查,不能只依据代码仓库许可证判断模型是否可商用。

十、一个完整任务怎样执行

以把红色杯子放到托盘为例,完整链路可以拆成以下步骤:

  1. 接收任务:语言模块解析目标物体、目标位置和完成条件。
  2. 获取观测:相机、深度传感器和机器人状态接口提供当前信息。
  3. 场景理解:VLM 或感知模型识别红色杯子、托盘、障碍物和空间关系。
  4. 状态落地:系统把语言中的对象与图像区域、三维位置和可操作部位对应起来。
  5. 任务规划:系统决定接近、预抓取、闭合夹爪、抬升、移动、放置和撤离等阶段。
  6. 动作生成:VLA 或专用策略根据当前观测预测末端位姿增量、夹爪动作或动作块。
  7. 安全与运动约束:规划器或安全层检查碰撞、关节范围、速度和工作空间限制。
  8. 底层控制:控制器把轨迹转换成执行器可跟踪的指令,并处理位置、速度或力反馈。
  9. 闭环校正:系统重新观察杯子是否抓稳、是否滑动、托盘位置是否变化,并调整动作。
  10. 完成判断:视觉、力觉或任务状态判断杯子是否稳定放入托盘;失败时执行重试或重新规划。

VLM 可以主要承担第 3 至第 5 步,VLA 可以覆盖第 3 至第 6 步的一部分,世界模型可以在第 5 至第 7 步预测动作后果。无论模型覆盖多少步骤,真实系统仍需第 7 至第 10 步的约束、执行与反馈。

十一、常见误区

VLM 能描述动作,因此就是 VLA

不成立。VLM 输出一段操作文字,与输出和机器人动作空间对齐、能进入控制链路的动作表示不同。判断依据应是训练数据、输出空间和执行接口。

VLA 等于完整的具身智能系统

不成立。VLA 是策略模型的一种。传感器同步、状态估计、运动规划、安全控制、执行器驱动、故障恢复和完成检测仍属于系统的一部分。

端到端模型不需要控制器

不成立。端到端通常表示从多模态观测直接预测较高层动作,但电机驱动仍需要实时控制、限幅和安全保护。端到端描述学习接口,不代表物理执行链路消失。

真实世界数据就是未经处理的原始数据

不成立。真实数据也要经过时间同步、标定、清洗、切片、动作归一化和质量筛选。真实世界描述数据来源,不描述数据处理程度。

仿真数据足够多就能完全替代真实数据

不成立。仿真可以扩大覆盖范围并降低成本,但模型误差会在接触、摩擦、柔性和传感器噪声中暴露。最终能力仍需在目标硬件和目标环境中验证。

世界模型就是更大的 VLM 或视频生成模型

不成立。世界模型的核心是预测环境状态如何在动作条件下演化,并服务于决策。生成视觉上合理的视频不足以证明其物理预测适合控制。

具身智能只研究人形机器人

不成立。具身智能关注身体、环境和闭环交互,人形只是一种 embodiment。

模型规模越大,机器人泛化就一定越好

不成立。机器人能力还受训练数据覆盖、动作标注质量、控制频率、传感器配置、机器人形态和安全约束影响。扩大模型不能弥补动作数据或系统接口的根本缺失。

十二、术语速查表

术语 中文 典型输入 典型输出 关键边界
LLM 大语言模型 文本 token 文本或结构化 token 以语言序列建模为核心,不天然连接机器人动作空间
MLLM 多模态大语言模型 文本、图像、视频、音频等 文本、结构化结果或多模态内容 通常以 LLM 为核心接入其他模态
LMM 大型多模态模型 多种模态 多种模态或表示 比 MLLM 更宽泛,实际文献中常混用
VLM 视觉语言模型 图像或视频、文本 文本、类别、坐标或表示 建立视觉与语言的对应关系,不必输出机器人动作
VLA 视觉语言动作模型 视觉、语言、机器人状态或历史 动作、动作 token 或动作块 输出与机器人动作空间对齐,可进入行动链路
具身智能 通过身体与环境交互的智能系统与研究方向 感知、任务、身体状态 持续决策与行动 强调感知—决策—行动闭环,不限定机器人外形
Embodiment 身体形态及能力边界 传感器、关节、执行器、工作空间 可感知和可执行的范围 同一任务在不同机器人上会形成不同状态与动作空间
真实世界 物理运行与数据采集环境 真实传感器和物理状态 带噪声、延迟和风险的交互数据 是环境类别,不是模型类型
仿真 计算机生成的物理与视觉环境 场景、物理参数、控制指令 合成观测、状态和反馈 便于扩展与重置,但存在仿真到现实差距
世界模型 环境动态预测模型 当前状态或观测、动作 未来状态、观测、奖励或潜变量 关注动作条件下的未来演化,不等同于策略
Policy 策略 状态或观测、任务 动作分布或动作 回答当前条件下采取什么动作
Task Planning 任务规划 目标、场景、技能集合 子目标与技能顺序 处理做什么和先后顺序
Motion Planning 运动规划 起点、终点、机器人模型、障碍物 无碰撞路径或轨迹 处理身体怎样移动
Control 控制 目标轨迹、实时状态 位置、速度或力矩指令 高频跟踪与稳定执行
Behavior Cloning 行为克隆 专家观测—动作对 模仿专家的策略 简单有效,但容易受分布偏移影响
Reinforcement Learning 强化学习 环境交互与奖励 最大化累计回报的策略 依赖奖励、探索和交互成本
Sim-to-Real 仿真到现实迁移 仿真训练结果、少量真实数据 可在真实系统工作的模型 需要处理视觉和动力学差异

结语

这些术语可以放在同一条系统链路上理解:LLM 提供语言知识与任务分解能力,VLM 把语言与视觉场景对齐,VLA 进一步把多模态条件映射到机器人动作,世界模型预测动作可能造成的未来变化,规划器和控制器把决策变成满足约束的物理运动。具身智能覆盖的是这条链路与环境反复交互的完整闭环,真实世界和仿真则决定数据与反馈从哪里产生。

因此,阅读一篇机器人论文时,先确认输入、输出、训练数据、动作空间和部署闭环,比依据模型名称判断能力更可靠。

参考资料

  1. Vaswani, A. et al. 2017. Attention Is All You Need. NeurIPS 2017.
  2. Brown, T. B. et al. 2020. Language Models are Few-Shot Learners. NeurIPS 2020.
  3. Radford, A. et al. 2021. Learning Transferable Visual Models From Natural Language Supervision. ICML 2021.
  4. Duan, J. et al. 2022. A Survey of Embodied AI: From Simulators to Research Tasks. IEEE Transactions on Emerging Topics in Computational Intelligence.
  5. Driess, D. et al. 2023. PaLM-E: An Embodied Multimodal Language Model. ICML 2023.
  6. Brohan, A. et al. 2022. RT-1: Robotics Transformer for Real-World Control at Scale. arXiv preprint.
  7. Brohan, A. et al. 2023. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. Conference on Robot Learning 2023.
  8. Kim, M. J. et al. 2024. OpenVLA: An Open-Source Vision-Language-Action Model. Conference on Robot Learning 2024.
  9. O’Neill, A. et al. 2023. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. IEEE International Conference on Robotics and Automation 2024.
  10. Ahn, M. et al. 2022. Do As I Can, Not As I Say: Grounding Language in Robotic Affordances. arXiv preprint.
  11. Chi, C. et al. 2023. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. Robotics: Science and Systems 2023.
  12. Ross, S., Gordon, G. J., and Bagnell, J. A. 2011. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning. AISTATS 2011.
  13. Tobin, J. et al. 2017. Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World. IEEE/RSJ International Conference on Intelligent Robots and Systems 2017.
  14. Ha, D. and Schmidhuber, J. 2018. World Models. arXiv preprint.
  15. Hafner, D. et al. 2023. Mastering Diverse Domains through World Models. arXiv preprint.
  16. Todorov, E., Erez, T., and Tassa, Y. 2012. MuJoCo: A Physics Engine for Model-Based Control. IEEE/RSJ International Conference on Intelligent Robots and Systems 2012.