# 大模型进入身体：VLA（视觉-语言-动作）模型

一个模型直接把摄像头画面加自然语言指令映射成机器人动作——它如何工作，做到了什么，以及还有哪三道难关

> VLA 模型 · 大模型与机器人 · 感知-行动闭环 · 约 6 分钟 · 07 月 11 日

## 本篇要点

1. VLA 模型将传统三段式（感知→规划→控制）流水线压缩成一个端到端神经网络，从像素和语言直接映射到动作。
2. RT-2（2023）首次证明：把机器人动作编码成文本 token，用预训练 VLM 做 backbone 联合微调，即可实现跨场景泛化——从未见过的场景上成功率从 32% 提升到 62%。
3. OpenVLA（2024）以 7B 开源模型超越 55B 闭源模型，且支持 LoRA 高效微调，但控制频率仅 1–3 Hz，无法用于快速运动控制。
4. 三大瓶颈：真机数据稀缺（97 万条轨迹远不及互联网图文规模）、跨场景泛化脆弱（实验室→工厂成功率骤降）、安全缺乏保障（SafeVLA 将不安全行为上界降至 1/35 但仍只在仿真中验证）。

---

前面几篇，我们分别聊了机器人如何"看懂"世界（传感器融合与 SLAM）和如何"动起来"（运动控制与强化学习）。但在传统机器人系统里，这两件事是分开的——感知模块输出"前方有一把椅子"，规划模块决定"绕开它"，控制模块算出"腿关节用多大扭矩"。三段流水线，各管一段。

VLA（视觉-语言-动作）模型要做的事截然不同：**一个模型，一次性把摄像头画面加自然语言指令，直接映射成机器人动作。** 它不再需要三段式流水线，而是让大模型"长出身体"。

## 从"三段式"到"一张网"

传统机器人架构是感知→规划→控制的串行链路。每个模块独立设计、独立调试，数据格式在模块间转换——感知模块输出结构化表示（如目标检测框），规划模块输出路径点，控制模块输出关节力矩。这种解耦的好处是各模块可独立优化，坏处是信息在传递中不断丢失：感知模块"看到"的内容，经过规划模块的抽象，到控制模块那里已经只剩数学坐标。

VLA 的思路完全不同：把整个感知-决策-控制过程塞进一个巨大的神经网络。输入是摄像头图像加自然语言指令（"把桌上的苹果拿给我"），输出是机械臂末端执行器的位置和夹爪开合度。中间没有"感知模块""规划模块""控制模块"的明确边界——模型自己学会了从像素到动作的映射。

这个思路的技术基础是近几年大模型（LLM/VLM）的突破。如果大模型能"理解"一张图片里有什么、一段文字什么意思，那它能不能也"理解"该做什么动作？[1]

## RT-2：第一个证明"能"的模型

2023年7月，Google DeepMind 发布了 RT-2（Robotic Transformer 2），这是第一个真正意义上的 VLA 模型。[1][2]

RT-2 的核心想法极其简洁：**把机器人的动作表示成文本 token。** 一个动作指令——比如"末端平移 (+0.05, 0, -0.02) 米，夹爪闭合"——被编码成一段数字字符串，像 `"1 128 91 241 5 101 127 217"` 这样的 token 序列。然后，用预训练好的视觉-语言模型（PaLI-X 或 PaLM-E）做 backbone，同时在互联网级别的图文数据和机器人演示数据上做联合微调。最终，模型既能理解"把可乐罐放到泰勒·斯威夫特旁边"这种语义指令（需要知道泰勒·斯威夫特长什么样，而机器人训练数据里从未出现过），也能输出对应的机械臂控制指令。[2]

在定量评估中，RT-2 在训练数据中从未见过的场景上，泛化成功率从 RT-1 的 32% 跃升到 62%，提升了近一倍。它还展现出一些"涌现"能力：比如面对"把快要掉下桌子的袋子捡起来"这种需要推理的指令——它从没被教过"快要掉下"是什么意思，但凭借对互联网图文的理解，它做到了。[1]

但 RT-2 有一个致命短板：**控制频率只有 1–3 Hz**。这意味着它每 300–1000 毫秒才能输出一次动作指令。相比之下，上一篇提到的四足机器人运动控制需要 500 Hz——快了三个数量级。所以，RT-2 目前只能用于相对缓慢的桌面操作任务（抓取、放置、推拉），离"跑起来"还有很大距离。

## OpenVLA：开源生态的追赶

2024年，斯坦福和伯克利联合发布了 OpenVLA——一个 7B 参数的开源 VLA 模型，在 97 万条机器人演示数据（来自 Open X-Embodiment 数据集，涵盖多种机器人平台）上训练。[3]

OpenVLA 的架构延续了 RT-2 的思路：用预训练的视觉编码器（DINOv2 + SigLIP 融合）+ 投影层 + Llama 2 7B 语言模型，输出 token 化的动作序列。它的关键贡献是**开源**和**可微调**：研究者可以用 LoRA（低秩适配）在消费级 GPU 上微调模型，使其适配新的机器人平台，而只需更新 1.4% 的参数量。在 29 个任务上的综合评估中，OpenVLA 以仅 7B 参数超越了参数量 55B 的闭源模型 RT-2-X，绝对成功率高出 16.5%。[3]

尤其在需要语言指令区分的多目标场景中，OpenVLA 比从头训练的模仿学习方法（如 Diffusion Policy）高出 20.4%——这说明预训练带来的"语义理解"能力确实管用。

## 三大瓶颈：数据、泛化与安全

VLA 模型展示了令人兴奋的可能性，但离大规模部署还有三道难关。

**第一，真机数据稀缺。** 互联网上有海量的图文数据，但机器人演示数据极度昂贵——需要人工遥控机器人完成动作，每一秒操作都要付出时间和硬件成本。OpenVLA 用了 97 万条轨迹，听起来很多，但相比 GPT 等模型训练所用的万亿级 token，只是九牛一毛。数据量不足直接限制了 VLA 的泛化能力。

**第二，跨场景泛化依然脆弱。** 虽然 VLA 在简单抓取任务上效果不错，但在复杂工业环境、高精度装配、长序列任务中，成功率会大幅下降。2025 年的一项工业部署研究显示，VLA 在简单抓取任务上表现尚可，但在复杂场景和多品类物体上"还有很大提升空间"。[4] 一个在实验室桌面上能 90% 成功抓取可乐罐的模型，放到工厂流水线上，面对不同光照、不同背景、不同物体，成功率可能骤降到 50% 以下。

**第三，安全是硬约束。** 大模型输出文本时"胡说八道"最多让人尴尬，但输出动作时"胡说八道"可能导致机器人撞坏物体、伤到人。2025 年提出的 SafeVLA 框架发现，未经安全对齐的 VLA 模型存在两类危险行为：忽视环境中与任务无关的物体（比如撞倒旁边的花瓶），以及不关心自身硬件安全（比如用关节硬碰障碍物）。SafeVLA 通过带约束的强化学习，将不安全行为的理论上界降低到原来的 1/35。[5] 但这项工作目前只在仿真中验证，真实部署的安全保障仍是开放问题。

## 小结：VLA 意味着什么？

VLA 是具身智能领域最令人兴奋的进展之一。它证明了：**大模型不只会在数字世界里"思考"，也能在物理世界里"动手"。** 一个模型能同时理解"把香蕉放在苹果旁边"这句话的语义、识别香蕉和苹果的视觉特征，并控制机械臂精确完成这个动作——这在三年前还接近科幻。

但 VLA 不是万能的。它的控制频率太慢，无法用于需要快速反应的运动控制；它对数据的需求极大，且真实世界的数据远不如互联网图文那么容易获取；它在安全方面还缺乏可靠的保障。最现实的前景是：**VLA 做高级规划和"常识理解"，底层运动控制依然交给传统方法——就像人类用大脑下指令"去拿杯子"，但执行这个动作的小脑回路并不需要经过意识层面的推理。**

下一篇，我们进入更前沿的话题：当机器人不仅会"看"和"动"，还能"记住"和"规划"时，还差什么？

## 来源

1. [Google DeepMind 官方博客：RT-2 — New model translates vision and language into action](https://deepmind.google/blog/rt-2-new-model-translates-vision-and-language-into-action/)
2. [RT-2 项目主页：论文、演示视频与技术细节](https://robotics-transformer2.github.io/)
3. [OpenVLA 项目主页：模型架构、训练数据、基准测试与开源资源](https://openvla.github.io/)
4. [VLA 模型工业部署研究：架构、性能与挑战（2025）](https://arxiv.org/html/2509.23121)
5. [SafeVLA：通过安全强化学习对齐 VLA 模型（2025）](https://arxiv.org/html/2503.03480v1)

---

原文：https://pangzhengboyin.com/articles/vision-language-action-models-5b5ba464

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
