前面几篇,我们分别聊了机器人如何"看懂"世界(传感器融合与 SLAM)和如何"动起来"(运动控制与强化学习)。但在传统机器人系统里,这两件事是分开的——感知模块输出"前方有一把椅子",规划模块决定"绕开它",控制模块算出"腿关节用多大扭矩"。三段流水线,各管一段。
VLA(视觉-语言-动作)模型要做的事截然不同:一个模型,一次性把摄像头画面加自然语言指令,直接映射成机器人动作。 它不再需要三段式流水线,而是让大模型"长出身体"。
从"三段式"到"一张网"
传统机器人架构是感知→规划→控制的串行链路。每个模块独立设计、独立调试,数据格式在模块间转换——感知模块输出结构化表示(如目标检测框),规划模块输出路径点,控制模块输出关节力矩。这种解耦的好处是各模块可独立优化,坏处是信息在传递中不断丢失:感知模块"看到"的内容,经过规划模块的抽象,到控制模块那里已经只剩数学坐标。
VLA 的思路完全不同:把整个感知-决策-控制过程塞进一个巨大的神经网络。输入是摄像头图像加自然语言指令("把桌上的苹果拿给我"),输出是机械臂末端执行器的位置和夹爪开合度。中间没有"感知模块""规划模块""控制模块"的明确边界——模型自己学会了从像素到动作的映射。
这个思路的技术基础是近几年大模型(LLM/VLM)的突破。如果大模型能"理解"一张图片里有什么、一段文字什么意思,那它能不能也"理解"该做什么动作?1
RT-2:第一个证明"能"的模型
2023年7月,Google DeepMind 发布了 RT-2(Robotic Transformer 2),这是第一个真正意义上的 VLA 模型。12
RT-2 的核心想法极其简洁:把机器人的动作表示成文本 token。 一个动作指令——比如"末端平移 (+0.05, 0, -0.02) 米,夹爪闭合"——被编码成一段数字字符串,像 "1 128 91 241 5 101 127 217" 这样的 token 序列。然后,用预训练好的视觉-语言模型(PaLI-X 或 PaLM-E)做 backbone,同时在互联网级别的图文数据和机器人演示数据上做联合微调。最终,模型既能理解"把可乐罐放到泰勒·斯威夫特旁边"这种语义指令(需要知道泰勒·斯威夫特长什么样,而机器人训练数据里从未出现过),也能输出对应的机械臂控制指令。2
在定量评估中,RT-2 在训练数据中从未见过的场景上,泛化成功率从 RT-1 的 32% 跃升到 62%,提升了近一倍。它还展现出一些"涌现"能力:比如面对"把快要掉下桌子的袋子捡起来"这种需要推理的指令——它从没被教过"快要掉下"是什么意思,但凭借对互联网图文的理解,它做到了。1
但 RT-2 有一个致命短板:控制频率只有 1–3 Hz。这意味着它每 300–1000 毫秒才能输出一次动作指令。相比之下,上一篇提到的四足机器人运动控制需要 500 Hz——快了三个数量级。所以,RT-2 目前只能用于相对缓慢的桌面操作任务(抓取、放置、推拉),离"跑起来"还有很大距离。
OpenVLA:开源生态的追赶
2024年,斯坦福和伯克利联合发布了 OpenVLA——一个 7B 参数的开源 VLA 模型,在 97 万条机器人演示数据(来自 Open X-Embodiment 数据集,涵盖多种机器人平台)上训练。3
OpenVLA 的架构延续了 RT-2 的思路:用预训练的视觉编码器(DINOv2 + SigLIP 融合)+ 投影层 + Llama 2 7B 语言模型,输出 token 化的动作序列。它的关键贡献是 开源 和 可微调:研究者可以用 LoRA(低秩适配)在消费级 GPU 上微调模型,使其适配新的机器人平台,而只需更新 1.4% 的参数量。在 29 个任务上的综合评估中,OpenVLA 以仅 7B 参数超越了参数量 55B 的闭源模型 RT-2-X,绝对成功率高出 16.5%。3
尤其在需要语言指令区分的多目标场景中,OpenVLA 比从头训练的模仿学习方法(如 Diffusion Policy)高出 20.4%——这说明预训练带来的"语义理解"能力确实管用。
三大瓶颈:数据、泛化与安全
VLA 模型展示了令人兴奋的可能性,但离大规模部署还有三道难关。
第一,真机数据稀缺。 互联网上有海量的图文数据,但机器人演示数据极度昂贵——需要人工遥控机器人完成动作,每一秒操作都要付出时间和硬件成本。OpenVLA 用了 97 万条轨迹,听起来很多,但相比 GPT 等模型训练所用的万亿级 token,只是九牛一毛。数据量不足直接限制了 VLA 的泛化能力。
第二,跨场景泛化依然脆弱。 虽然 VLA 在简单抓取任务上效果不错,但在复杂工业环境、高精度装配、长序列任务中,成功率会大幅下降。2025 年的一项工业部署研究显示,VLA 在简单抓取任务上表现尚可,但在复杂场景和多品类物体上"还有很大提升空间"。4 一个在实验室桌面上能 90% 成功抓取可乐罐的模型,放到工厂流水线上,面对不同光照、不同背景、不同物体,成功率可能骤降到 50% 以下。
第三,安全是硬约束。 大模型输出文本时"胡说八道"最多让人尴尬,但输出动作时"胡说八道"可能导致机器人撞坏物体、伤到人。2025 年提出的 SafeVLA 框架发现,未经安全对齐的 VLA 模型存在两类危险行为:忽视环境中与任务无关的物体(比如撞倒旁边的花瓶),以及不关心自身硬件安全(比如用关节硬碰障碍物)。SafeVLA 通过带约束的强化学习,将不安全行为的理论上界降低到原来的 1/35。5 但这项工作目前只在仿真中验证,真实部署的安全保障仍是开放问题。
小结:VLA 意味着什么?
VLA 是具身智能领域最令人兴奋的进展之一。它证明了:大模型不只会在数字世界里"思考",也能在物理世界里"动手"。 一个模型能同时理解"把香蕉放在苹果旁边"这句话的语义、识别香蕉和苹果的视觉特征,并控制机械臂精确完成这个动作——这在三年前还接近科幻。
但 VLA 不是万能的。它的控制频率太慢,无法用于需要快速反应的运动控制;它对数据的需求极大,且真实世界的数据远不如互联网图文那么容易获取;它在安全方面还缺乏可靠的保障。最现实的前景是:VLA 做高级规划和"常识理解",底层运动控制依然交给传统方法——就像人类用大脑下指令"去拿杯子",但执行这个动作的小脑回路并不需要经过意识层面的推理。
下一篇,我们进入更前沿的话题:当机器人不仅会"看"和"动",还能"记住"和"规划"时,还差什么?