首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >VLA 模型三部曲:OpenVLA、π₀、GO-1 如何重新定义机器人控制

VLA 模型三部曲:OpenVLA、π₀、GO-1 如何重新定义机器人控制

作者头像
heidsoft
发布2026-07-23 20:18:34
发布2026-07-23 20:18:34
1680
举报

AI论文陪读 · 具身智能

VLA 模型三部曲: OpenVLA、π₀、GO-1 如何重新定义机器人控制

Vision-Language-Action Model · Stanford · Physical Intelligence · 智元机器人

OPC

云与数字化

1 人公司 · LLM 协作 · 工程底座

+ 关注

上一期聊了 RT-1 / RT-2(Google,2022~2023):动作 token 化 + VLM 预训练知识迁移,零样本语义推理成了。但 RT-2 是 Google 闭源、55B 参数、无法部署——学术标杆,产品障碍。这一期看三件事:OpenVLA(开源能不能打)、π₀(fast motor control 的答案)、GO-1(国产 VLA 新坐标)。

核心结论 · CORE INSIGHT

三代 VLA 的演进逻辑:OpenVLA 回答"开源能不能部署",π₀ 回答"动作生成够不够快",GO-1 回答"国产化怎么做到产品级"。背后是同一个工程矛盾——怎么把互联网规模的语言-视觉知识,塞进一个实时响应机械臂的控制信号里。

01

OpenVLA:开源 VLA 的里程碑(Stanford + NVIDIA,2024)

OpenVLA(arXiv:2409.10846,2024 年 9 月)是 Stanford HAI + NVIDIA TITANS 团队的工作,号称"第一个 open-source 7B VLA,在真实机器人上达到 RT-2 水平"。这句话有争议,但开源本身没争议。

核心数字

7B 参数(Llama 2 7B + 视觉 encoder),RT-2 是 55B,体积小 8 倍

开源权重(Apache 2.0),RT-2 闭源,OpenVLA 可本地部署

多实体机器人验证: WidowX、Franka、xArm 等 7 种实体,证明跨实体迁移可行

训练数据:Open X-Embodiment 数据集子集 + 97K 演示数据

架构:SigLIP So400m 视觉 encoder + Llama 2 7B 语言 backbone + 动作预测头。SigLIP 是 Google 的 open-source CLIP 替代方案,在图像-文本对比学习上效果更好。

泛化能力测试:OpenVLA 在novel objects/novel backgrounds/novel instructions 三个维度上,对比 RT-2-X(RT-2 的 55B 版本),部分任务差距明显,部分任务追平。但最关键的优势不是性能数字,而是可复现、可微调、可部署

"

7B 参数的代价:语义推理能力比 RT-2 弱,在需要复杂多步规划的任务上差距显著。但这是所有开源模型的通病——参数量决定能力上限。

— OpenVLA 的核心局限

02

π₀:Physical Intelligence 的 fast motor control 方案(2024)

Physical Intelligence(创始团队来自 Google Robotics + Stanford)2024 年发布 π₀,核心解决一个问题:RT-2 的动作生成太慢,无法做 real-time 闭环控制——RT-2 在 V100 上只能跑到 1~3Hz,机械臂控制通常需要 30Hz 以上。

π₀ 的解法:用 Diffusion Model 生成动作序列,而不是像 RT-2 那样用 Autoregressive Transformer 逐个生成动作 token。

Diffusion vs Autoregressive 动作生成

AR(RT-2):逐个生成动作 token,延迟 = O(T),30 个动作就要 30 步串行推理

Diffusion(π₀):并行 denoising,一次生成整条动作序列,延迟 = O(1) 步 denoising(~10 步)

结果:π₀ 在家务任务(折叠衣物、整理桌面)上达到 80%+ 成功率,且能 30Hz 闭环

关键设计:Flow Matching + VLA

π₀ 用的是 Flow Matching(扩散模型的数学简化版,不需要 noise schedule),条件是视觉语言特征(来自 VLM encoder)。动作生成条件注入在每步 denoising 里,和 Stable Diffusion 的 cross-attention 条件注入逻辑一致。

"

扩散模型在图像生成领域的成功,被 PI 团队迁移到了机器人动作生成领域——图像是 2D 像素网格,动作是 1D 时序信号,数学结构完全相同。

— π₀ 的核心洞察

03

GO-1:智元机器人的国产 VLA 方案(2025)

智元机器人(2023 年成立,创始团队来自华为天才少年计划)是国内具身智能融资最猛的创业公司,2025 年发布 GO-1(Goal-Oriented 1)。国产 VLA 第一个产品级方案。

GO-1 核心设计

架构:多模态大模型(视觉-语言) + 扩散动作解码器,类似 π₀ 的技术路线

数据飞轮:真实机器人遥操数据 + 仿真合成数据结合,这是国内团队能快速追赶的关键

Goal-conditioned:GO-1 名字里的 Goal-Oriented,指支持目标图像输入——用户给一张"完成后的状态图",机器人自己规划路径达到

Goal-conditioned 的产品价值:这比自然语言指令更直觉。工业场景里,用户不需要写"把红色方块放到左上角",只需要给一张目标布局照片,机器人自己理解差异、执行任务。对非技术用户更友好。

"

Goal-conditioned 是 VLA 的产品化关键:语言指令需要精确措辞,图像目标只需要"你想要什么",用户门槛大幅降低。这和 GPT-4V 取代 ChatGPT 早期 prompt engineering 的逻辑一样——视觉比文字更直观。

— GO-1 的产品设计直觉

04

三代 VLA 技术路线横向对比

OpenVLA vs π₀ vs GO-1

维度 OpenVLA π₀ GO-1

发布方 Stanford+NVIDIA Physical Intelligence 智元机器人

动作生成 Autoregressive Diffusion (Flow) Diffusion

参数量 7B 未公开 未公开

控制频率 ~5Hz 30Hz+ 30Hz+

指令形式 自然语言 自然语言 语言 + 目标图像

开源/闭源 开源(Apache 2.0) 闭源 闭源/商用

核心规律:Diffusion 路线正在全面超越 Autoregressive 路线——π₀ 和 GO-1 都选了 Diffusion,核心原因是并行生成动作序列 vs 串行生成动作 token,在控制频率上形成量级差距。30Hz 是机器人实时控制的最低门槛,AR 路线天然难达到。

· · ·

核心洞察 · CORE INSIGHT

三代 VLA 演进背后是同一个工程矛盾:互联网规模的视觉-语言预训练知识,怎么高效注入到实时机器人控制信号里?OpenVLA 用小模型压缩知识(7B vs 55B),π₀ 用扩散模型并行化动作生成(30Hz),GO-1 用目标图像降低用户门槛(产品化)。每一步都在解决上一代的实际痛点。

本月

读 π₀ 论文原文(Physical Intelligence,2024),重点看 Flow Matching 数学推导

本月

GitHub 搜 OpenVLA,尝试本地部署一个 7B 模型跑通 demo

永远

每篇具身智能论文,问自己:这个工作比 RT-2 改进了什么?改进了多少?

· · ·

END · 完

下一步行动

选 1 个具体动作: ① 搜「Physical Intelligence π₀ demo」看真实机器人演示视频 ② 读 OpenVLA 论文(arXiv:2409.10846)③ 思考:1 人公司的 AI 产品能不能借鉴 VLA 的"预训练+微调"范式?

云与数字化 · 立即关注

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-23,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • VLA 模型三部曲: OpenVLA、π₀、GO-1 如何重新定义机器人控制
    • OpenVLA:开源 VLA 的里程碑(Stanford + NVIDIA,2024)
    • π₀:Physical Intelligence 的 fast motor control 方案(2024)
    • GO-1:智元机器人的国产 VLA 方案(2025)
    • 三代 VLA 技术路线横向对比
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档