跳转至

04 | VLA 关键技术

989 个字 预计阅读时间 4 分钟

动作 Tokenization

将连续动作空间转换为模型可处理的离散或连续表示。

离散化方法

方法 说明 工作
VQ-VAE 离散化 连续动作 → 离散 codebook token VQ-VLA (ICCV 2025)
均匀分桶 将每个动作维度均匀分成 N bin RT-1
自适应分桶 根据动作分布自适应 bin 边界 RT-2

优点:可复用 LLM token 预测能力;缺点:量化误差,高维动作空间 token 数量爆炸。

连续方法(当前主流)

  • 直接回归:输出 7-14 维连续值(RT-½, OpenVLA)
  • 扩散去噪:从噪声逐步去噪生成动作(Diffusion Policy, RDT)
  • 流匹配:学习噪声→动作的流变换(π0, FlowPolicy)
  • 跳过 tokenizationHelix 直接输出连续电机信号

扩散策略(Diffusion Policy)

核心思想

不直接回归动作,而是学习条件去噪过程:

\[ a_0 = \text{Denoise}(a_T, \text{condition}) \]

从纯噪声 \(a_T \sim \mathcal{N}(0, I)\) 开始,通过 \(T\) 步逐步去噪得到动作序列 \(a_0\)

关键设计

  • Action Chunking:一次生成多步动作序列(如 16 ,提升时序一致性
  • 条件注入:观测特征通过 FiLM / cross-attention 注入去噪网络
  • 采样步数:训练 T=100,推理可减少到 10-50

代表工作

工作 年份 核心贡献
Diffusion Policy 2023 首次将扩散模型用于视觉运动策略
3D Diffusion Policy 2024 扩展到 3D 点云输入
RDT-1B 2024 1.2B 扩散 Transformer,双臂操作

参考:Diffusion Policy 官网

流匹配(Flow Matching)

与扩散的区别

DDPM ( 扩散 ) Flow Matching ( 流匹配 )
路径 随机 SDE 轨迹 确定性 ODE
采样步数 50-100 5-10
训练目标 噪声预测 速度场预测
推理速度

π0 的实现

π0 PaliGemma VLM 与流匹配动作专家结合:

  1. VLM 编码视觉 + 语言 → 条件向量
  2. 流匹配专家从噪声开始,沿学习到的速度场流到目标动作
  3. 5-10 步即可生成高质量动作,支持 50Hz 控制

参考:Flow Matching 教程

协同训练(Co-training)

跨具身 Co-fine-tuning

RT-X 的核心发现:在多种机器人数据上联合微调,性能可超越在单机器人数据上微调。多样化数据带来更好的表征泛化。

VLM + 机器人联合训练

RT-2 的关键技巧:机器人数据与原始 VLM 数据(图文对、QA)混合训练,保留 VLM 的常识推理能力,同时学习机器人控制。

多阶段训练

  1. 预训练:大规模互联网数据(VLM backbone)
  2. 机器人预训练Open X-Embodiment 多机器人数据
  3. 任务微调:目标机器人 / 任务数据(LoRA 或全参数)

语言 / 图像条件

语言 Grounding

将自然语言指令映射到视觉场景中的具体操作目标:

  • RT-2:首次大规模验证 web-scale VLM 知识对机器人 grounding 的迁移
  • 多粒度指令:从 " 拿起杯子 " " 把桌上的红色杯子放到水槽旁边 "
  • 多步指令链:将长指令分解为子任务序列

Image-Goal Conditioning

给定目标图像作为条件,生成到达目标状态的动作序列:

  • 扩散策略天然支持图像条件(将目标图像作为额外条件输入)
  • 与语言条件正交,可组合使用

数据扩展规律

已知发现

  • 数据量:机器人数据量增加能持续提升 VLA 泛化能力,但存在收益递减
  • 数据多样性 > 数据量:多具身、多场景、多任务 > 单场景海量数据(RT-X 核心结论)
  • 质量 vs 数量:高质量遥操作数据 vs 低成本自主采集的权衡仍是开放问题

扩展策略

  1. 多源数据混合:不同机器人、不同任务、不同实验室
  2. 仿真数据补充:低成本大规模仿真数据与真实数据混合
  3. 数据增强:视觉增强(光照、背景、纹理随机化)

Acknowledgement