04 | VLA 关键技术 ¶
约 989 个字 预计阅读时间 4 分钟
动作 Tokenization ¶
将连续动作空间转换为模型可处理的离散或连续表示。
离散化方法 ¶
| 方法 | 说明 | 工作 |
|---|---|---|
| VQ-VAE 离散化 | 连续动作 → 离散 codebook token | VQ-VLA (ICCV 2025) |
| 均匀分桶 | 将每个动作维度均匀分成 N 个 bin | RT-1 |
| 自适应分桶 | 根据动作分布自适应 bin 边界 | RT-2 |
优点:可复用 LLM 的 token 预测能力;缺点:量化误差,高维动作空间 token 数量爆炸。
连续方法(当前主流)¶
- 直接回归:输出 7-14 维连续值(RT-½, OpenVLA)
- 扩散去噪:从噪声逐步去噪生成动作(Diffusion Policy, RDT)
- 流匹配:学习噪声→动作的流变换(π0, FlowPolicy)
- 跳过 tokenization:Helix 直接输出连续电机信号
扩散策略(Diffusion Policy)¶
核心思想 ¶
不直接回归动作,而是学习条件去噪过程:
\[
a_0 = \text{Denoise}(a_T, \text{condition})
\]
从纯噪声 \(a_T \sim \mathcal{N}(0, I)\) 开始,通过 \(T\) 步逐步去噪得到动作序列 \(a_0\)。
关键设计 ¶
- Action Chunking:一次生成多步动作序列(如 16 步
) ,提升时序一致性 - 条件注入:观测特征通过 FiLM / cross-attention 注入去噪网络
- 采样步数:训练 T=100,推理可减少到 10-50 步
代表工作 ¶
| 工作 | 年份 | 核心贡献 |
|---|---|---|
| Diffusion Policy | 2023 | 首次将扩散模型用于视觉运动策略 |
| 3D Diffusion Policy | 2024 | 扩展到 3D 点云输入 |
| RDT-1B | 2024 | 1.2B 扩散 Transformer,双臂操作 |
流匹配(Flow Matching)¶
与扩散的区别 ¶
| DDPM ( 扩散 ) | Flow Matching ( 流匹配 ) | |
|---|---|---|
| 路径 | 随机 SDE 轨迹 | 确定性 ODE 流 |
| 采样步数 | 50-100 | 5-10 |
| 训练目标 | 噪声预测 | 速度场预测 |
| 推理速度 | 慢 | 快 |
π0 的实现 ¶
π0 将 PaliGemma VLM 与流匹配动作专家结合:
- VLM 编码视觉 + 语言 → 条件向量
- 流匹配专家从噪声开始,沿学习到的速度场流到目标动作
- 5-10 步即可生成高质量动作,支持 50Hz 控制
协同训练(Co-training)¶
跨具身 Co-fine-tuning ¶
RT-X 的核心发现:在多种机器人数据上联合微调,性能可超越在单机器人数据上微调。多样化数据带来更好的表征泛化。
VLM + 机器人联合训练 ¶
RT-2 的关键技巧:机器人数据与原始 VLM 数据(图文对、QA)混合训练,保留 VLM 的常识推理能力,同时学习机器人控制。
多阶段训练 ¶
- 预训练:大规模互联网数据(VLM backbone)
- 机器人预训练:Open X-Embodiment 多机器人数据
- 任务微调:目标机器人 / 任务数据(LoRA 或全参数)
语言 / 图像条件 ¶
语言 Grounding ¶
将自然语言指令映射到视觉场景中的具体操作目标:
- RT-2:首次大规模验证 web-scale VLM 知识对机器人 grounding 的迁移
- 多粒度指令:从 " 拿起杯子 " 到 " 把桌上的红色杯子放到水槽旁边 "
- 多步指令链:将长指令分解为子任务序列
Image-Goal Conditioning¶
给定目标图像作为条件,生成到达目标状态的动作序列:
- 扩散策略天然支持图像条件(将目标图像作为额外条件输入)
- 与语言条件正交,可组合使用
数据扩展规律 ¶
已知发现 ¶
- 数据量:机器人数据量增加能持续提升 VLA 泛化能力,但存在收益递减
- 数据多样性 > 数据量:多具身、多场景、多任务 > 单场景海量数据(RT-X 核心结论)
- 质量 vs 数量:高质量遥操作数据 vs 低成本自主采集的权衡仍是开放问题
扩展策略 ¶
- 多源数据混合:不同机器人、不同任务、不同实验室
- 仿真数据补充:低成本大规模仿真数据与真实数据混合
- 数据增强:视觉增强(光照、背景、纹理随机化)