核心要点

  • 能讲清思路:视觉帧经 ViT 编码成 patch token,语言指令经 tokenizer 成 text token,拼接后送入冻结或 LoRA 微调的 LLM,LLM 输出端接动作头

  • 能说出动作空间的主流参数化:离散化(对每维分箱或聚类成 codebook,输出动作 token)、连续回归(直接输出关节角/末端位姿),以及流匹配/扩散动作头(拟合多模态分布)

  • 能说出对齐关键:训练时用行为克隆(BC)损失——LLM 输出分布去拟合专家动作;语言对齐靠 next-token prediction 在指令条件化下完成

  • 能说出难点:视觉帧率远高于语言指令,需帧堆叠/降采样;动作空间高维且多模态,单一回归易坍缩到均值

标准回答

一、整体架构

VLA 的典型管线:① 视觉编码器(SigLIP/ViT)把多视角图像编码成 patch token 序列;② 语言 tokenizer 把自然语言指令编码成 text token;③ 两类 token 拼接后送入预训练 LLM(如 PaLM-E、RT-2、OpenVLA),LLM 在指令条件下自回归预测动作 token 或回归连续值。

二、动作空间参数化——两条路线

  1. 离散动作 token(RT-1、RT-2):把末端位姿 + 夹爪开合按每个动作维度均匀分箱(如 256 个 bin),复用 LLM 词表中的 token 表示动作;也有工作(如 BeT、部分 VQ 方案)用 VQ-VAE/k-means 量化成 codebook。推理时 LLM 输出 token 索引,解码回连续动作。优点:复用 LLM 的分类头、与语言 token 同构;缺点:bin 数 / codebook 大小决定精度上限。
  2. 连续回归(OpenVLA-OFT 等):LLM 末端接 MLP / 动作头直接回归连续动作(L1 或 MSE / 负对数似然做 BC 损失)。优点:精度高、无量化误差;缺点:需额外正则防止多模态坍缩。
  3. 流匹配 / 扩散动作头(π0、Octo):用 flow matching / diffusion 的 action expert 拟合多模态动作分布,天然缓解 MSE 均值坍缩,适合接触丰富的任务。

三、对齐机制

  • 视觉-语言对齐:靠大规模图文预训练(CLIP/SigLIP)的 ViT 权重,冻结或 LoRA 微调到机器人数据;
  • 语言-动作对齐:靠行为克隆——在每条专家轨迹上,以指令 + 历史观测为条件,监督 LLM 输出正确动作;
  • 跨模态融合:用 Q-Former 或 Perceiver resampler 把变长视觉 token 压缩到固定长度,避免 context 爆炸。

四、核心难点

  • 频率失配:语言指令 1 Hz,视觉 10–30 Hz,动作 100+ Hz——需动作分块 + 降采样;
  • 多模态动作分布:同一指令下可有多条成功轨迹,MSE 回归会平均成碰撞轨迹,需混合高斯或扩散动作头;
  • Sim-to-real gap:仿真数据丰富但动力学不真实,真实数据稀缺——需域随机化 + 少量真实精调。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:VLA 不是「给 LLM 接个机械臂」那么简单:① 冻结 LLM 不做动作微调会导致动作精度差,至少需 LoRA;② 离散 codebook 太小会丢精度、太大会让分类头难以收敛;③ 忽视动作多模态性用 MSE 回归,在接触丰富的任务(插 peg、拧瓶盖)上必失败。

追问

追问 1VLA 的动作 tokenizer 和语言的 BPE tokenizer 有什么本质区别?

BPE 基于统计频率切分文本子词,词表是离散的语义单元;动作 tokenizer 则把连续动作离散化——或对每个动作维度均匀分箱复用词表 token(如 RT-2),或基于轨迹用 k-means/VQ-VAE 聚类成 codebook,codebook 向量是连续动作空间的量化原型。关键差异:① BPE 词表有语义层级(子词→词→短语),动作 codebook 是扁平的;② BPE 离散化的是符号空间,动作离散化的是度量空间,后者需保持几何连续性——因此常加 reconstruction loss 和 commitment loss 保证 codebook 向量覆盖动作流形。

追问 2如果 VLA 输出动作 token,解码时如何保证物理可行性(关节极限、碰撞约束)?

主流做法三层:① 训练数据侧——用物理仿真或真实遥操作过滤越限/碰撞轨迹;② 解码侧——token 采样后加投影层,把超出关节极限的预测截断到合法区间,或用 CEM/MPPI 等采样优化器在 VLA 给出的分布上做约束采样;③ 架构侧——把约束编码进动作参数化(如用关节角而非笛卡尔坐标、用指数映射保证旋转合法),让 token 本身只能表示合法动作。三层叠加:数据过滤兜底分布、参数化保证结构合法、运行时投影兜底安全。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习