Candlest 的博客

视觉语言动作模型(VLA)

VLM 的迁移。

背景#

VLA 把视觉语言模型(VLM)的表示能力迁移到动作预测上。

结构#

编码器#

负责把图像和语言指令编码成统一的表示。

解码器#

把表示解码成机器人可执行的动作序列。