书架 / 机器人学习 / 模型 / 视觉语言动作模型(VLA) 视觉语言动作模型(VLA) VLM 的迁移。 背景# VLA 把视觉语言模型(VLM)的表示能力迁移到动作预测上。 结构# 编码器# 负责把图像和语言指令编码成统一的表示。 解码器# 把表示解码成机器人可执行的动作序列。