描述
PaLM-E 通过引入一个具身多模态语言模型,显著推动了人工智能的发展,该模型旨在弥合抽象语言理解与真实世界物理交互之间的差距。传统的大型语言模型在复杂的文本任务上表现出色,但在将知识与连续的真实世界传感器数据相结合方面存在困难,而这对于机器人等应用至关重要。PaLM-E 通过直接将视觉输入和状态估计等模态纳入语言模型的处理流程来解决这一挑战。
PaLM-E 的核心架构创新在于其将连续的具身观察注入预训练语言模型的语言嵌入空间的方法。这是通过将传感器数据编码为与语言模型 token 嵌入具有相同维度的向量序列来实现的。这使得模型能够以统一的方式处理和推理多模态输入,包括文本、图像和连续状态估计。PaLM-E 基于一个仅解码器的大型语言模型架构(特别是 PaLM)构建,并扩展了其处理具身任务的能力。
PaLM-E 在各种具身推理任务中展现出卓越的性能。评估结果显示了其在序列机器人操作规划、视觉问答和图像描述方面的能力。作为一个单一的大型具身多模态模型,PaLM-E 能够跨越不同的观察模态和多个机器人具身来应对各种推理挑战。值得注意的是,它表现出积极的迁移能力,这意味着其性能受益于跨越广泛的互联网规模语言、视觉和视觉-语言数据集的联合训练。最大的变体 PaLM-E-562B 不仅在机器人领域表现出色,而且作为一个通用的视觉-语言模型,在 OK-VQA 等基准测试中取得了最先进的成果,同时随着其规模的增加,它也保留了其通用的语言能力。
该模型在长时程机器人任务的示例中展示了其实际应用。PaLM-E 可以理解“从抽屉里拿米饼给我”或“拿一个绿色的星星给我”等指令,并结合机器人摄像头的视觉反馈来执行多步计划。它还可以控制机器人按颜色排列积木或执行推挤任务,为低级策略排序分步命令。此外,PaLM-E 展现出令人印象深刻的泛化能力,即使在这些特定对象或场景未包含在其直接训练数据中的情况下,也能成功执行“将红色积木推到咖啡杯旁”或“将绿色积木推到乌龟旁”等任务。这种适应性突显了其在全新情况下的强大理解和推理能力。
PaLM-E亮点
具身多模态语言模型
集成视觉和连续状态传感器模态
将语言与真实世界感知相联系
实现机器人操作规划
支持视觉问答
能够进行图像描述
跨领域展现积极迁移学习能力
处理多种机器人具身
在 OK-VQA 上取得最先进的性能
保留通用语言能力
处理多模态句子
自回归生成文本补全
PaLM-E入门
访问模型:为具身 AI 任务使用 PaLM-E 模型。
输入数据:提供包含视觉、状态估计和文本编码的多模态句子。
训练模型:与预训练的大型语言模型进行端到端训练编码。
执行任务:部署用于序列机器人操作规划。
执行推理:应用于视觉问答和图像描述。
评估性能:在各种具身推理任务上评估能力。
与机器人集成:用于真实世界机器人控制和规划。
PaLM-E的使用案例
- 机器人操作
- 视觉问答
- 图像描述
- 具身推理
- 通用 AI
- 机器人规划
- 跨领域学习








