描述
受大型语言模型进展的启发,Google DeepMind 开发了 Gato,这是一款旨在超越文本输出限制的单一通用代理。Gato 充当多模态、多任务、多具身(multi-embodiment)的通用策略。同一个神经网络,使用相同的权重,可以执行各种活动,例如玩 Atari 游戏、为图像生成字幕、参与对话以及用真实的机器人手臂操纵物体。其决策过程会根据提供的上下文动态调整,决定是输出文本、关节扭矩、按钮按下还是其他形式的 token。
在训练阶段,Gato 通过将来自各种任务和模态的数据序列化为扁平的 token 序列来处理它们。然后,该序列会被批处理并由 Transformer 神经网络处理,这类似于用于大型语言模型的网络。训练损失会被掩码(masked),以确保 Gato 专注于预测动作和文本目标。在部署 Gato 时,会通过对提示(prompt)进行 token 化来形成初始序列,该提示可以是一个演示。然后环境会提供第一个观察(observation),该观察也会被 token 化并附加到此序列中。Gato 会自回归地(autoregressively)逐个 token 采样动作向量。一旦采样完构成动作向量的所有 token(根据环境的动作规范),动作就会被解码并发送到环境。环境会进行一步操作,产生新的观察,然后重复此过程。至关重要的是,模型在其 1024 个 token 的上下文窗口内始终可以访问所有先前的观察和动作。
Gato 在大量的训练数据集上进行训练,这些数据集包含了来自模拟和真实世界环境的代理经验,以及各种自然语言和图像数据集。预训练的 Gato 模型在衡量其在众多任务中超越专家分数百分比的能力方面的性能,按领域进行分类。可视化展示了 Gato 执行图像字幕、进行交互式对话以及控制机器人手臂等能力,所有这些都使用同一组权重。
Gato Generalist Agent亮点
多模态能力
多任务性能
多具身控制
Transformer 神经网络架构
自回归动作采样
1024 个 token 的上下文窗口
在多样化数据集上训练
通用策略代理
Gato Generalist Agent入门
访问模型:获取 Gato 通用代理的访问权限。
身份验证:设置必要的身份验证凭据。
设置环境:配置目标环境以进行交互。
通过 API 集成:利用提供的 API 端点执行任务。
提供提示:输入 token 化后的提示或演示。
接收观察:处理环境观察。
采样动作:自回归采样动作 token。
解码并执行:将采样后的 token 解码为可执行动作。
Gato Generalist Agent的使用案例
- 机器人控制
- 图像字幕
- 交互式对话
- 游戏
- 多模态理解
- 通用人工智能研究








