跳转到主要内容
ToolPotion

Decision Transformer

Decision Transformer 将强化学习重构为序列建模问题,利用 GPT-x 和 BERT 等 Transformer 架构。它通过对期望回报、过去状态和动作进行条件化来生成最优动作,在 Atari、OpenAI Gym 和 Key-to-Door 任务上达到了最先进的性能。

访问URL

描述

Decision Transformer 提出了一种新颖的强化学习(RL)方法,将其抽象为序列建模问题。这使其能够利用在语言建模中常用的 Transformer 架构(如 GPT-x 和 BERT)的强大功能和可扩展性。核心创新在于将 RL 视为条件序列建模,摆脱了传统的价值函数拟合或策略梯度计算。

这个名为 Decision Transformer 的框架通过使用因果掩码 Transformer 直接输出最优动作。通过对自回归模型进行条件化,使其依赖于期望的回报(奖励)以及过去的状态和动作,Decision Transformer 可以生成旨在实现该特定回报的未来动作。这种简洁性使其易于实现和评估。

在实践中,Decision Transformer 将 RL 轨迹视为序列。回报、状态或动作的每种模态都通过嵌入网络进行处理。然后将这些嵌入输入到自回归 Transformer 模型中,该模型经过训练以预测后续动作。评估涉及使用目标回报和初始状态来初始化模型,然后展开序列以生成要在环境中执行的动作,这类似于语言模型中的标准自回归生成。

所展示的关键能力之一是能够“拼接”来自不同训练轨迹的子序列,以在测试时产生最优路径。例如,在图问题中的随机游走上进行训练后,Decision Transformer 可以通过对高回报进行条件化来生成最优路径,而无需显式的 TD 学习或价值悲观主义。这种行为与离策略 Q-学习算法类似,但通过序列建模范式实现。

Decision Transformer 已在标准的离线 RL 基准测试中进行了评估,包括 Atari 学习环境、OpenAI Gym 和 Minigrid Key-To-Door 任务。在这些多样化的任务中,涉及离散和连续控制,以及图像和状态观测,Decision Transformer 表现出了与专用 TD 学习算法相当的性能。

此外,Decision Transformer 通过执行条件生成,充当多任务学习器。它不产生单一策略,而是对策略的分布进行建模。通过绘制平均实现回报与目标回报的关系图,可以观察到不同的策略。在某些情况下,Decision Transformer 已证明了其能够外推到训练数据集之外并对高于数据中存在的策略进行建模的能力。

Decision Transformer亮点

  • 强化学习作为序列建模

  • 集成 Transformer 架构

  • 条件序列建模

  • 自回归动作生成

  • 期望回报条件化

  • 离线强化学习

  • 无模型方法

  • 最先进的性能

  • 跨任务适用性(Atari、OpenAI Gym、Key-to-Door)

  • 拼接子序列以获得最优轨迹

  • 外推到训练数据之外

  • 多任务学习能力

Decision Transformer入门

  1. 访问模型:获取 Decision Transformer 模型的访问权限。

  2. 设置环境:配置 RL 环境以进行交互。

  3. 通过 API 集成:在您的 RL 管道中实现 Decision Transformer。

  4. 定义目标回报:指定策略的期望奖励水平。

  5. 输入历史数据:提供过去的状态和动作作为条件输入。

  6. 生成动作:模型输出要执行的动作序列。

  7. 评估性能:衡量相对于目标的已实现回报。

Decision Transformer的使用案例

  • 离线 RL 训练
  • 基于序列的决策
  • 目标条件策略
  • 轨迹优化
  • 机器人控制
  • 游戏 AI 开发

Decision Transformer的常见问题

Decision Transformer 评价

加载中...

与 Decision Transformer 类似的热门AI工具

AI 模型

PlaNet 是一种基于模型的强化学习算法,通过学习潜在动力学来从像素中进行规划。它能在学习到的潜在空间中高效地预测未来奖励,在与模型无关的方法竞争的同时,减少了与环境的交互。该项目提供了开源实现。

AI 模型与大语言模型

AI 模型

InstructGPT 模型是经过训练的 AI 语言模型,比 GPT-3 更能遵循用户意图。它们通过人类反馈强化学习,更加真实、毒性更低,并与用户目标保持一致,现已为 OpenAI 的 API 提供支持。

AI 模型与大语言模型

策略梯度法是一类直接学习策略函数的强化学习算法。与基于值的方法不同,它们直接优化策略的参数以最大化预期回报,从而为复杂环境中的动作选择提供了一种直接的方法。

AI 模型与大语言模型

Gato 是 Google DeepMind 开发的单一通用人工智能代理。它可以执行各种任务,包括玩 Atari 游戏、为图像添加字幕、聊天以及控制真实的机器人手臂。这种多模态代理使用 Transformer 神经网络来处理多样化的数据输入并生成适当的输出。

AI 模型与大语言模型

TRL是一个综合库,旨在使用各种强化学习方法训练变压器语言模型。它与Hugging Face的变压器无缝集成,提供监督微调和高级优化技术的工具。

精选机器学习平台

AI 模型

Q-learning 是一种无模型强化学习算法,它训练智能体根据当前状态为动作分配价值。通过最大化预期未来奖励来优化决策,在没有显式环境模型的情况下处理随机环境。适用于复杂的序贯决策问题。

AI 模型与大语言模型

SARSA 是一种用于学习马尔可夫决策过程策略的强化学习算法。它根据智能体的当前状态、动作、奖励、下一个状态和下一个动作来更新 Q 值,从而在动态环境中实现自适应决策。这种同策略方法对于开发智能体至关重要。

AI 模型与大语言模型

This repository contains experiment code for "Deep Reinforcement Learning in a Handful of Trials using Probabilistic Dynamics Models." It implements the PETS algorithm, combining…

AI 模型与大语言模型