描述
Decision Transformer 提出了一种新颖的强化学习(RL)方法,将其抽象为序列建模问题。这使其能够利用在语言建模中常用的 Transformer 架构(如 GPT-x 和 BERT)的强大功能和可扩展性。核心创新在于将 RL 视为条件序列建模,摆脱了传统的价值函数拟合或策略梯度计算。
这个名为 Decision Transformer 的框架通过使用因果掩码 Transformer 直接输出最优动作。通过对自回归模型进行条件化,使其依赖于期望的回报(奖励)以及过去的状态和动作,Decision Transformer 可以生成旨在实现该特定回报的未来动作。这种简洁性使其易于实现和评估。
在实践中,Decision Transformer 将 RL 轨迹视为序列。回报、状态或动作的每种模态都通过嵌入网络进行处理。然后将这些嵌入输入到自回归 Transformer 模型中,该模型经过训练以预测后续动作。评估涉及使用目标回报和初始状态来初始化模型,然后展开序列以生成要在环境中执行的动作,这类似于语言模型中的标准自回归生成。
所展示的关键能力之一是能够“拼接”来自不同训练轨迹的子序列,以在测试时产生最优路径。例如,在图问题中的随机游走上进行训练后,Decision Transformer 可以通过对高回报进行条件化来生成最优路径,而无需显式的 TD 学习或价值悲观主义。这种行为与离策略 Q-学习算法类似,但通过序列建模范式实现。
Decision Transformer 已在标准的离线 RL 基准测试中进行了评估,包括 Atari 学习环境、OpenAI Gym 和 Minigrid Key-To-Door 任务。在这些多样化的任务中,涉及离散和连续控制,以及图像和状态观测,Decision Transformer 表现出了与专用 TD 学习算法相当的性能。
此外,Decision Transformer 通过执行条件生成,充当多任务学习器。它不产生单一策略,而是对策略的分布进行建模。通过绘制平均实现回报与目标回报的关系图,可以观察到不同的策略。在某些情况下,Decision Transformer 已证明了其能够外推到训练数据集之外并对高于数据中存在的策略进行建模的能力。
Decision Transformer亮点
强化学习作为序列建模
集成 Transformer 架构
条件序列建模
自回归动作生成
期望回报条件化
离线强化学习
无模型方法
最先进的性能
跨任务适用性(Atari、OpenAI Gym、Key-to-Door)
拼接子序列以获得最优轨迹
外推到训练数据之外
多任务学习能力
Decision Transformer入门
访问模型:获取 Decision Transformer 模型的访问权限。
设置环境:配置 RL 环境以进行交互。
通过 API 集成:在您的 RL 管道中实现 Decision Transformer。
定义目标回报:指定策略的期望奖励水平。
输入历史数据:提供过去的状态和动作作为条件输入。
生成动作:模型输出要执行的动作序列。
评估性能:衡量相对于目标的已实现回报。
Decision Transformer的使用案例
- 离线 RL 训练
- 基于序列的决策
- 目标条件策略
- 轨迹优化
- 机器人控制
- 游戏 AI 开发








