Description
Decision Transformer présente une approche novatrice de l'apprentissage par renforcement (RL) en l'abstraiant comme un problème de modélisation de séquences. Cela lui permet d'exploiter la puissance et l'évolutivité des architectures Transformer, couramment utilisées dans la modélisation du langage, telles que GPT-x et BERT. L'innovation principale réside dans la transformation du RL en modélisation de séquences conditionnelles, s'éloignant ainsi des ajustements traditionnels de fonctions de valeur ou des calculs de gradient de politique.
Ce cadre, nommé Decision Transformer, produit directement des actions optimales en utilisant un Transformer masqué causalement. En conditionnant un modèle autorégressif sur un retour souhaité (récompense), ainsi que sur les états et actions passés, le Decision Transformer peut générer des actions futures conçues pour atteindre ce retour spécifique. Cette simplicité permet une mise en œuvre et une évaluation directes.
En pratique, Decision Transformer traite les trajectoires RL comme des séquences. Chaque modalité – retour, état ou action – est traitée par un réseau d'intégration (embedding). Ces intégrations sont ensuite alimentées dans un modèle Transformer autorégressif entraîné à prédire l'action suivante. L'évaluation implique d'initialiser le modèle avec un retour cible et l'état de départ, puis de dérouler la séquence pour générer des actions à exécuter dans l'environnement, à l'instar de la génération autorégressive standard dans les modèles de langage.
L'une des capacités clés démontrées est la possibilité de « recoudre » des sous-séquences provenant de différentes trajectoires d'entraînement pour produire des chemins optimaux au moment du test. Par exemple, lorsqu'il est entraîné sur des marches aléatoires dans un problème de graphe, Decision Transformer peut générer un chemin optimal en se basant sur un retour élevé, sans apprentissage TD explicite ni pessimisme de valeur. Ce comportement reflète celui des algorithmes d'apprentissage Q hors politique, mais obtenu par le biais d'un paradigme de modélisation de séquences.
Decision Transformer a été évalué sur des benchmarks standard de RL hors ligne, y compris l'Atari Learning Environment, OpenAI Gym et une tâche Minigrid Key-To-Door. Sur ces tâches diverses, qui impliquent un contrôle discret et continu, ainsi que des observations d'images et d'états, Decision Transformer a montré des performances comparables à celles des algorithmes spécialisés d'apprentissage TD.
De plus, Decision Transformer agit comme un apprenant multitâche en effectuant une génération conditionnelle. Il ne produit pas une politique unique mais modélise une distribution de politiques. En traçant le retour moyen atteint par rapport au retour cible, des politiques distinctes peuvent être observées. Dans certains cas, Decision Transformer a démontré la capacité d'extrapoler au-delà de l'ensemble de données d'entraînement et de modéliser des politiques avec des retours plus élevés que ceux présents dans les données.
Points forts de Decision Transformer
Apprentissage par renforcement comme modélisation de séquences
Intégration d'architecture Transformer
Modélisation de séquences conditionnelles
Génération d'actions autorégressive
Conditionnement sur le retour souhaité
Apprentissage par renforcement hors ligne
Approche sans modèle
Performances de pointe
Applicabilité inter-tâches (Atari, OpenAI Gym, Key-to-Door)
Recollage de sous-séquences pour des trajectoires optimales
Extrapolation au-delà des données d'entraînement
Capacité d'apprentissage multitâche
Premiers pas avec Decision Transformer
Accéder au modèle : Obtenir l'accès au modèle Decision Transformer.
Configurer l'environnement : Configurer l'environnement RL pour l'interaction.
Intégrer via API : Implémenter le Decision Transformer dans votre pipeline RL.
Définir le retour cible : Spécifier le niveau de récompense souhaité pour la politique.
Saisir les données passées : Fournir les états et actions passés comme entrées de conditionnement.
Générer des actions : Le modèle produit une séquence d'actions à exécuter.
Évaluer les performances : Mesurer le retour atteint par rapport à la cible.
Cas d'utilisation de Decision Transformer
- Entraînement RL hors ligne
- Prise de décision basée sur des séquences
- Politiques conditionnées par un objectif
- Optimisation de trajectoire
- Contrôle robotique
- Développement d'IA pour les jeux








