Description
State–action–reward–state–action (SARSA) est un algorithme fondamental dans le domaine de l'apprentissage par renforcement de l'apprentissage automatique. Développé initialement sous le nom de "Modified Connectionist Q-Learning" par Rummery et Niranjan, son nom actuel, SARSA, a été popularisé par Rich Sutton. Le nom lui-même dérive du quintuplet d'éléments qui forment la base de sa règle de mise à jour des valeurs Q : l'état actuel (S), l'action entreprise (A), la récompense reçue (R), l'état subséquent (S'), et la prochaine action choisie dans ce nouvel état (A'). Cette séquence spécifique, souvent notée (S_t, A_t, R_{t+1}, S_{t+1}, A_{t+1}), est ce qui donne à l'algorithme son nom distinctif.
SARSA fonctionne comme un algorithme d'apprentissage on-policy, ce qui signifie qu'il apprend la valeur d'une politique tout en suivant cette même politique. Le cœur de l'algorithme réside dans son équation de mise à jour des valeurs Q : Q_new(S_t, A_t) ← (1 - α)Q(S_t, A_t) + α [R_{t+1} + γ Q(S_{t+1}, A_{t+1})]. Ici, α représente le taux d'apprentissage, contrôlant la quantité de nouvelles informations qui remplacent les anciennes, et γ est le facteur d'actualisation, qui détermine l'importance des récompenses futures. Un taux d'apprentissage de 0 signifie qu'aucun apprentissage ne se produit, tandis qu'un taux de 1 privilégie les informations les plus récentes. Un facteur d'actualisation de 0 rend l'agent myope, se concentrant uniquement sur les récompenses immédiates, tandis qu'un facteur proche de 1 encourage la maximisation des récompenses à long terme.
Contrairement à des algorithmes comme le Q-learning de Watkin, qui estime la fonction de valeur état-action optimale en considérant la récompense maximale possible à partir de l'état suivant, SARSA apprend les valeurs Q associées à la politique qu'il exécute actuellement. Cette distinction est significative pour comprendre son comportement, en particulier dans les environnements où des stratégies d'exploration sont employées. Des optimisations du Q-learning peuvent parfois être appliquées à SARSA. Les performances de l'algorithme sont également influencées par ses conditions initiales. Les "conditions initiales optimistes", où les valeurs Q sont définies à une valeur élevée, potentiellement infinie, peuvent encourager l'exploration en rendant les actions initiales plus gratifiantes. Des recherches récentes ont également exploré l'utilisation de la première récompense reçue pour réinitialiser les conditions initiales, permettant un apprentissage immédiat dans des scénarios de récompense déterministe, une méthode qui montre une cohérence avec les modèles d'apprentissage humains.
SARSA est particulièrement utile pour les agents qui doivent apprendre un comportement optimal par essais et erreurs dans des environnements où les conséquences des actions ne sont pas entièrement connues. Sa nature on-policy le rend adapté aux scénarios où l'agent doit apprendre à agir selon une politique spécifique, comme en robotique, dans les jeux, ou dans la gestion des ressources, où la stratégie d'exploration a un impact direct sur la politique apprise.
Points forts de State–action–reward–state–action
Apprend les politiques de processus de décision markoviens
Utilise l'état, l'action, la récompense, l'état suivant et l'action suivante pour les mises à jour
Algorithme d'apprentissage on-policy
Règle de mise à jour des valeurs Q basée sur le taux d'apprentissage (alpha)
Facteur d'actualisation (gamma) pour l'importance des récompenses futures
Adaptable à différentes conditions initiales
Prend en charge les conditions initiales optimistes pour l'exploration
Peut intégrer la première récompense pour la réinitialisation des conditions initiales
Fondation pour les agents d'apprentissage par renforcement
Permet une prise de décision adaptative dans des environnements dynamiques
Adapté à l'apprentissage par essais et erreurs
Premiers pas avec State–action–reward–state–action
Initialiser les valeurs Q pour les paires état-action
Sélectionner une action basée sur la politique actuelle et les valeurs Q
Exécuter l'action, observer la récompense et l'état suivant
Sélectionner la prochaine action dans le nouvel état basée sur la politique actuelle
Mettre à jour la valeur Q pour la paire état-action précédente en utilisant la règle de mise à jour SARSA
Répéter jusqu'à convergence ou que la condition de terminaison soit remplie
Cas d'utilisation de State–action–reward–state–action
- Contrôle robotique
- Développement d'IA pour les jeux
- Navigation autonome
- Gestion des ressources
- Recommandations personnalisées
- Trading algorithmique






