Gradient de politique


Révision datée du 25 septembre 2026 à 17:53 par Pitpitt (discussion | contributions) (Page créée avec « == '''<span style="font-family:arial black;font-size:24px; color:#1880a6;">ROBOTIQUE</span>'''== == Définition == Une famille d'algorithmes RL qui optimisent directement les paramètres de la politique en estimant le gradient du rendement attendu par rapport aux paramètres de la politique. REINFORCE, PPO, TRPO et SAC appartiennent tous à cette famille. Les méthodes de gradient de politique fonctionnent avec des espaces d'actions... »)
(diff) ← Version précédente | Voir la version actuelle (diff) | Version suivante → (diff)

ROBOTIQUE

Définition

Une famille d'algorithmes RL qui optimisent directement les paramètres de la politique en estimant le gradient du rendement attendu par rapport aux paramètres de la politique. REINFORCE, PPO, TRPO et SAC appartiennent tous à cette famille.

Les méthodes de gradient de politique fonctionnent avec des espaces d'actions continus (contrairement aux méthodes basées sur la valeur comme DQN) et sont l'approche RL standard pour les tâches de contrôle de robot.

Français

Gradient de politique

Anglais

policy gradient

Sources

Source : Robotic Center


LEXIQUE DE LA ROBOTIQUE Ligne robot.jpg Robotique.jpg

Contributeurs: wiki