PPO
ROBOTIQUE
Définition
Proximal Policy Optimization — un algorithme d'apprentissage par renforcement basé sur le gradient de politique qui contraint les mises à jour de politique à une région de confiance en utilisant un objectif de substitution écrêté. PPO est l'algorithme d'apprentissage par renforcement par défaut pour la locomotion robotique (robots à pattes, humanoïdes) et le transfert sim-vers-réel en raison de sa stabilité, sa simplicité et son efficacité en termes d'échantillons. Il équilibre l'exploration et l'exploitation sans le coût de calcul de l'optimisation contrainte de TRPO.
voir Optimisation de politique proximale
Français
PPO
Optimisation de politique proximale
Anglais
PPO
Proximal Policy Optimization
Sources
Contributeurs: Claude Coulombe, wiki





