« PPO » : différence entre les versions


(Redirection supprimée vers Optimisation de politique proximale)
Balise : Redirection supprimée
Aucun résumé des modifications
 
Ligne 3 : Ligne 3 :
== Définition ==
== Définition ==
Proximal Policy Optimization — un algorithme d'apprentissage par renforcement basé sur le gradient de politique qui contraint les mises à jour de politique à une région de confiance en utilisant un objectif de substitution écrêté. PPO est l'algorithme d'apprentissage par renforcement par défaut pour la locomotion robotique (robots à pattes, humanoïdes) et le transfert sim-vers-réel en raison de sa stabilité, sa simplicité et son efficacité en termes d'échantillons. Il équilibre l'exploration et l'exploitation sans le coût de calcul de l'optimisation contrainte de TRPO.
Proximal Policy Optimization — un algorithme d'apprentissage par renforcement basé sur le gradient de politique qui contraint les mises à jour de politique à une région de confiance en utilisant un objectif de substitution écrêté. PPO est l'algorithme d'apprentissage par renforcement par défaut pour la locomotion robotique (robots à pattes, humanoïdes) et le transfert sim-vers-réel en raison de sa stabilité, sa simplicité et son efficacité en termes d'échantillons. Il équilibre l'exploration et l'exploitation sans le coût de calcul de l'optimisation contrainte de TRPO.
voir [[Optimisation de politique proximale]]


== Français ==
== Français ==

Dernière version du 2 octobre 2026 à 21:07

ROBOTIQUE

Définition

Proximal Policy Optimization — un algorithme d'apprentissage par renforcement basé sur le gradient de politique qui contraint les mises à jour de politique à une région de confiance en utilisant un objectif de substitution écrêté. PPO est l'algorithme d'apprentissage par renforcement par défaut pour la locomotion robotique (robots à pattes, humanoïdes) et le transfert sim-vers-réel en raison de sa stabilité, sa simplicité et son efficacité en termes d'échantillons. Il équilibre l'exploration et l'exploitation sans le coût de calcul de l'optimisation contrainte de TRPO.

voir Optimisation de politique proximale

Français

PPO

Optimisation de politique proximale

Anglais

PPO

Proximal Policy Optimization

Sources

Source : Robotic Center


LEXIQUE DE LA ROBOTIQUE Ligne robot.jpg Robotique.jpg

Contributeurs: Claude Coulombe, wiki