« PPO » : différence entre les versions
(Page redirigée vers Optimisation de la Politique Proximale) Balise : Nouvelle redirection |
Aucun résumé des modifications |
||
| (3 versions intermédiaires par 2 utilisateurs non affichées) | |||
| Ligne 1 : | Ligne 1 : | ||
==[[:Catégorie:Robotique | '''<span style="font-family:arial black;font-size:24px; color:#1880a6;">ROBOTIQUE</span>''']]== | |||
== Définition == | |||
Proximal Policy Optimization — un algorithme d'apprentissage par renforcement basé sur le gradient de politique qui contraint les mises à jour de politique à une région de confiance en utilisant un objectif de substitution écrêté. PPO est l'algorithme d'apprentissage par renforcement par défaut pour la locomotion robotique (robots à pattes, humanoïdes) et le transfert sim-vers-réel en raison de sa stabilité, sa simplicité et son efficacité en termes d'échantillons. Il équilibre l'exploration et l'exploitation sans le coût de calcul de l'optimisation contrainte de TRPO. | |||
[[ | voir [[Optimisation de politique proximale]] | ||
[[Catégorie: | == Français == | ||
'''PPO''' | |||
'''Optimisation de politique proximale''' | |||
== Anglais == | |||
'''PPO''' | |||
'''Proximal Policy Optimization''' | |||
==Sources== | |||
[https://www.roboticscenter.ai/fr/glossary Source : Robotic Center] | |||
{{Modèle:Robotique}} | |||
[[Catégorie:Robotique]] | |||
Dernière version du 2 octobre 2026 à 21:07
ROBOTIQUE
Définition
Proximal Policy Optimization — un algorithme d'apprentissage par renforcement basé sur le gradient de politique qui contraint les mises à jour de politique à une région de confiance en utilisant un objectif de substitution écrêté. PPO est l'algorithme d'apprentissage par renforcement par défaut pour la locomotion robotique (robots à pattes, humanoïdes) et le transfert sim-vers-réel en raison de sa stabilité, sa simplicité et son efficacité en termes d'échantillons. Il équilibre l'exploration et l'exploitation sans le coût de calcul de l'optimisation contrainte de TRPO.
voir Optimisation de politique proximale
Français
PPO
Optimisation de politique proximale
Anglais
PPO
Proximal Policy Optimization
Sources
Contributeurs: Claude Coulombe, wiki





