« Politique » : différence entre les versions
(Patrickdrouin a déplacé la page Politique vers Politique d'action) Balise : Nouvelle redirection |
(Redirection supprimée vers Politique d'action) Balise : Redirection supprimée |
||
| Ligne 1 : | Ligne 1 : | ||
==[[:Catégorie:Robotique | '''<span style="font-family:arial black;font-size:24px; color:#1880a6;">ROBOTIQUE</span>''']]== | |||
== Définition == | |||
En apprentissage robotique, une politique (notée π) est une fonction qui mappe les observations aux actions : π(o) → a. La politique est le « cerveau » appris du robot qui détermine quoi faire à chaque pas de temps en fonction de ce qu'il perçoit. Les politiques peuvent être représentées comme des réseaux de neurones (politiques neurales), des arbres de décision, des processus gaussiens ou des tables de consultation. | |||
Elles peuvent être déterministes (une action par observation) ou stochastiques (une distribution sur les actions). La qualité de la politique est mesurée par le taux de succès de la tâche dans des conditions diverses, pas seulement sur les démonstrations d'entraînement. Le défi central de l'apprentissage robotique est d'entraîner des politiques qui se généralisent de manière fiable au-delà de leur distribution d'entraînement. | |||
== Français == | |||
'''Politique''' | |||
== Anglais == | |||
'''Policy''' | |||
==Sources== | |||
[https://www.roboticscenter.ai/fr/glossary Source : Robotic Center] | |||
{{Modèle:Robotique}} | |||
[[Catégorie:Robotique]] | |||
Dernière version du 2 octobre 2026 à 20:45
ROBOTIQUE
Définition
En apprentissage robotique, une politique (notée π) est une fonction qui mappe les observations aux actions : π(o) → a. La politique est le « cerveau » appris du robot qui détermine quoi faire à chaque pas de temps en fonction de ce qu'il perçoit. Les politiques peuvent être représentées comme des réseaux de neurones (politiques neurales), des arbres de décision, des processus gaussiens ou des tables de consultation.
Elles peuvent être déterministes (une action par observation) ou stochastiques (une distribution sur les actions). La qualité de la politique est mesurée par le taux de succès de la tâche dans des conditions diverses, pas seulement sur les démonstrations d'entraînement. Le défi central de l'apprentissage robotique est d'entraîner des politiques qui se généralisent de manière fiable au-delà de leur distribution d'entraînement.
Français
Politique
Anglais
Policy
Sources
Contributeurs: Patrick Drouin, wiki





