« Apprentissage par différence temporelle » : différence entre les versions
Ligne 15 : | Ligne 15 : | ||
== Anglais == | == Anglais == | ||
'''Temporal difference learning''' | |||
<br/> | <br/> | ||
<br/> | <br/> |
Version du 11 février 2019 à 14:46
Domaine
Apprentissage par renforcement
Coulombe
Définition
En apprentissage par renforcement, l’algorithme d’apprentissage par différence temporelle utilise un mécanisme d’estimation temporelle pour la prédiction du temps d’arrivée d’une récompense. L’algorithme d’apprentissage par différence temporelle s'inspire d'études d’apprentissage chez les animaux.
Français
apprentissage par différence temporelle n.m.
Anglais
Temporal difference learning
Sources:
http://theses.univ-lyon2.fr/documents/getpart.php?id=lyon2.2005.blanc_jm&part=92195
http://planiart.usherbrooke.ca/cours/ift615/ift615-13-apprentissage-renforcement.pdf
Contributeurs: Evan Brach, Claire Gorjux, Claude Coulombe, Jacques Barolet, wiki