<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="fr">
	<id>https://datafranca.org/wiki/index.php?action=history&amp;feed=atom&amp;title=Gradient_de_politique</id>
	<title>Gradient de politique - Historique des versions</title>
	<link rel="self" type="application/atom+xml" href="https://datafranca.org/wiki/index.php?action=history&amp;feed=atom&amp;title=Gradient_de_politique"/>
	<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Gradient_de_politique&amp;action=history"/>
	<updated>2026-10-08T15:51:41Z</updated>
	<subtitle>Historique des versions pour cette page sur le wiki</subtitle>
	<generator>MediaWiki 1.39.5</generator>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Gradient_de_politique&amp;diff=133218&amp;oldid=prev</id>
		<title>Pitpitt : Page créée avec « == &#039;&#039;&#039;&lt;span style=&quot;font-family:arial black;font-size:24px;  color:#1880a6;&quot;&gt;ROBOTIQUE&lt;/span&gt;&#039;&#039;&#039;==  == Définition == Une famille d&#039;algorithmes RL qui optimisent directement les paramètres de la politique en estimant le gradient du rendement attendu par rapport aux paramètres de la politique. REINFORCE, PPO, TRPO et SAC appartiennent tous à cette famille.   Les méthodes de gradient de politique fonctionnent avec des espaces d&#039;actions... »</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Gradient_de_politique&amp;diff=133218&amp;oldid=prev"/>
		<updated>2026-09-25T21:53:50Z</updated>

		<summary type="html">&lt;p&gt;Page créée avec « ==&lt;a href=&quot;/wiki/Cat%C3%A9gorie:Robotique&quot; title=&quot;Catégorie:Robotique&quot;&gt; &amp;#039;&amp;#039;&amp;#039;&amp;lt;span style=&amp;quot;font-family:arial black;font-size:24px;  color:#1880a6;&amp;quot;&amp;gt;ROBOTIQUE&amp;lt;/span&amp;gt;&amp;#039;&amp;#039;&amp;#039;&lt;/a&gt;==  == Définition == Une famille d&amp;#039;algorithmes RL qui optimisent directement les paramètres de la politique en estimant le gradient du rendement attendu par rapport aux paramètres de la politique. REINFORCE, PPO, TRPO et SAC appartiennent tous à cette famille.   Les méthodes de gradient de politique fonctionnent avec des espaces d&amp;#039;actions... »&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Nouvelle page&lt;/b&gt;&lt;/p&gt;&lt;div&gt;==[[:Catégorie:Robotique | &amp;#039;&amp;#039;&amp;#039;&amp;lt;span style=&amp;quot;font-family:arial black;font-size:24px;  color:#1880a6;&amp;quot;&amp;gt;ROBOTIQUE&amp;lt;/span&amp;gt;&amp;#039;&amp;#039;&amp;#039;]]==&lt;br /&gt;
&lt;br /&gt;
== Définition ==&lt;br /&gt;
Une famille d&amp;#039;algorithmes RL qui optimisent directement les paramètres de la politique en estimant le gradient du rendement attendu par rapport aux paramètres de la politique. REINFORCE, PPO, TRPO et SAC appartiennent tous à cette famille. &lt;br /&gt;
&lt;br /&gt;
Les méthodes de gradient de politique fonctionnent avec des espaces d&amp;#039;actions continus (contrairement aux méthodes basées sur la valeur comme DQN) et sont l&amp;#039;approche RL standard pour les tâches de contrôle de robot.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Gradient de politique&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;policy gradient&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.roboticscenter.ai/fr/glossary    Source : Robotic Center]&lt;br /&gt;
&lt;br /&gt;
{{Modèle:Robotique}}&lt;br /&gt;
[[Catégorie:Robotique]]&lt;/div&gt;</summary>
		<author><name>Pitpitt</name></author>
	</entry>
</feed>