« Peaufinage par auto-jeu » : différence entre les versions

Version du 14 avril 2026 à 15:02

Définition

Algorithme de peaufinage pour les grands modèles de langues (GML) qui utilise un mécanisme qui lui permet de jouer contre lui-même self-play mechanism en utilisant les versions précédentes du modèle.

Voir aussi Optimisation de la politique relative au groupe et Apprentissage par curriculum auto-évolutif

Complément

Cette technique réduit la dépendance vis-à-vis des jeux de données externes ou des modèles enseignants.

Français

peaufinage par auto-jeu

Anglais

self-play fine-tuning

self-play fine tuning

SPIN

Sources

Zhuofan Xu (2025) - Auto-jeu

Source : arxiv

Source : GitHub

Source: verl

Version du 14 avril 2026 à 15:02 (voir la source) Patrickdrouin (discussion \| contributions) Aucun résumé des modifications ← Modification précédente	Version du 14 avril 2026 à 15:02 (voir la source) Patrickdrouin (discussion \| contributions) m (Patrickdrouin a déplacé la page Self-play fine-tuning vers Peaufinage par auto-jeu) Modification suivante →
(Aucune différence)

« Peaufinage par auto-jeu » : différence entre les versions