« VLA » : différence entre les versions
(Page créée avec « == '''<span style="font-family:arial black;font-size:24px; color:#1880a6;">ROBOTIQUE</span>'''== == Définition == Modèle Vision-Langage-Action — un modèle de fondation qui prend des observations visuelles et des instructions en langage naturel en entrée et produit directement des actions de robot. Les VLA unifient la perception, la compréhension du langage et le contrôle dans un seul réseau de neurones. Les exemples incluent... ») |
Aucun résumé des modifications |
||
| Ligne 2 : | Ligne 2 : | ||
== Définition == | == Définition == | ||
Modèle Vision-Langage-Action — un modèle de fondation qui prend des observations visuelles et des instructions en langage naturel en entrée et produit directement des actions de robot. Les VLA unifient la perception, la compréhension du langage et le contrôle dans un seul réseau de neurones. Les exemples incluent RT-2, OpenVLA, Octo et π0. Les VLA représentent la frontière actuelle de l'apprentissage robotique généraliste, visant à être le « moment GPT » de la | Modèle Vision-Langage-Action — un modèle de fondation qui prend des observations visuelles et des instructions en langage naturel en entrée et produit directement des actions de robot. Les VLA unifient la perception, la compréhension du langage et le contrôle dans un seul réseau de neurones. Les exemples incluent RT-2, OpenVLA, Octo et π0. Les VLA représentent la frontière actuelle de l'apprentissage robotique généraliste, visant à être le « moment GPT » de la robotique | ||
Un modèle Vision-Langage-Action est un réseau de neurones qui traite conjointement les observations visuelles (images RGB), les instructions en langage naturel et la proprioception du robot pour produire des sorties d'action. Les VLA étendent les grands modèles vision-langage (VLM tels que PaLM-E, LLaVA ou Gemini) en ajoutant une tête d'action — entraînant le modèle à produire des positions articulaires du robot ou des deltas d'effecteur final aux côtés de ses prédictions de langage. Les VLA notables incluent RT-2 (tokenise les actions comme des jetons de texte et affine un VLM), OpenVLA (open-source, 7B paramètres, entraîné sur Open X-Embodiment) et pi0 (VLA de flow-matching de Physical Intelligence). | |||
== Français == | == Français == | ||
Dernière version du 7 octobre 2026 à 16:29
ROBOTIQUE
Définition
Modèle Vision-Langage-Action — un modèle de fondation qui prend des observations visuelles et des instructions en langage naturel en entrée et produit directement des actions de robot. Les VLA unifient la perception, la compréhension du langage et le contrôle dans un seul réseau de neurones. Les exemples incluent RT-2, OpenVLA, Octo et π0. Les VLA représentent la frontière actuelle de l'apprentissage robotique généraliste, visant à être le « moment GPT » de la robotique
Un modèle Vision-Langage-Action est un réseau de neurones qui traite conjointement les observations visuelles (images RGB), les instructions en langage naturel et la proprioception du robot pour produire des sorties d'action. Les VLA étendent les grands modèles vision-langage (VLM tels que PaLM-E, LLaVA ou Gemini) en ajoutant une tête d'action — entraînant le modèle à produire des positions articulaires du robot ou des deltas d'effecteur final aux côtés de ses prédictions de langage. Les VLA notables incluent RT-2 (tokenise les actions comme des jetons de texte et affine un VLM), OpenVLA (open-source, 7B paramètres, entraîné sur Open X-Embodiment) et pi0 (VLA de flow-matching de Physical Intelligence).
Français
VLA
Anglais
Vision-Langage-Action
Sources
Contributeurs: wiki





