VLA


Révision datée du 7 octobre 2026 à 16:29 par Pitpitt (discussion | contributions)
(diff) ← Version précédente | Voir la version actuelle (diff) | Version suivante → (diff)

ROBOTIQUE

Définition

Modèle Vision-Langage-Action — un modèle de fondation qui prend des observations visuelles et des instructions en langage naturel en entrée et produit directement des actions de robot. Les VLA unifient la perception, la compréhension du langage et le contrôle dans un seul réseau de neurones. Les exemples incluent RT-2, OpenVLA, Octo et π0. Les VLA représentent la frontière actuelle de l'apprentissage robotique généraliste, visant à être le « moment GPT » de la robotique

Un modèle Vision-Langage-Action est un réseau de neurones qui traite conjointement les observations visuelles (images RGB), les instructions en langage naturel et la proprioception du robot pour produire des sorties d'action. Les VLA étendent les grands modèles vision-langage (VLM tels que PaLM-E, LLaVA ou Gemini) en ajoutant une tête d'action — entraînant le modèle à produire des positions articulaires du robot ou des deltas d'effecteur final aux côtés de ses prédictions de langage. Les VLA notables incluent RT-2 (tokenise les actions comme des jetons de texte et affine un VLM), OpenVLA (open-source, 7B paramètres, entraîné sur Open X-Embodiment) et pi0 (VLA de flow-matching de Physical Intelligence).

Français

VLA

Anglais

Vision-Langage-Action

Sources

Source : Robotic Center


LEXIQUE DE LA ROBOTIQUE Ligne robot.jpg Robotique.jpg

Contributeurs: wiki