Préentraînement contrastif langue-image


ROBOTIQUE

Définition

Approche qui prend en entrée une image et une description textuelle de l'image et qui apprend à représenter les l'image et le texte dans un même espace latent selon une distribution de probabilité conjointe.

Robotique - Contrastive Language-Image Pre-training — un modèle entraîné par OpenAI sur 400M paires image-texte pour apprendre des représentations visuelles et linguistiques alignées. Les embeddings CLIP sont utilisés en robotique pour la détection d'objets en vocabulaire ouvert, la manipulation conditionnée par le langage et la spécification de récompenses.

Compléments

CLIP est un algorithme en code source ouvert, multimodal et à apprentissage à zéro-coup. À partir d'une image et de descriptions textuelles, le modèle peut prédire la description textuelle la plus pertinente pour cette image, sans optimisation pour cette tâche particulière.

Français

préentraînement contrastif langue-image

pré-entraînement contrastif langue-image

CLIP

Anglais

CLIP

Constastive Language-Image Pretraining

Sources

Denis, Nicholas (2023) - Révolution : Une nouvelle approche de pré-entraînement d'apprentissage par transfert voit le jour!- Statistique Canada

- Introduction au contrastive learning : une forme d’apprentissage auto supervisé Medium

Source : Robotic Center


LEXIQUE DE LA ROBOTIQUE Ligne robot.jpg Robotique.jpg

Contributeurs: Patrick Drouin, wiki