Préentraînement contrastif langue-image
ROBOTIQUE
Définition
Approche qui prend en entrée une image et une description textuelle de l'image et qui apprend à représenter les l'image et le texte dans un même espace latent selon une distribution de probabilité conjointe.
Robotique - Contrastive Language-Image Pre-training — un modèle entraîné par OpenAI sur 400M paires image-texte pour apprendre des représentations visuelles et linguistiques alignées. Les embeddings CLIP sont utilisés en robotique pour la détection d'objets en vocabulaire ouvert, la manipulation conditionnée par le langage et la spécification de récompenses.
Compléments
CLIP est un algorithme en code source ouvert, multimodal et à apprentissage à zéro-coup. À partir d'une image et de descriptions textuelles, le modèle peut prédire la description textuelle la plus pertinente pour cette image, sans optimisation pour cette tâche particulière.
Français
préentraînement contrastif langue-image
pré-entraînement contrastif langue-image
CLIP
Anglais
CLIP
Constastive Language-Image Pretraining
Sources
Denis, Nicholas (2023) - Révolution : Une nouvelle approche de pré-entraînement d'apprentissage par transfert voit le jour!- Statistique Canada
- Introduction au contrastive learning : une forme d’apprentissage auto supervisé Medium
Contributeurs: Patrick Drouin, wiki





