← Glossaire IA

Définition

Embedding

Un embedding est une façon de transformer un mot, une phrase, une image ou un son en une liste de nombres qui capture son sens, pour qu'un ordinateur puisse le comparer à d'autres.

En clair

Un embedding, c'est la traduction d'un contenu (texte, image, son) en une suite de nombres, un peu comme des coordonnées GPS mais dans un espace à des centaines de dimensions. L'idée géniale : deux éléments qui ont un sens proche auront des coordonnées proches. « Chat » et « chaton » seront voisins. « Chat » et « voiture » seront loin l'un de l'autre.

Comment ça marche

Un modèle d'IA (souvent un réseau de neurones entraîné sur d'énormes quantités de textes ou d'images) apprend à représenter chaque mot ou phrase par un vecteur, c'est-à-dire une liste de nombres, par exemple 768 ou 1536 valeurs. Ce vecteur n'est pas choisi au hasard : il est appris de façon à ce que les relations de sens se traduisent en relations géométriques. Un exemple classique : si on prend le vecteur de « roi », qu'on lui enlève « homme » et qu'on ajoute « femme », on obtient un vecteur très proche de « reine ». C'est ce genre de propriété qui rend les embeddings si puissants.

Un exemple concret

Quand tu utilises la recherche sémantique dans Notion ou un outil de RAG (Retrieval-Augmented Generation) branché sur ChatGPT, tes documents sont découpés en morceaux et chacun est transformé en embedding. Quand tu poses une question, ta question est aussi transformée en embedding, puis on cherche les morceaux de documents dont le vecteur est le plus proche du tien. C'est ce qui permet de retrouver « le passage qui parle de vacances » même si tu as tapé « congés payés », deux formulations différentes mais proches en sens.

À ne pas confondre

Un embedding n'est pas un résumé ni une traduction lisible : c'est une représentation mathématique interne, illisible pour un humain. On ne peut pas « lire » un embedding, on peut seulement le comparer à d'autres embeddings pour mesurer une proximité de sens.

Pourquoi ça compte

Sans les embeddings, pas de recherche sémantique, pas de recommandation intelligente, pas de RAG. C'est la brique invisible derrière énormément d'usages d'IA modernes, du moteur de recherche à la détection de doublons dans une base de données.

À retenir

Les embeddings transforment le sens en coordonnées, pour que des concepts proches se retrouvent proches dans l'espace mathématique.

Questions fréquentes

Un embedding, c'est la même chose qu'un mot-clé ?+

Non. Un mot-clé cherche une correspondance exacte de texte, alors qu'un embedding capture le sens, donc il retrouve des formulations différentes qui veulent dire la même chose.

Est-ce que je peux voir à quoi ressemble un embedding ?+

Techniquement oui, c'est une liste de nombres, mais elle n'a aucun sens lisible pour un humain. Seule sa comparaison avec d'autres embeddings est utile.

Où sont utilisés les embeddings au quotidien sans qu'on le sache ?+

Dans les moteurs de recherche, les recommandations Netflix ou Spotify, la détection de spam, et les assistants IA qui vont chercher dans tes documents avant de répondre.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.