← Glossaire IA

Définition

Auto-supervisé (self-supervised)

L’apprentissage auto-supervisé crée ses propres étiquettes à partir des données brutes, sans annotation humaine.

En clair

Dans l’apprentissage auto-supervisé, le modèle fabrique lui-même l’exercice à partir des données. Typiquement : cacher une partie du texte et apprendre à la deviner.

Comment ça marche

On masque un mot dans une phrase (ou on demande de prédire le mot suivant) : la « bonne réponse » est simplement le mot d’origine. Aucun humain n’a annoté quoi que ce soit — le signal vient des données elles-mêmes.

Un exemple concret

« Le chat dort sur le ___ » → le modèle apprend à prédire « canapé ». Répété sur des milliards de phrases, il acquiert une compréhension profonde du langage.

Pourquoi ça compte

C’est ce qui a rendu possibles les LLM : on peut apprendre sur d’énormes quantités de texte non étiqueté, ce qui aurait été impensable à annoter à la main.

À retenir

C’est la clé qui a permis d’entraîner les grands modèles sur tout le web, sans tout étiqueter à la main.

Questions fréquentes

Différence avec le non supervisé ?+

C’est une forme de non supervisé où l’on fabrique des « étiquettes » à partir des données.

C’est comme ça qu’apprend ChatGPT ?+

La phase de pré-entraînement, oui : prédire le mot suivant sur d’immenses corpus.

Il faut quand même des humains ?+

Ensuite, pour l’ajustement (RLHF) et la sécurité, oui.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.