Définition
Distillation
La distillation entraîne un petit modèle à imiter un grand, pour obtenir presque les mêmes performances en beaucoup plus léger.
En clair
La distillation (knowledge distillation) consiste à faire apprendre à un modèle « élève » compact en s’appuyant sur les réponses d’un modèle « professeur » plus gros et plus capable.
Comment ça marche
Le gros modèle produit des exemples (ou des probabilités détaillées), et le petit s’entraîne à les reproduire. Il hérite ainsi d’une bonne partie du comportement du professeur, avec une fraction de la taille et du coût.
Un exemple concret
Beaucoup de petits modèles rapides destinés aux téléphones ou aux applis à fort trafic sont distillés à partir de modèles bien plus lourds : réponses quasi équivalentes, latence et coût divisés.
À ne pas confondre
Ce n’est pas de la compression de nombres (ça, c’est la quantization) : ici on ré-entraîne un nouveau modèle, plus petit, à partir du grand.
À retenir
On transmet le « savoir » d’un gros modèle à un plus petit, moins cher à faire tourner.
Questions fréquentes
L’élève égale-t-il le professeur ?+
Rarement à 100 %, mais il s’en approche souvent assez pour un usage donné, à coût très réduit.
Pourquoi distiller plutôt qu’entraîner directement ?+
Apprendre d’un professeur déjà bon est plus efficace que repartir de zéro.
C’est légal ?+
Ça dépend des conditions d’utilisation du modèle professeur : certaines l’interdisent.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.