Définition
Quantization
La quantization réduit la précision des nombres d’un modèle pour le rendre plus léger et plus rapide.
En clair
Un modèle est fait de millions de nombres (ses « poids »). La quantization stocke ces nombres avec moins de précision (par exemple 4 bits au lieu de 16), ce qui divise la mémoire nécessaire et accélère les calculs.
Comment ça marche
On « arrondit » les poids sur une échelle plus grossière. Le modèle devient plus petit et tourne sur du matériel modeste, au prix d’une légère perte de qualité — souvent imperceptible.
Un exemple concret
Un modèle open source de 13 milliards de paramètres peut passer de ~26 Go à ~7 Go une fois quantizé, et tourner sur un bon PC portable au lieu d’un serveur avec GPU coûteux.
En pratique
C’est ce qui rend possible l’exécution de l’IA en local. Plus on compresse, plus c’est léger, mais plus le risque de dégradation augmente : on cherche le bon compromis.
À retenir
C’est comme compresser un MP3 : un peu de qualité en moins, mais un fichier bien plus petit et fluide.
Questions fréquentes
On perd beaucoup en qualité ?+
Souvent très peu jusqu’à 4 bits. En dessous, la dégradation devient sensible.
À quoi ça sert concrètement ?+
À faire tourner des modèles sur des machines modestes (PC, téléphone) et à réduire les coûts.
Différence avec la distillation ?+
La quantization compresse les nombres ; la distillation entraîne un plus petit modèle à imiter un gros.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.