← Glossaire IA

Définition

Quantization

La quantization réduit la précision des nombres d’un modèle pour le rendre plus léger et plus rapide.

En clair

Un modèle est fait de millions de nombres (ses « poids »). La quantization stocke ces nombres avec moins de précision (par exemple 4 bits au lieu de 16), ce qui divise la mémoire nécessaire et accélère les calculs.

Comment ça marche

On « arrondit » les poids sur une échelle plus grossière. Le modèle devient plus petit et tourne sur du matériel modeste, au prix d’une légère perte de qualité — souvent imperceptible.

Un exemple concret

Un modèle open source de 13 milliards de paramètres peut passer de ~26 Go à ~7 Go une fois quantizé, et tourner sur un bon PC portable au lieu d’un serveur avec GPU coûteux.

En pratique

C’est ce qui rend possible l’exécution de l’IA en local. Plus on compresse, plus c’est léger, mais plus le risque de dégradation augmente : on cherche le bon compromis.

À retenir

C’est comme compresser un MP3 : un peu de qualité en moins, mais un fichier bien plus petit et fluide.

Questions fréquentes

On perd beaucoup en qualité ?+

Souvent très peu jusqu’à 4 bits. En dessous, la dégradation devient sensible.

À quoi ça sert concrètement ?+

À faire tourner des modèles sur des machines modestes (PC, téléphone) et à réduire les coûts.

Différence avec la distillation ?+

La quantization compresse les nombres ; la distillation entraîne un plus petit modèle à imiter un gros.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.