← Glossaire IA

Définition

Inférence

L’inférence, c’est le moment où un modèle déjà entraîné produit une réponse à partir de ta demande.

En clair

On distingue deux phases dans la vie d’un modèle. L’entraînement, où il apprend à partir de données. Et l’inférence, où il utilise ce qu’il a appris pour répondre à une nouvelle question, en temps réel.

Comment ça marche

Pendant l’inférence, aucun apprentissage : le modèle applique ses poids figés à ton entrée pour générer une sortie. C’est ce qui se passe chaque fois que tu envoies un message à un assistant.

Un exemple concret

Entraîner un grand modèle peut coûter des millions d’euros et durer des semaines. Mais chaque réponse qu’il te donne ensuite (l’inférence) prend une fraction de seconde et coûte quelques centimes.

Pourquoi ça compte

À l’échelle, ce sont les coûts d’inférence (répétés à chaque requête) qui pèsent le plus. D’où l’intérêt des modèles plus petits, quantizés ou distillés.

À retenir

Entraînement = apprendre (une fois, cher). Inférence = répondre (à chaque usage).

Questions fréquentes

Le modèle apprend-il pendant l’inférence ?+

Non, ses poids ne changent pas. Il « raisonne » sur le moment sans mémoriser durablement.

Pourquoi certaines réponses sont lentes ?+

Plus le texte à générer est long et le modèle gros, plus l’inférence prend de temps.

Où se fait l’inférence ?+

Sur des serveurs (le cloud), ou en local sur ta machine pour les modèles légers.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.