Définition
Inférence
L’inférence, c’est le moment où un modèle déjà entraîné produit une réponse à partir de ta demande.
En clair
On distingue deux phases dans la vie d’un modèle. L’entraînement, où il apprend à partir de données. Et l’inférence, où il utilise ce qu’il a appris pour répondre à une nouvelle question, en temps réel.
Comment ça marche
Pendant l’inférence, aucun apprentissage : le modèle applique ses poids figés à ton entrée pour générer une sortie. C’est ce qui se passe chaque fois que tu envoies un message à un assistant.
Un exemple concret
Entraîner un grand modèle peut coûter des millions d’euros et durer des semaines. Mais chaque réponse qu’il te donne ensuite (l’inférence) prend une fraction de seconde et coûte quelques centimes.
Pourquoi ça compte
À l’échelle, ce sont les coûts d’inférence (répétés à chaque requête) qui pèsent le plus. D’où l’intérêt des modèles plus petits, quantizés ou distillés.
À retenir
Entraînement = apprendre (une fois, cher). Inférence = répondre (à chaque usage).
Questions fréquentes
Le modèle apprend-il pendant l’inférence ?+
Non, ses poids ne changent pas. Il « raisonne » sur le moment sans mémoriser durablement.
Pourquoi certaines réponses sont lentes ?+
Plus le texte à générer est long et le modèle gros, plus l’inférence prend de temps.
Où se fait l’inférence ?+
Sur des serveurs (le cloud), ou en local sur ta machine pour les modèles légers.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.