← Glossaire IA

Définition

Latence

La latence est le temps d’attente entre ta demande et le début de la réponse de l’IA.

En clair

La latence mesure le délai avant qu’une IA commence à répondre. C’est un facteur clé d’expérience : une réponse juste mais lente peut gâcher un produit.

Comment ça marche

Elle dépend de la taille du modèle, du matériel, de la longueur de la demande et de la distance réseau. Les gros modèles de raisonnement sont plus lents car ils « réfléchissent » plus.

Un exemple concret

Pour un assistant vocal, une latence élevée casse la conversation. Pour un rapport généré la nuit, elle n’a aucune importance.

En pratique

Le « streaming » (afficher la réponse au fur et à mesure) réduit la latence perçue même si le total reste identique.

À retenir

Plus la latence est basse, plus l’IA paraît réactive — clé pour le temps réel.

Questions fréquentes

Comment la réduire ?+

Modèle plus petit, meilleur matériel, prompt plus court, ou streaming de la réponse.

Latence ou débit ?+

La latence = attente initiale ; le débit = vitesse de génération une fois lancée.

Ça vaut le compromis ?+

Souvent oui : on choisit un modèle plus léger quand la réactivité prime sur la finesse.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.