Définition
Latence
La latence est le temps d’attente entre ta demande et le début de la réponse de l’IA.
En clair
La latence mesure le délai avant qu’une IA commence à répondre. C’est un facteur clé d’expérience : une réponse juste mais lente peut gâcher un produit.
Comment ça marche
Elle dépend de la taille du modèle, du matériel, de la longueur de la demande et de la distance réseau. Les gros modèles de raisonnement sont plus lents car ils « réfléchissent » plus.
Un exemple concret
Pour un assistant vocal, une latence élevée casse la conversation. Pour un rapport généré la nuit, elle n’a aucune importance.
En pratique
Le « streaming » (afficher la réponse au fur et à mesure) réduit la latence perçue même si le total reste identique.
À retenir
Plus la latence est basse, plus l’IA paraît réactive — clé pour le temps réel.
Questions fréquentes
Comment la réduire ?+
Modèle plus petit, meilleur matériel, prompt plus court, ou streaming de la réponse.
Latence ou débit ?+
La latence = attente initiale ; le débit = vitesse de génération une fois lancée.
Ça vaut le compromis ?+
Souvent oui : on choisit un modèle plus léger quand la réactivité prime sur la finesse.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.