← Glossaire IA

Définition

Synthèse vocale (text-to-speech)

La synthèse vocale transforme un texte écrit en voix parlée, de plus en plus naturelle.

En clair

La synthèse vocale (text-to-speech, TTS) convertit du texte en parole audio. Les modèles récents produisent des voix expressives, avec intonation et respiration, difficiles à distinguer d’un humain.

Comment ça marche

Un modèle apprend, à partir d’heures d’enregistrements, à générer le signal audio correspondant à un texte, en respectant prononciation, rythme et émotion.

Un exemple concret

Un article de blog lu à voix haute pour une version podcast, un livre audio généré automatiquement, ou la voix d’un assistant vocal : tout ça, c’est du TTS.

À ne pas confondre

Le TTS produit de la voix à partir de texte ; l’inverse (voix → texte) s’appelle la reconnaissance vocale. Le clonage vocal, lui, imite une voix précise.

À retenir

Le text-to-speech donne une voix à tes contenus — accessibilité, audio, assistants.

Questions fréquentes

Les voix sont-elles réalistes ?+

Les meilleures sont bluffantes. La qualité varie selon les outils et les langues.

Peut-on choisir la voix ?+

Oui : genre, âge, ton, parfois émotion. Certains outils clonent même une voix existante.

Quels usages ?+

Accessibilité, podcasts, formation, jeux, doublage, assistants.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.