Définition
Synthèse vocale (text-to-speech)
La synthèse vocale transforme un texte écrit en voix parlée, de plus en plus naturelle.
En clair
La synthèse vocale (text-to-speech, TTS) convertit du texte en parole audio. Les modèles récents produisent des voix expressives, avec intonation et respiration, difficiles à distinguer d’un humain.
Comment ça marche
Un modèle apprend, à partir d’heures d’enregistrements, à générer le signal audio correspondant à un texte, en respectant prononciation, rythme et émotion.
Un exemple concret
Un article de blog lu à voix haute pour une version podcast, un livre audio généré automatiquement, ou la voix d’un assistant vocal : tout ça, c’est du TTS.
À ne pas confondre
Le TTS produit de la voix à partir de texte ; l’inverse (voix → texte) s’appelle la reconnaissance vocale. Le clonage vocal, lui, imite une voix précise.
À retenir
Le text-to-speech donne une voix à tes contenus — accessibilité, audio, assistants.
Questions fréquentes
Les voix sont-elles réalistes ?+
Les meilleures sont bluffantes. La qualité varie selon les outils et les langues.
Peut-on choisir la voix ?+
Oui : genre, âge, ton, parfois émotion. Certains outils clonent même une voix existante.
Quels usages ?+
Accessibilité, podcasts, formation, jeux, doublage, assistants.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.