Définition
Reconnaissance vocale (speech-to-text)
La reconnaissance vocale transcrit automatiquement de la parole en texte.
En clair
La reconnaissance vocale (speech-to-text, STT) convertit un audio parlé en texte écrit. C’est la brique derrière la dictée, les sous-titres automatiques et la transcription de réunions.
Comment ça marche
Un modèle entraîné sur d’énormes quantités d’audio associé à sa transcription apprend à relier les sons aux mots, en gérant accents, bruit et hésitations.
Un exemple concret
Tu enregistres une réunion : l’outil en produit la transcription, repère les intervenants, et un modèle de langage peut ensuite résumer les décisions et les tâches.
En pratique
Des modèles comme Whisper ont rendu la transcription de qualité accessible à tous, dans de nombreuses langues, souvent gratuitement.
À retenir
Le speech-to-text transforme ce qu’on dit en texte : dictée, sous-titres, comptes rendus de réunion.
Questions fréquentes
Ça gère les accents ?+
Plutôt bien pour les grands modèles, mais la précision baisse sur audio bruité ou accents marqués.
En temps réel ?+
Oui pour la dictée et les sous-titres live ; la précision maximale demande parfois un traitement différé.
Multilingue ?+
Les meilleurs modèles transcrivent (et parfois traduisent) des dizaines de langues.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.