← Glossaire IA

Définition

Reconnaissance vocale (speech-to-text)

La reconnaissance vocale transcrit automatiquement de la parole en texte.

En clair

La reconnaissance vocale (speech-to-text, STT) convertit un audio parlé en texte écrit. C’est la brique derrière la dictée, les sous-titres automatiques et la transcription de réunions.

Comment ça marche

Un modèle entraîné sur d’énormes quantités d’audio associé à sa transcription apprend à relier les sons aux mots, en gérant accents, bruit et hésitations.

Un exemple concret

Tu enregistres une réunion : l’outil en produit la transcription, repère les intervenants, et un modèle de langage peut ensuite résumer les décisions et les tâches.

En pratique

Des modèles comme Whisper ont rendu la transcription de qualité accessible à tous, dans de nombreuses langues, souvent gratuitement.

À retenir

Le speech-to-text transforme ce qu’on dit en texte : dictée, sous-titres, comptes rendus de réunion.

Questions fréquentes

Ça gère les accents ?+

Plutôt bien pour les grands modèles, mais la précision baisse sur audio bruité ou accents marqués.

En temps réel ?+

Oui pour la dictée et les sous-titres live ; la précision maximale demande parfois un traitement différé.

Multilingue ?+

Les meilleurs modèles transcrivent (et parfois traduisent) des dizaines de langues.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.