← Glossaire IA

Définition

Données synthétiques

Les données synthétiques sont des données générées artificiellement pour entraîner ou tester une IA.

En clair

Les données synthétiques sont créées par ordinateur (souvent par une autre IA) plutôt que collectées dans le monde réel. Elles servent à combler un manque de données ou à éviter d’exposer des données personnelles.

Comment ça marche

On génère des exemples réalistes couvrant les cas voulus, y compris des situations rares difficiles à collecter. On les mélange parfois à de vraies données pour équilibrer.

Un exemple concret

Pour entraîner une IA médicale sans manipuler de vrais dossiers patients, on peut générer des dossiers fictifs statistiquement réalistes.

À manier avec prudence

Trop de données synthétiques de mauvaise qualité peut dégrader un modèle (risque d’amplifier des biais ou de tourner en rond). La qualité prime sur la quantité.

À retenir

Quand les vraies données manquent (ou sont sensibles), on en fabrique — avec prudence.

Questions fréquentes

C’est fiable ?+

Utile si bien conçu et validé. Mal fait, ça introduit des biais ou du bruit.

Ça remplace les vraies données ?+

Rarement complètement : c’est un complément, surtout pour les cas rares ou sensibles.

Quel avantage vie privée ?+

Pas de données personnelles réelles exposées, à condition que le synthétique ne « fuie » pas d’infos.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.