Définition
Données synthétiques
Les données synthétiques sont des données générées artificiellement pour entraîner ou tester une IA.
En clair
Les données synthétiques sont créées par ordinateur (souvent par une autre IA) plutôt que collectées dans le monde réel. Elles servent à combler un manque de données ou à éviter d’exposer des données personnelles.
Comment ça marche
On génère des exemples réalistes couvrant les cas voulus, y compris des situations rares difficiles à collecter. On les mélange parfois à de vraies données pour équilibrer.
Un exemple concret
Pour entraîner une IA médicale sans manipuler de vrais dossiers patients, on peut générer des dossiers fictifs statistiquement réalistes.
À manier avec prudence
Trop de données synthétiques de mauvaise qualité peut dégrader un modèle (risque d’amplifier des biais ou de tourner en rond). La qualité prime sur la quantité.
À retenir
Quand les vraies données manquent (ou sont sensibles), on en fabrique — avec prudence.
Questions fréquentes
C’est fiable ?+
Utile si bien conçu et validé. Mal fait, ça introduit des biais ou du bruit.
Ça remplace les vraies données ?+
Rarement complètement : c’est un complément, surtout pour les cas rares ou sensibles.
Quel avantage vie privée ?+
Pas de données personnelles réelles exposées, à condition que le synthétique ne « fuie » pas d’infos.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.