Définition
Surapprentissage (overfitting)
Le surapprentissage, c’est quand un modèle apprend « par cœur » ses données d’entraînement et échoue sur des cas nouveaux.
En clair
Le surapprentissage (overfitting) survient quand un modèle colle trop aux exemples vus pendant l’entraînement, y compris à leurs détails et au bruit, au lieu d’en tirer des règles générales.
Comment ça marche
À force de s’ajuster aux données d’entraînement, le modèle devient excellent dessus… mais se plante sur des données qu’il n’a jamais vues. On le repère quand la performance est bonne à l’entraînement mais mauvaise sur un jeu de test séparé.
Un exemple concret
Un détecteur de spam entraîné sur trop peu d’e-mails apprend que « le mot X = spam » parce que ça collait à ses exemples, et se trompe dès qu’un vrai message contient X.
Comment l’éviter
Plus de données variées, des techniques de régularisation, et surtout tester sur des données séparées de l’entraînement.
À retenir
Un modèle qui récite ne comprend pas : bon sur l’examen révisé, perdu dès qu’on change la question.
Questions fréquentes
Le contraire existe ?+
Oui : le sous-apprentissage (underfitting), quand le modèle est trop simple pour capter les motifs utiles.
Comment le détecter ?+
En comparant la performance sur l’entraînement et sur un jeu de test indépendant.
Ça touche les grands modèles ?+
Moins, grâce à l’énormité des données, mais le risque existe sur des tâches ou données étroites.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.