← Glossaire IA

Définition

Modèle de diffusion

Un modèle de diffusion est une IA qui apprend à créer une image (ou un son) en partant de bruit aléatoire et en le "nettoyant" petit à petit jusqu'à obtenir un résultat net.

En clair

Un modèle de diffusion est la technologie derrière la plupart des générateurs d'images actuels comme Midjourney, DALL-E ou Stable Diffusion. Son principe est étonnant : au lieu de dessiner directement une image, il part d'une image 100% bruitée (comme la neige sur un vieux téléviseur) et la débruite progressivement, étape par étape, jusqu'à faire apparaître une image cohérente qui correspond à ta demande.

Comment ça marche

L'entraînement se fait à l'envers de l'utilisation :

  • Phase d'apprentissage : on prend des vraies photos, on leur ajoute du bruit petit à petit jusqu'à ce qu'elles deviennent de la neige totale. L'IA apprend à chaque étape à deviner "quel bruit vient d'être ajouté" pour pouvoir l'enlever.
  • Phase de génération : une fois entraînée, l'IA fait l'inverse. Elle part d'une image de bruit pur et, guidée par ton texte ("un chat astronaute sur la lune"), elle enlève le bruit couche par couche (souvent 20 à 50 étapes) jusqu'à révéler une image nette qui correspond à la description.

C'est un peu comme un sculpteur qui ne rajoute pas de matière, mais qui retire des morceaux de marbre jusqu'à faire apparaître une statue déjà "présente" dans le bloc.

Un exemple concret

Quand tu tapes "un renard qui lit un livre sous la pluie, style aquarelle" dans Stable Diffusion, l'outil génère d'abord une image totalement aléatoire de pixels colorés. Puis, à chaque étape, il compare ce bruit à ton texte et ajuste : il enlève un peu de bruit "vers" un renard, "vers" de la pluie, "vers" un style aquarelle. Au bout de quelques secondes, l'image finale apparaît, nette et cohérente.

À ne pas confondre

Ce n'est pas la même famille que les GANs (Generative Adversarial Networks), une technologie plus ancienne où deux réseaux "s'affrontent" (un qui génère, un qui juge). Les modèles de diffusion sont généralement plus stables à entraîner et produisent des images de meilleure qualité, ce qui explique pourquoi ils ont pris le dessus depuis 2022.

À retenir

Générer une image, c'est un peu comme sculpter dans le brouillard : on enlève du flou jusqu'à ce que la forme apparaisse.

Questions fréquentes

Pourquoi ça met du temps à générer une image ?+

Parce que le processus se fait en plusieurs dizaines d'étapes de débruitage successives, contrairement à d'autres IA qui génèrent en une seule passe. C'est le compromis qualité contre vitesse.

Les modèles de diffusion servent-ils qu'aux images ?+

Non, on les utilise aussi pour générer de l'audio, de la vidéo, et même des molécules en recherche pharmaceutique. Le principe "bruit vers signal" marche pour plein de types de données.

Est-ce que l'IA "invente" vraiment ou copie des images existantes ?+

Elle ne stocke pas les images d'origine, elle a appris des motifs statistiques à partir de millions d'exemples. Le résultat est une recombinaison créative, mais le débat sur les droits d'auteur des images d'entraînement reste bien réel.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.