Définition
Génération de vidéo (text-to-video)
La génération de vidéo crée de courtes séquences animées à partir d’un texte ou d’une image.
En clair
La génération de vidéo (text-to-video) produit des clips animés à partir d’une description, ou anime une image fixe. C’est l’un des domaines qui progressent le plus vite.
Comment ça marche
Le principe étend celui de l’image : le modèle génère des images cohérentes dans le temps, en gérant le mouvement et la continuité entre les plans — un défi bien plus dur que l’image seule.
Un exemple concret
Créer une courte pub, un plan d’ambiance, une animation de concept, ou donner vie à une illustration en quelques secondes de vidéo.
Les limites
Durées courtes, cohérence parfois fragile (objets qui « fondent »), coût élevé. Ça avance vite, mais reste à vérifier plan par plan pour un usage pro.
À retenir
La technologie la plus spectaculaire du moment — bluffante, mais encore limitée en durée et cohérence.
Questions fréquentes
On peut faire un film ?+
Pas encore d’un bloc : on assemble des clips courts. La durée et la cohérence progressent.
C’est cher ?+
Plus que l’image, car bien plus gourmand en calcul.
Risque de deepfakes ?+
Oui, d’où l’importance du filigrane et d’un usage responsable.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.