Définition
Vision par ordinateur
La vision par ordinateur permet à une machine d’analyser et comprendre des images et des vidéos.
En clair
La vision par ordinateur (computer vision) est le domaine de l’IA qui traite le visuel : détecter des objets, reconnaître des visages, lire du texte sur une photo, segmenter une image, analyser une vidéo.
Comment ça marche
Des modèles (longtemps des réseaux convolutifs, désormais souvent des Transformers) apprennent, à partir d’énormes jeux d’images étiquetées, à repérer les motifs qui caractérisent chaque catégorie.
Un exemple concret
La vision par ordinateur alimente le déverrouillage par visage, les caisses automatiques, l’aide au diagnostic médical sur radios, ou la détection d’obstacles dans les voitures.
En pratique
Couplée au langage (modèles multimodaux), elle permet aussi de « discuter » d’une image : la décrire, répondre à des questions dessus, en extraire des données.
À retenir
C’est « donner des yeux » à une IA : reconnaître, localiser, décrire ce qu’il y a dans une image.
Questions fréquentes
C’est fiable à 100 % ?+
Non : éclairage, angles ou cas rares peuvent tromper le modèle. On l’encadre selon l’enjeu.
Ça pose des questions de vie privée ?+
Oui, surtout la reconnaissance faciale, très encadrée par la réglementation.
Différence avec l’OCR ?+
L’OCR est une sous-tâche : lire du texte dans une image.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.