Définition
Transformer
Le Transformer est une architecture de réseau de neurones, inventée en 2017, qui a révolutionné l'IA en apprenant à repérer les liens entre tous les mots d'un texte en même temps plutôt que un par un.
En clair
Le Transformer est une architecture, une manière d'organiser un réseau de neurones pour qu'il traite du texte (ou des images, du son) efficacement. Elle a été présentée en 2017 par des chercheurs de Google dans un article resté célèbre, intitulé Attention is All You Need. Depuis, presque toutes les IA génératives dont on parle (GPT, Gemini, Claude, Mistral) reposent dessus.
Comment ça marche
Avant le Transformer, les IA lisaient le texte mot par mot, dans l'ordre, un peu comme nous quand on lit à voix haute lentement. Le problème : au bout de longues phrases, elles oubliaient le début.
Le Transformer change tout grâce à un mécanisme appelé attention : il regarde tous les mots d'une phrase en même temps et calcule à quel point chaque mot est lié à chaque autre. Par exemple dans la phrase « Le chat a mangé son croquette parce qu'il avait faim », le mot « il » va automatiquement se relier à « chat », même si plusieurs mots les séparent. Cette capacité à faire des liens sur de longues distances, tout en traitant le texte en parallèle (donc plus vite), est ce qui a permis de faire des modèles à la fois plus performants et plus rapides à entraîner.
Un exemple concret
Quand tu écris à ChatGPT « Marie a donné son livre à Julie parce qu'elle avait fini de le lire », le modèle doit comprendre qui est « elle » : Marie ou Julie ? Grâce au mécanisme d'attention du Transformer, il pondère les liens entre tous les mots de la phrase et déduit, selon le contexte, la bonne interprétation. C'est ce genre de calcul, répété des milliards de fois à travers des dizaines de couches, qui donne l'impression que l'IA "comprend" le langage.
À ne pas confondre
Transformer (l'architecture) n'est pas la même chose qu'un LLM (le modèle entraîné avec cette architecture). Le Transformer est le plan de construction, le LLM est le bâtiment fini. GPT-4 est un LLM qui utilise une architecture Transformer, entraîné sur des quantités massives de texte.
En pratique
Tu n'as jamais besoin de "configurer" un Transformer toi-même : c'est un choix technique fait par les créateurs de modèles. Mais savoir que ça existe aide à comprendre pourquoi l'IA générative a explosé depuis 2018-2020, et pas avant.
À retenir
Sans le Transformer, il n'y aurait ni ChatGPT, ni Gemini, ni presque aucune IA générative actuelle.
Questions fréquentes
Pourquoi le Transformer a-t-il autant changé l'IA ?+
Parce qu'il permet de traiter le texte en parallèle plutôt que mot par mot, ce qui le rend à la fois plus rapide à entraîner et meilleur pour comprendre les liens entre mots éloignés dans une phrase.
Le Transformer sert-il seulement pour le texte ?+
Non, on l'utilise aussi pour les images (comme dans certains générateurs d'images), l'audio, la vidéo, voire des données biologiques comme les protéines.
Faut-il être ingénieur pour comprendre le Transformer ?+
Pas pour l'idée générale : retenir que c'est un mécanisme qui "fait attention" aux liens entre tous les éléments d'un texte suffit pour comprendre pourquoi les IA actuelles sont si douées en langage.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.