Définition
Tokenisation
La tokenisation découpe un texte en petites unités (tokens) que le modèle sait manipuler.
En clair
La tokenisation est l’étape qui transforme ton texte en une suite de tokens (mots, morceaux de mots, symboles). Le modèle ne voit jamais des lettres, mais ces unités.
Comment ça marche
Une méthode répandue, le BPE (Byte Pair Encoding), fusionne les combinaisons de caractères les plus fréquentes en tokens. Les mots courants deviennent un seul token ; les mots rares, plusieurs.
Un exemple concret
« bonjour » peut être un seul token ; « anticonstitutionnellement » en plusieurs. C’est pourquoi certaines langues ou termes rares « coûtent » plus de tokens que d’autres.
Pourquoi ça compte
La tokenisation explique la facturation au token, les limites de la fenêtre de contexte, et pourquoi le modèle bute parfois sur l’orthographe ou le comptage de lettres.
À retenir
Avant de « lire », une IA découpe le texte en morceaux — souvent des bouts de mots.
Questions fréquentes
Un token = un mot ?+
Pas toujours : souvent un bout de mot. En français, ~0,75 mot par token en moyenne.
Pourquoi l’IA compte mal les lettres ?+
Parce qu’elle voit des tokens, pas des lettres individuelles.
BPE, c’est quoi ?+
Une technique de tokenisation qui fusionne les motifs de caractères fréquents.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.