← Glossaire IA

Définition

Tokenisation

La tokenisation découpe un texte en petites unités (tokens) que le modèle sait manipuler.

En clair

La tokenisation est l’étape qui transforme ton texte en une suite de tokens (mots, morceaux de mots, symboles). Le modèle ne voit jamais des lettres, mais ces unités.

Comment ça marche

Une méthode répandue, le BPE (Byte Pair Encoding), fusionne les combinaisons de caractères les plus fréquentes en tokens. Les mots courants deviennent un seul token ; les mots rares, plusieurs.

Un exemple concret

« bonjour » peut être un seul token ; « anticonstitutionnellement » en plusieurs. C’est pourquoi certaines langues ou termes rares « coûtent » plus de tokens que d’autres.

Pourquoi ça compte

La tokenisation explique la facturation au token, les limites de la fenêtre de contexte, et pourquoi le modèle bute parfois sur l’orthographe ou le comptage de lettres.

À retenir

Avant de « lire », une IA découpe le texte en morceaux — souvent des bouts de mots.

Questions fréquentes

Un token = un mot ?+

Pas toujours : souvent un bout de mot. En français, ~0,75 mot par token en moyenne.

Pourquoi l’IA compte mal les lettres ?+

Parce qu’elle voit des tokens, pas des lettres individuelles.

BPE, c’est quoi ?+

Une technique de tokenisation qui fusionne les motifs de caractères fréquents.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.