Dans cette leçon
La tokenisation, ou comment un modèle lit
Ni lettres, ni mots : un modèle reçoit des tokens. Pariez sur le meilleur découpage, puis mettez-le à l’épreuve.
Le parcours
Du texte au chatbot
C’est l’ordre du cours, pas celui d’une passe avant.
I · Du texte aux représentations
- 01Prédictionétape TransformerPas commencé
- 02Tokenisationétape TransformerPas commencé
- 03Embeddingsétape TransformerPas commencé
II · Dans le Transformer
III · Prédire et apprendre
IV · Du modèle au chatbot
À la fin, vous saurez
- Expliquer pourquoi un modèle transforme le texte en tokens avant tout calcul.
- Comparer les compromis entre caractères, mots et sous-mots.
Avant de commencer : Le jeu que joue un modèle de langage
Combien de « r » dans strawberry ? Un modèle de langage peut produire des pages de texte fluide et perdre ce minuscule pari d’orthographe. L’énigme commence avant la première couche de neurones, dans la salle de découpe.
Un tokeniseur découpe le texte en tokens, puis associe chaque token à un identifiant. Ces identifiants sont les unités d’entrée explicites du réseau ; les lettres, elles, ne voyagent pas à côté.
Si strawberry forme un seul token, ses trois « r » ne sont pas exposés séparément à l’entrée. Cela ne rend pas le comptage impossible, car les couches suivantes peuvent retrouver des indices orthographiques.
La coupe fixe toutefois les morceaux de départ et la facture : le nombre de positions que le reste du réseau devra traiter.
Observez trois coupes et leurs factures
Prenez « manger un avocat ». La règle de découpe peut travailler à plusieurs échelles :
- lettre par lettre :
m,a,n,g,e,r… (une quinzaine d’unités pour trois mots) ; - mot par mot :
manger,un,avocat(trois unités, affaire réglée) ; - ou entre les deux : des morceaux de mots.
La coupe intermédiaire paraît étrange. Est-elle le meilleur rapport qualité-prix ? À vous de parier.
Prédisez le découpage gagnant
Trois candidats : caractères, mots, sous-mots. Le mode qui produit la séquence la plus courte est facile à deviner. La vraie question est ailleurs : que fera chaque mode du mot inventé vélolune, d’un 👋 ou de 3,14 ?
Votre pari
Quel mode encaisse « vélolune » sans perdre son orthographe ni allonger toute la phrase ?
Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.
Missions en cours
- Faites dépasser 3 au ratio caractères par token en Sous-mots
- Avec un emoji ou un mot inventé, ramenez le ratio sous 1,5
Le même texte, compté par les trois méthodes en même temps.
Un compromis courant : les fragments familiers restent entiers ; les mots rares, symboles et emoji se replient sur de petites unités.
Manipulez la facture de découpe
Chaque coupe envoie une facture aux couches suivantes. Passez en mode Caractères. Ce laboratoire préserve le texte inconnu, mais facture un token par caractère, emoji compris.
Essayez Mots. Les entrées de ce petit vocabulaire restent compactes ; les mots absents deviennent <UNK>, et leur orthographe disparaît avec eux.
Revenez aux Sous-mots et réglez votre pari : tapez Vélolune 👋 coûte 3,14 !. Les fragments familiers restent groupés ; de petites unités de repli préservent chaque symbole. Beaucoup de tokeniseurs de production font ce compromis.
Les compteurs montrent le prix. Le vocabulaire doit garder une solution de repli pour l’inconnu, mais moins de tokens pour le même texte, c’est moins de positions à traiter.
Laissez strawberry aux modèles anglophones ; tapez plutôt tokenisation dans ce laboratoire français : ses fragments appris cachent déjà une partie de l’orthographe.
Le réseau ne reçoit que des identifiants et doit reconstruire les lettres avant de compter.
Mission principale. En mode Sous-mots, faites grimper le ratio caractères / token. Le petit corpus vous met sur la piste : les fragments familiers demandent moins de coupes.
Pour aller plus loin. Ajoutez un emoji ou un mot inventé et ramenez le ratio vers 1. Expliquez pourquoi la facture monte.
Comparez votre réponse
Mission principale. « manger un avocat » garde des fragments familiers groupés. Chaque token porte plusieurs caractères, donc le ratio dépasse nettement 1.
Pour aller plus loin. Un 👋 ou vélolune inconnu se replie sur de petits morceaux. Plus de coupes couvrent le même texte, donc la facture monte et le ratio retombe vers 1.
Expliquez la recette des sous-mots
Les tokeniseurs de sous-mots apprennent un vocabulaire de fragments récurrents. Dans la famille BPE (Byte Pair Encoding), notre version pédagogique répète une règle :
Repérer la paire de fragments voisins la plus fréquente, la fusionner, puis recommencer.
C’est la règle de découpe. Le déroulé montre seulement les fusions qui modifient le mot témoin ; chaque badge conserve le rang de la fusion dans l’entraînement complet.
BPE apprend sur tout le corpus. Cette lecture ne montre que les fusions qui modifient le mot témoin ; les autres sont ignorées.
Les fragments fréquents deviennent de grands tokens ; le texte inconnu se replie sur de petites unités. Ce laboratoire fusionne des caractères Unicode afin de garder chaque coupe visible.
Les tokeniseurs de production partent souvent d’octets et ajoutent des règles de pré-découpage. L’arbitrage, lui, ne change pas : couvrir tous les textes possibles, ou raccourcir la séquence.
Si C caractères hors espaces produisent T tokens visibles, le taux de compression affiché vaut C / T. En mode Sous-mots, un ratio élevé signale un vocabulaire qui contenait déjà de longs morceaux de votre texte.
Il ne mesure ni la qualité du texte ni l’intelligence du modèle. En mode Mots, un mot inconnu se réduit à une seule pastille <UNK>, et le ratio grimpe, même sur un texte jamais vu.
Idée fausse à éviter. Un token n’est pas toujours une unité de sens : sa frontière dépend du tokeniseur et de son vocabulaire. Changez de langue, de tokeniseur ou de système d’écriture, et le même mot se découpe autrement.
Réfléchissez avant de continuer
Point de contrôle
Que reçoit la première couche de neurones après le découpage de vélolune par le tokeniseur ?
Choisissez d’abord une réponse.
Reliez ces numéros à la suite
Avant de partir, tapez manger un avocat en mode Sous-mots. Ignorez les puces d’espace affichées à part. Le petit vocabulaire du cours conserve manger, un et avocat entiers.
Pour la suite, ces tokens pédagogiques reçoivent les adresses #120, #18 et #901. Ce sont des données du cours ; aucun tokeniseur de production ne les a attribuées.
- Vous écrivezmanger un avocat
- BPE conservemanger · un · avocat
- Le cours transporte#120 · #18 · #901
Ces nombres sont des adresses : leur valeur numérique ne dit rien du sens. Au chapitre suivant, chaque adresse ouvre une ligne de coordonnées apprises et pose son token sur une carte. De quoi trancher entre le fruit et le barreau ?
Sources et périmètre
- Sennrich, Haddow et Birch (2016) présentent des unités de sous-mots de type BPE pour représenter les mots rares ou inconnus.
- Le laboratoire emploie une variante pédagogique lisible fondée sur les caractères Unicode. Les tokeniseurs de production peuvent travailler sur des octets et appliquer d’autres règles de pré-découpage.
- Contenu et affirmations relus le 28 juillet 2026.