Chapitre 07III · Prédire et apprendre9 min de lecture · ~12 min de manipulation

III · Prédire et apprendre

Dans cette leçon

Logits, température et le token qui sort

Le vecteur final devient un pari sur tout le vocabulaire, une politique de décodage choisit le token - et le jouet non entraîné garde une surprise en réserve.

À la fin, vous saurez

  • Tracer le chemin du dernier vecteur de sortie jusqu’aux logits, aux probabilités et au token tiré.
  • Distinguer ce que le modèle calcule de ce que la politique de décodage choisit.
  • Démontrer comment une fenêtre de contexte finie retire les premiers tokens des appels suivants.

Avant de commencer : Le bloc Transformer, l’étage que l’on empile

Au sommet de la tour reste un vecteur de sortie - deux nombres, dans notre jouet. Il vient de la dernière position, le seul flux causal à avoir vu tout le contexte. Et un lecteur attend un mot.

La réponse se cache dans une table déjà connue, lue à l’envers. Le geste que le chapitre 6 a laissé en suspens transforme ce vecteur en pari sur tout le vocabulaire, puis mise pour de bon.

C’est aussi le chapitre où notre jouet fabriqué à la main se fait surprendre à faire semblant de savoir le français.

Observez la table lue à l’envers

Pour noter un mot, le modèle calcule le produit scalaire du vecteur de contexte et de la ligne d’embedding de ce mot, celle du chapitre 3. La table de l’aller sert de juge au retour.

Beaucoup de modèles de production partagent ces deux tables. Ce choix courant s’appelle le liage des poids (weight tying) ; le studio l’emploie pour montrer les deux rôles d’une même ligne.

À partir d’ici, poids désigne les nombres appris du modèle. Les poids d’attention du chapitre 4 étaient différents : des parts temporaires recalculées à chaque phrase.

Chaque score brut sur le vocabulaire est un logit. Après l’appel au modèle, le moteur de décodage peut régler la température.

Le softmax - le comptable du chapitre 4 - convertit les logits en parts de 100 %. Reste à savoir si ces parts visent juste.

Prédisez le premier mot du jouet

Le contexte est la trace du cours, « manger un ». Chaque nombre de cette machine a été réglé à la main pour être lisible, pas pour être juste, et rien n’a jamais été entraîné.

Votre pari

Après « manger un », sur quel nom notre modèle fabriqué à la main parie-t-il vraiment ?

Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.

Studio de génération / du vecteur au token

Le sommet de la tour produit un vecteur ; le lecteur attend un mot. Regardez le vecteur devenir un pari, puis laissez la politique de décodage choisir.

Régler k et p
Déplacer la ligne liée d’avocatLa même ligne représente avocat à l’entrée et le note à la sortie. Le chapitre suivant la déplacera par gradient.

Missions en cours

  • Briser la boucle de chat avec une politique non gloutonne
  • Déplacer la ligne liée jusqu’à faire gagner avocat

Du vecteur au pari

Contexte actuel → vecteur de sortie h = [3,661 ; 1,974]

MotLogit h · E[mot]Part (après T)Part finale
chat · #314gardé4,42446,1 %
chien · #271écarté4,05231,8 %
reine · #409écarté2,99311,0 %
roi · #408écarté2,94310,5 %
vélo · #734écarté-0,8640,23 %
voiture · #733écarté-0,8860,23 %
avocat · #901écarté-1,6210,11 %
pomme · #612écarté-2,2240,06 %

La boucle, en vrai

Chaque tirage relance tout : bloc causal → logits → politique → token ajouté au contexte.

mangerun

Politique gloutonne : le dé est ignoré, le maximum gagne toujours.

#2019

Manipulez la politique

C’est chat qui gagne, à environ 46 % - et avocat termine en queue de classement avec 0,1 % ; seule pomme fait pire. Gardez ce 0,1 % en tête. Le chapitre 8 y reviendra.

Descendez la température à 0,5 et lisez la colonne Part (après T) : la part du gagnant enfle. Montez-la à 2 et cette distribution s’aplatit ; les outsiders respirent.

Surveillez le classement : il ne bouge pas. La Part finale reste à 100 % pour chat pendant tout ce temps, car la politique appliquée ensuite est encore gloutonne et ne garde qu’un seul candidat.

Comparez maintenant les politiques. Réglez la Politique de décodage sur Gloutonne (argmax) : elle prend toujours le maximum. Tirez quelques tokens et le jouet écrit « manger un chat chat chat… », une répétition appelée dégénérescence.

Top-k et top-p coupent la queue avant le tirage ; le tirage complet ne coupe rien et pioche dans toute la distribution. Le dé porte un numéro, et ce numéro est la graine (seed) : même graine, même texte.

Déplacez les deux coordonnées d’avocat. Le casier lu à l’entrée et le juge lu à la sortie sont la même ligne liée, si bien que cette commande peut changer le classement lui-même.

Faites gagner avocat, puis réinitialisez. Au chapitre 8, c’est l’entraînement qui déplacera cette ligne, à partir d’exemples et non à la main.

Réduisez la fenêtre de contexte à deux tokens et tirez encore. Les premières puces pâlissent à mesure que de nouvelles arrivent. L’application les affiche toujours, mais l’appel suivant ne reçoit que la fin visible.

Les systèmes de chat réels vivent eux aussi sur un budget de contexte fini, donc l’application qui entoure le modèle peut tronquer, résumer ou récupérer les échanges anciens.

Une longue conversation ne devient pas une mémoire permanente dans les poids.

La génération doit aussi savoir s’arrêter. Le modèle peut parier sur un token de fin de séquence appris. L’application extérieure peut également s’arrêter sur un budget de tokens, un délimiteur, un appel d’outil ou une règle de sécurité.

Le modèle fournit un pari à la fois, un token par pari. L’orchestrateur - le code applicatif autour de lui - décide s’il en demande un autre.

Défi Mission principale : faites passer avocat en tête. Essayez d’abord la température, puis déplacez sa ligne liée. Expliquez pourquoi une seule de ces commandes peut changer le classement.

Pour aller plus loin : brisez la boucle « chat chat chat » avec une politique d’échantillonnage. Nommez ce qui a changé - les logits du modèle ou la règle du moteur de décodage.

Comparez votre réponse

La température divise tous les logits par le même nombre positif. Elle change les écarts et les parts, jamais leur ordre. Avocat ne peut donc pas atteindre la première place ainsi.

Déplacer avocat change sa ligne liée, donc son logit peut dépasser celui de chat. Quitter le décodage glouton ne change que la politique du moteur de décodage : les logits restent en place, mais un autre token peut gagner le tirage.

Expliquez le partage des rôles

La chaîne repose sur un partage strict des rôles :

  • Le modèle calcule : vecteur de contexte → logits, un score brut pour chaque mot. Ici, les poids appris façonnent son pari en cours.
  • Le moteur de décodage agit ensuite : il règle la température, applique softmax, puis choisit une politique - gloutonne, top-k, top-p ou tirage complet - sans modifier le modèle.

La température appartient à la seconde moitié. Un même diviseur positif pour tous les logits resserre ou étale les écarts. Elle remodèle le pari ; elle ne peut pas le réordonner.

Le curseur de netteté du chapitre 4 était une loupe pédagogique posée sur l’attention. Celui-ci existe tel quel en production : la température de génération.

  1. La tour produith = un vecteur
  2. La table notelogit(mot) = h · E[mot]
  3. La politique choisittoken suivant → retour dans le contexte

Reste le chat. Pourquoi une machine dotée de tous les mécanismes parie-t-elle sur chat après « manger un » ? Parce que les mécanismes seuls ne portent aucune régularité apprise.

Chaque matrice de ce jouet a été écrite pour être lisible, pas pour être juste. La table de comptes du chapitre 1, toute rudimentaire qu’elle était, apprenait au moins de ses données. Notre belle tour n’en a vu aucune.

Une mécanique qui tourne et un bon pari sont deux réussites distinctes.

Repère d’échelle. Ce jouet parie sur 8 noms en 2 dimensions. Un modèle de production peut parier sur environ 100 000 tokens représentés dans des milliers de dimensions.

Ses mots-outils figurent dans le même vocabulaire que le reste. Le chemin que vous venez de tracer demeure ; l’échelle et l’entraînement fournissent bien plus de nombres.

Réfléchissez à ce que la température ne peut pas faire

Point de contrôle

La politique gloutonne choisit « chat » ici à toutes les températures. Pourquoi la température ne peut-elle rien y changer ?

La politique gloutonne choisit « chat » ici à toutes les températures. Pourquoi la température ne peut-elle rien y changer ?

Choisissez d’abord une réponse.

Point de contrôle

Après plusieurs tirages, le premier token sort de la fenêtre de contexte de deux tokens et pâlit à l’écran. Que s’est-il réellement passé ?

Après plusieurs tirages, le premier token sort de la fenêtre de contexte de deux tokens et pâlit à l’écran. Que s’est-il réellement passé ?

Choisissez d’abord une réponse.

Reliez la boucle, puis brisez le charme

La boucle est fermée : texte → tokens → vecteurs → attention → bloc → logits → probabilités → token choisi → retour dans le contexte.

Pourtant, le jouet dit encore « manger un chat ». Tous les mécanismes fonctionnent ; seuls ses nombres sont mauvais. Reste une question, celle de savoir comment obtenir de bons poids.

Déplacer une ligne a corrigé un mot ; un vocabulaire de production en compte environ cent mille. L’entraînement prend le relais au chapitre suivant, pari raté après pari raté, jusqu’à faire basculer la mise vers avocat.

Sources et périmètre
  • Press et Wolf (2017) montrent que partager les poids d’embedding et de dé-embedding - le liage que ce laboratoire rend visible - améliore les modèles de langage.
  • Holtzman et al. (2020) documentent la dégénérescence des décodages glouton et par faisceau et proposent l’échantillonnage par noyau (top-p).
  • Le vocabulaire est constitué des huit lignes fabriquées du chapitre 3 ; les mots-outils du préfixe n’existent que comme données pédagogiques. Aucun nombre ici ne provient d’un modèle entraîné - cet écart est le sujet même du chapitre.
  • Contenu et affirmations relus le 28 juillet 2026.