Verbatome / Chapitre 08III · Prédire et apprendre14-18 min de lecture · ~30 min de manipulation

Dans cette leçon

L’entraînement, la machine qui corrige ses nombres

Perte, gradient, petit pas, recommencer. Libérez exactement deux nombres, regardez la descente de gradient traîner une ligne de la carte, et voyez basculer le pari absurde du chapitre 7.

À la fin, vous saurez

  • Expliquer l’entraînement comme une mesure de perte, un calcul de gradient et de petites mises à jour répétées.
  • Expliquer pourquoi la géométrie apprise sert la prédiction plutôt que l’intuition humaine.
  • Comparer comptage exact, comptage avec repli et représentation neuronale partagée sur un contexte inédit.

Avant de commencer : Logits, température et le token qui sort

Personne n’a écrit les nombres d’un vrai modèle de langage. Ni la table d’embeddings, ni les projections Q, K, V, ni le MLP - pas un seul des milliards. Le chapitre 7 s’est terminé sur la preuve que cela compte : notre tour soigneusement fabriquée à la main, devant « manger un », pariait 46 % sur chat. Ce chapitre montre le mécanisme qui écrit les nombres : mesurer à quel point on se trompe, calculer la direction qui trompe moins, faire un petit pas, recommencer. À la fin, le même pari se pose sur avocat - et vous aurez regardé chaque étape de la réparation.

Observez ce qui a le droit de bouger

Un paramètre, c’est un nombre ajustable dans la machine : le jouet en compte des dizaines, les vrais modèles des milliards. Le véritable entraînement les ajuste tous à la fois, ce qui est impossible à regarder. Ce laboratoire gèle donc la tour entière et libère exactement deux nombres : les coordonnées de la ligne d’avocat dans la table du chapitre 3 - celle-là même que vous traîniez à la main. Le vecteur de contexte h de « manger un » reste fixe ; la seule question est de savoir où la machine traînera cette ligne, et elle y répond avec trois gestes : une perte qui note le pari actuel, un gradient qui pointe vers le haut, et un petit pas dans l’autre sens.

Prédisez la forme de l’apprentissage

La perte démarre à 6,8 - le prix d’avoir donné 0,1 % de chances à la bonne réponse.

Votre pari

Au taux d’apprentissage 0,1, à quoi ressemblera la courbe de perte pendant l’entraînement ?

Personne ne corrige. Engagez-vous, l’instrument tranchera.

Observatoire d’entraînement / deux nombres libres

Toute la tour est gelée sauf deux nombres : la ligne d’avocat dans la table du chapitre 3. Regardez la descente de gradient la traîner.

Mode
Taux d’apprentissage
pas 0 / 60

Le pari du modèle

MotPart
chat46,1 %
chien31,8 %
reine11,0 %
Perte −log p(cible)
6.819
p(cible)
0,1 %

Le modèle parie encore de travers. Continuez à entraîner.

Courbe de perte

Lancez un pas pour tracer la courbe de perte.

La carte, pendant l’entraînement

chatchienroireinepommevoiturevéloavocat · #901

Sept lignes restent fixes ; la ligne d’avocat (en orange) est traînée pas à pas. Le trait montre son trajet.

cos(avocat, chat) -0.272

Promesse du chapitre 1

Laboratoire de généralisation

Même corpus d’entraînement, nouveau contexte. Les trois méthodes doivent parier sur « éplucher un », une ligne qu’aucune n’a vue.

Corpus visible

  • manger un → avocat × 6
  • dessiner un → pomme × 3
  • repérer un → chien × 2
  • conduire une → voiture × 4
  • monter un → vélo × 4
  • caresser un → chat × 3

Test gardé à part

éplucher un → avocat ?jamais montré pendant l’entraînement

Comptage exact

Cherche toute la ligne.

Aucune ligne. Aucun pari.

Comptage avec repli

Oublie le premier mot et compte après « un ».

p(avocat)
54,5 %
rang
#1
exemples utilisés
11

Petit réseau

Partage une carte 2D entre les contextes.

p(avocat)
96,5 %
rang
#1
exemples utilisés
22

Le comptage exact n’a pas de ligne. Le repli récupère un indice faible. Proche de « manger », la représentation partagée place avocat au premier rang.

Missions en cours

  • Faire basculer le pari vers avocat
  • Faire perdre au transfert son indice utile

Calcul réel, carte 2D fabriquée. Le classifieur softmax apprend ses poids par descente de gradient sur les 22 exemples visibles. Une vraie représentation est elle aussi apprise, mais dans des milliers de dimensions.

Inspecter le gradient
Vecteur de contexte h (gelé)[3.661, 1.974]
Force de traction (1 − p)0.999
Gradient actuel[-3.657, -1.972]
Ligne d’avocat actuelle[-0.680, 0.440]

gradient = −(1 − p(cible)) × h ; mise à jour : ligne ← ligne − pas × gradient

La moitié basse tient la promesse du chapitre 1 avec un contexte délibérément gardé hors de l’entraînement : « éplucher un ». Les trois méthodes ont vu les mêmes 22 exemples contexte-token suivant, et aucun ne contenait « éplucher un » - un mot que même le corpus du chapitre 1 n’avait jamais présenté. Le comptage exact reste muet, faute de ligne pour la phrase entière. Un compteur réparé, appelé repli, abandonne éplucher et retombe sur les statistiques plus faibles après un seul. Le petit modèle neuronal fait ce qu’aucun des deux ne peut faire : le vecteur fabriqué d’éplucher se trouve près de manger, donc tout ce qui a été appris avec « manger un → avocat » traverse les mêmes poids jusqu’au nouveau contexte. Une fonction, réutilisée entre représentations voisines - voilà ce que le comptage exact n’a jamais eu.

Éloignez éplucher de manger. Les poids du réseau ne changent pas, mais sa prédiction, si. Ce geste montre à la fois le biais utile et son risque : la géométrie des représentations décide quels exemples peuvent prêter leurs indices à quels nouveaux contextes.

Manipulez la descente

Entraînez pas à pas et regardez trois affichages bouger ensemble : la perte tombe, p(avocat) grimpe, et sur la carte, la ligne d’avocat glisse physiquement - la descente de gradient est un glisser-déposer exécuté par le calcul différentiel. Le taux 0,1 est la courbe qui faisait l’objet de votre pari : entraînez-y dix pas et l’observatoire estampille votre pari confirmé ou contredit face à la forme qu’elle a vraiment tracée. Le pari bascule au pas 4. Réinitialisez au taux 0,01 : même destination, trente-huit pas de reptation. Le taux 1 traverse d’une seule enjambée. Pour ces trois taux, plus grand veut simplement dire plus vite.

Poussez ensuite l’enjambée au taux 5 et regardez-la casser. Le pas est si démesuré qu’il saute par-dessus le fond, atterrit sur la paroi d’en face et rebondit - la perte scie de haut en bas, le pari clignote, et rien ne se stabilise jamais. C’est la leçon une enjambée trop grande dépasse la cible. Lisez-la comme une illustration, pas comme le vrai gradient de ce laboratoire : notre cuvette à deux paramètres a un fond qui file vers l’infini, donc la vraie descente ne peut jamais dépasser ici. L’oscillation est dessinée à la main pour vous montrer l’échec qui ne mord qu’à grande échelle - l’aparté ci-dessous dit pourquoi.

Un dernier mode : passez de Regarder descendre à Battre l’optimiseur. C’est vous qui saisissez la ligne d’avocat et la traînez à la main, en chassant la perte la plus basse. Puis lâchez la descente de gradient et courez votre trajet contre le sien. Égalez sa perte finale sans le calcul différentiel et la mission est à vous - la preuve, sentie du bout des doigts, de tout le travail que le gradient faisait pour vous.

Défi Trois missions. Un : après le basculement, continuez d’entraîner et surveillez la force de traction (1 − p) dans l’inspecteur. Expliquez pourquoi l’entraînement se freine tout seul à mesure que le modèle réussit. Deux : regardez où la ligne d’avocat finit sur la carte - juste à côté de chat. Vérifiez les voisins qu’elle a quittés. Quelque chose de la carte du chapitre 3 a été sacrifié en silence ; nommez-le. Trois : passez en Battre l’optimiseur, traînez avocat à la main jusqu’à ce que votre meilleure perte égale ou batte celle qu’atteint la descente de gradient, puis faites Copier le lien et partagez l’état de votre victoire à la main.

Comparez votre réponse

Un : la traction est proportionnelle à (1 − p), la part de probabilité qui manque encore à la vérité. À mesure que p grimpe vers 1, cette part fond vers 0, donc chaque pas pousse moins et le modèle se freine tout seul à mesure qu’il réussit le pari. Deux : avocat a été traîné dans le coin de chat pour gagner ce seul contexte, et il a abandonné au passage les voisins qui lui donnaient son sens au chapitre 3, pomme et les autres fruits. La géométrie honnête de la carte a été sacrifiée à une seule prédiction : c’est du surapprentissage en miniature.

Expliquez la boucle en trois gestes

La perte est l’entropie croisée : −log p(cible). Lisez cette expression comme un compteur de surprise, pas comme un examen d’algèbre : elle reste proche de zéro quand la vérité a reçu une grosse part et explose quand cette part s’approche de zéro. Elle est brutale envers les erreurs sûres d’elles - parier 0,1 % sur la vérité coûte environ 7 ; parier 90 % coûte 0,1 - et c’est exactement la pression qui force un modèle à se calibrer : à aligner sa confiance affichée sur sa fréquence de réussite réelle - du moins pendant le préentraînement, car le post-entraînement qui vient ensuite peut dérégler cette calibration.

Le gradient, pour cette tête softmax, a une forme fermée qui mérite d’être lue à voix haute :

gradient = −(1 − p(cible)) × h

Pause maths : le gradient comme flèche de pente

Vous n’avez pas besoin de dériver la formule pour la lire. Un gradient est une flèche vers l’augmentation la plus rapide de la perte. L’entraînement soustrait cette flèche et descend donc la pente. Ici, le signe moins dirige la ligne cible vers h, tandis que (1 − p) règle la traction : forte après une surprise, faible après une réussite assurée.

Tirer la ligne de la cible vers le vecteur de contexte, avec une force proportionnelle à la surprise. Quand p(cible) est minuscule, la traction est féroce ; à mesure que le modèle réussit, elle s’éteint. L’entraînement s’auto-éteint - la première mission du défi le montre en direct. Et la mise à jour tient en une ligne, tout le rituel de l’IA moderne : ligne ← ligne − pas × gradient.

  1. Mesurerperte = −log p(avocat)
  2. Dérivergradient = −(1 − p) × h
  3. Avancer, recommencerligne ← ligne − pas × gradient

Agrandissez maintenant l’image honnêtement. Un vrai modèle calcule ce même gradient pour chaque paramètre en même temps - lignes d’embeddings, Q, K, V, poids du MLP, tous - grâce à la rétropropagation, qui n’est que la règle de dérivation en chaîne appliquée à toute la tour. Il le fait sur des milliards de phrases, pas sur une.

Ces phrases proviennent de jeux d’entraînement assemblés à partir de sources comme des pages web publiques, des livres, du code, des collections sous licence et des exemples écrits par des humains ; le mélange exact dépend du modèle. L’entraînement transforme la pression statistique de ces matériaux en poids, avec leurs motifs utiles mais aussi les lacunes et biais des données comme de leur sélection.

Et votre seconde mission a trouvé le prix de notre raccourci : pour gagner un seul pari, la machine a traîné avocat dans le voisinage de chat - leur cosinus est passé de −0,27 à 0,998. La carte sert désormais la prédiction et horrifierait un lexicographe. C’est la leçon la plus profonde de ce jouet : la géométrie apprise obéit à la perte, pas à la taxonomie humaine. Les vrais modèles équilibrent des milliards de phrases, alors leur géométrie finit utile pour d’innombrables paris à la fois - mais elle obéit au même maître.

Ce que la cuvette ne peut pas montrer. Deux paramètres libres forment une cuvette convexe dont le fond file vers l’infini, donc le vrai gradient n’y dépasse jamais - le trajet au taux 5 que vous avez vu osciller est dessiné à la main, pas la vraie descente de ce laboratoire. Le paysage de perte d’un modèle à milliards de paramètres n’a rien d’une cuvette, et là les pas trop grands détruisent réellement des entraînements - cette affirmation repose sur la littérature d’optimisation, pas sur ce laboratoire. Et rappelez-vous : l’entraînement n’a inséré ni fait ni compréhension. Il a fait baisser un nombre. La grammaire, le calcul, le « savoir » et les biais des données entrent tous dans un vrai modèle par la même porte : tout ce qui aide ce nombre à baisser.

Réfléchissez à ce qu’exige la généralisation

Point de contrôle

Les trois méthodes ont reçu le même corpus et aucune n’a vu « éplucher un ». Pourquoi seul le jouet neuronal classe-t-il avocat premier ?

Les trois méthodes ont reçu le même corpus et aucune n’a vu « éplucher un ». Pourquoi seul le jouet neuronal classe-t-il avocat premier ?

Point de contrôle

Après l’entraînement, la ligne d’avocat se retrouve juste à côté de chat, loin des fruits qu’elle voisinait. Que révèle cela sur l’origine de la forme de la carte apprise ?

Après l’entraînement, la ligne d’avocat se retrouve juste à côté de chat, loin des fruits qu’elle voisinait. Que révèle cela sur l’origine de la forme de la carte apprise ?

Reliez la machine réparée aux vraies

Le jouet complète désormais « manger un » par avocat. Chaque étape interne du modèle est construite, et le seul mystère que laissait le chapitre 7 - d’où viennent les bons nombres - est devenu un mécanisme lui aussi : l’erreur, mesurée ; la direction, calculée ; les pas, répétés. Portez cela à des milliards de paramètres et à des océans de texte, et vous obtenez ce que les praticiens appellent un modèle de base : un magnifique continuateur de texte, et rien d’autre. Il complète ; il n’est pas explicitement optimisé pour répondre, refuser ou suivre fidèlement des consignes. Les quatre dernières leçons tracent la distance qui reste entre ce continuateur brut et le chatbot que vous utilisez.

Sources et périmètre
  • Rumelhart, Hinton et Williams (1986) introduisent la rétropropagation - la machinerie de dérivation en chaîne qui calcule ces mêmes gradients à travers toutes les couches d’un vrai réseau.
  • Bengio, Ducharme, Vincent et Jauvin (2003) entraînent des lignes d’embeddings exactement ainsi - par descente de gradient sur l’entropie croisée du token suivant - à l’échelle réelle.
  • Ce laboratoire dérive deux paramètres libres analytiquement ; aucune rétropropagation à travers la tour n’est effectuée, et le comportement des taux dans cette cuvette convexe ne se généralise pas aux vrais paysages de perte.
  • Contenu et affirmations relus le 18 juillet 2026.