Dans cette leçon
L’entraînement, la machine qui corrige ses nombres
Perte, gradient, petit pas, recommencer. Libérez deux nombres, regardez la descente de gradient déplacer une ligne de la carte et voyez basculer le pari absurde du chapitre 7.
Le parcours
Du texte au chatbot
C’est l’ordre du cours, pas celui d’une passe avant.
I · Du texte aux représentations
II · Dans le Transformer
III · Prédire et apprendre
- 07GénérationdécodagePas commencé
- 08Entraînementconstruit les poidsPas commencé
- 09Passage à l’échellepasser à l’échellePas commencé
- 10Assistantchange les poidsPas commencé
IV · Du modèle au chatbot
À la fin, vous saurez
- Expliquer l’entraînement comme une mesure de perte, un calcul de gradient et de petites mises à jour répétées.
- Expliquer pourquoi la géométrie apprise sert la prédiction plutôt que l’intuition humaine.
- Comparer comptage exact, comptage avec repli et représentation neuronale partagée sur un contexte inédit.
Avant de commencer : Logits, température et le token qui sort
Personne n’a écrit les nombres d’un vrai modèle de langage. Les auteurs choisissent la structure ; l’entraînement fixe les valeurs. Au chapitre 7, notre chère tour bâtie à la main pariait 46 % sur chat après « manger un ».
Une mise à jour calculée peut-elle réparer ce pari ?
La boucle tient en trois gestes : mesurer l’erreur avec une perte, calculer le gradient, puis mettre les paramètres à jour. Recommencer.
Observez ce qui a le droit de bouger
Un paramètre est un nombre ajustable. Pour rendre la mise à jour visible, ce laboratoire gèle la tour et n’en libère que deux : les coordonnées de la ligne d’avocat dans la table d’embeddings.
Le vecteur de contexte h de « manger un » reste fixe. La perte met un prix sur le pari, le gradient pointe vers la montée, la mise à jour part dans l’autre sens : une traction sur la ligne. Tout tiendra à la force de cette traction.
Prédisez la forme de l’apprentissage
La perte démarre à 6,8 - le prix d’avoir donné environ 0,1 % de chances à la bonne réponse.
Votre pari
Au taux d’apprentissage 0,1, à quoi ressemblera la courbe de perte pendant l’entraînement ?
Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.
Toute la tour est gelée sauf deux nombres : la ligne d’avocat dans la table du chapitre 3. Regardez la descente de gradient la traîner.
Le pari du modèle
| Mot | Part |
|---|---|
| chat | 46,1 % |
| chien | 31,8 % |
| reine | 11,0 % |
- Perte −log p(cible)
- 6,819
- p(cible)
- 0,1 %
Le modèle parie encore de travers. Continuez à entraîner.
Courbe de perte
La carte, pendant l’entraînement
Sept lignes restent fixes ; la ligne d’avocat (en orange) est traînée pas à pas. Le trait montre son trajet.
cos(avocat, chat) -0,272
Promesse du chapitre 1
Laboratoire de généralisation
Même corpus d’entraînement, nouveau contexte. Les trois méthodes doivent parier sur « éplucher un », une ligne qu’aucune n’a vue.
Corpus visible
manger un → avocat × 6dessiner un → pomme × 3repérer un → chien × 2conduire une → voiture × 4monter le → vélo × 4caresser le → chat × 3
Test gardé à part
éplucher un → avocat ?jamais montré pendant l’entraînementComptage exact
Cherche toute la ligne.
Aucune ligne. Aucun pari.Comptage avec repli
Oublie le premier mot et compte après « un ».
- p(avocat)
- 54,5 %
- rang
- #1
- exemples utilisés
- 11
Petit réseau
Partage une carte 2D entre les contextes.
- p(avocat)
- 96,5 %
- rang
- #1
- exemples utilisés
- 22
Le comptage exact n’a pas de ligne. Le repli récupère un indice faible. Proche de « manger », la représentation partagée place avocat au premier rang.
Missions en cours
- Faire basculer le pari vers avocat
- Faire perdre au transfert son indice utile
Calcul réel, carte 2D fabriquée. Le classifieur apprend ses poids sur 22 exemples visibles. Les représentations d’un vrai modèle sont aussi apprises, dans bien plus de dimensions.
Inspecter le gradient
| Vecteur de contexte h (gelé) | [3,661 ; 1,974] |
|---|---|
| Force de traction (1 − p) | 0,999 |
| Gradient actuel | [-3,657 ; -1,972] |
| Ligne d’avocat actuelle | [-0,680 ; 0,440] |
gradient = −(1 − p(cible)) × h ; mise à jour : ligne ← ligne − pas × gradient
Manipulez la descente
Lancez dix pas d’entraînement au taux 0,1, puis lisez la courbe : cela tranche votre pari. Regardez la perte baisser, p(avocat) monter et la ligne se déplacer.
Le même gradient calculé pilote les trois affichages. En quelques pas, la prédiction en tête bascule ; guettez le pas exact.
Réinitialisez, puis comparez les trajets calculés. Le taux 0,01 demande 38 pas pour franchir le seuil du laboratoire ; le taux 1 le franchit en un seul.
Sur ces trois essais, une règle se dégage. Plus le pas est grand, plus tôt le seuil tombe.
Le taux 5 va compliquer cette règle, et autant le savoir avant de cliquer. Ce trajet est dessiné à la main ; il ne sort pas du calcul de gradient à deux paramètres.
Sélectionnez-le et prenez la courbe oscillante pour ce qu’elle est, une illustration. Un pas trop grand pour son paysage peut dépasser le fond au lieu de s’y poser.
Vous pouvez aussi passer à Battre l’optimiseur et déplacer la ligne vous-même. Quelques coups joués à la main rendent la direction calculée tangible ; ils n’ajoutent rien à la preuve.
Défi
Après le basculement de la prédiction, continuez l’entraînement et observez la force de traction (1 − p) dans l’inspecteur. Expliquez pourquoi les mises à jour diminuent quand le modèle donne plus de probabilité à la cible.
Comparez votre réponse
La norme du gradient contient (1 − p). Quand la cible reçoit peu de probabilité, ce facteur est grand. Lorsque p approche de 1, le facteur approche de 0.
Avec un taux et un vecteur de contexte fixes, ce facteur décroissant réduit chaque mise à jour suivante.
Inspectez la carte finale. La ligne d’avocat finit près de chat et quitte les fruits. Expliquez quel objectif l’a déplacée et pourquoi les catégories humaines n’ont pas contraint ce mouvement.
Expliquez la boucle en trois gestes
Pour cette cible, l’entropie croisée vaut −log p(cible). Elle approche de zéro quand la probabilité de la cible approche de 1 et croît sans limite quand cette probabilité approche de 0.
Attribuer 0,1 % à la cible coûte environ 6,9 ; lui attribuer 90 % coûte environ 0,1. Se tromper avec aplomb se paie donc au prix fort.
Sur beaucoup de paris, et dans le cas idéal, cette perte récompense des cotes honnêtes, dites calibrées : un 70 % annoncé se réalise 70 % du temps.
Qu’un modèle réel mérite ce qualificatif reste une autre question, que cette trace ne tranche pas.
Le gradient de la ligne cible, tous les autres nombres étant figés, tient dans une formule qui mérite d’être lue à voix haute :
gradient = −(1 − p(cible)) × h
Pause maths : le gradient comme flèche de pente
Un gradient pointe vers l’augmentation la plus rapide de la perte. La descente de gradient le soustrait, et la mise à jour descend donc la pente.
Ici, le signe déplace la ligne cible vers h. Le facteur (1 − p) rend la traction forte après une surprise et faible après une réussite confiante.
La traction a donc une direction et une force. Ici, elle tire la ligne cible vers le vecteur de contexte, à proportion de (1 − p) et du taux. Un modèle surpris tire fort ; un modèle confiant tire à peine.
La mise à jour est ligne ← ligne − taux × gradient. Recalculer la perte et le gradient après chaque mise à jour produit la courbe observée.
- Mesurerperte = −log p(avocat)
- Dérivergradient = −(1 − p) × h
- Avancer, recommencerligne ← ligne − pas × gradient
Une étape d’entraînement complète passe par la rétropropagation, la règle de dérivation en chaîne remontée à travers le réseau. Il en sort un gradient pour chaque paramètre entraînable, mesuré sur un lot d’exemples.
Un optimiseur transforme ensuite ces gradients en mises à jour.
La formule à deux paramètres ne vaut que pour cet étage de sortie figé. La boucle générale demeure : mesurer la perte d’un lot, rétropropager ses gradients, mettre à jour, puis recommencer.
Ici, optimiser un seul contexte déplace avocat près de chat, et leur cosinus passe de −0,27 à 0,998. La ligne quitte les fruits, car la perte récompense la prédiction, pas une taxonomie humaine.
À grande échelle, de nombreux exemples tirent sur les mêmes lignes à la fois, et la géométrie qui survit est le compromis qui fait baisser la perte. Vous n’avez regardé ici qu’une seule traction, délibérément isolée.
Cette perte à deux paramètres n’a pas de minimum fini dans sa direction d’amélioration, si bien que son trajet calculé ne dépasse pas la cible. L’oscillation au taux 5 est dessinée, comme annoncé avant le réglage.
Des mises à jour trop grandes peuvent déstabiliser l’entraînement d’un réseau. Cette affirmation générale vient des travaux d’optimisation ; ce laboratoire ne fait que l’emprunter.
Vérification ciblée du transfert.
Le panneau inférieur passe à « éplucher un », un contexte tenu à l’écart de l’entraînement. Les trois méthodes reçoivent les mêmes 22 paires (contexte, token suivant), et aucune ne contient celui-là.
En français, on épluche un avocat comme on épluche un dossier ; le jouet, lui, n’a épluché ni l’un ni l’autre.
Le comptage exact ne trouve aucune ligne pour ce contexte : il revient les mains vides. Le repli abandonne éplucher et donne à avocat 6 occurrences sur 11, assez pour la première place mais avec un indice faible.
Aucun ne partage une représentation apprise.
Le jouet neuronal place éplucher près de manger. Les poids partagés réutilisent « manger un → avocat » et donnent plus de 90 % à avocat, bien davantage que le repli.
Éloignez éplucher de manger. Les poids restent fixes, mais la prédiction change. Dans ce jouet, la géométrie des représentations détermine quels contextes peuvent partager des indices.
La démonstration a un périmètre précis : des représentations partagées laissent les vecteurs voisins se prêter des indices. Rien ne dit ici que les voisins méritent cette confiance, et le softmax ne le vérifiera pas pour eux.
Réfléchissez à ce qu’exige la généralisation
Point de contrôle
Le repli et le jouet neuronal classent tous deux avocat premier pour « éplucher un ». Pourquoi la probabilité du jouet est-elle bien plus forte ?
Choisissez d’abord une réponse.
Point de contrôle
Après l’entraînement, la ligne d’avocat se retrouve juste à côté de chat, loin des fruits qu’elle côtoyait. Que révèle cela sur l’origine de la forme de la carte apprise ?
Choisissez d’abord une réponse.
Reliez la machine réparée aux modèles complets
Le jouet classe désormais avocat premier après « manger un ». Le pari du chapitre 7 est réglé : la perte a mis un prix sur l’erreur, le gradient a choisi la direction, de petits pas répétés ont fait le reste.
À l’échelle d’un modèle, les trois mêmes gestes s’appliquent à des milliards de paramètres à la fois, et aucun n’est gratuit.
La leçon suivante explore comment grandissent ensemble les tokens, le calcul et les paramètres, et à combien s’élève la facture.
Sources et périmètre
- Rumelhart, Hinton et Williams (1986) décrivent la rétropropagation et son usage pour ajuster les poids d’un réseau.
- Bengio, Ducharme, Vincent et Jauvin (2003) entraînent conjointement des représentations distribuées et un modèle probabiliste du mot suivant.
- Ce laboratoire dérive deux paramètres libres analytiquement ; aucune rétropropagation à travers la tour n’est effectuée, et le comportement des taux dans cette cuvette convexe ne se généralise pas aux paysages de perte de modèles complets.
- Contenu et affirmations relus le 28 juillet 2026.