Dans cette leçon
Le bloc Transformer, l’étage que l’on empile
Dans le modèle
Du texte au token suivant
Un étage complet : positions, normalisation, attention, MLP et flux résiduel - avec une expérience exacte sur ce que le bloc fait de l’ordre des mots.
À la fin, vous saurez
- Tracer un vecteur à travers positions, normalisation, attention, MLP et les deux additions résiduelles.
- Expliquer pourquoi un Transformer a besoin d’une information de position.
Avant de commencer : L’attention, le moment où les tokens se parlent
Le chien mord l’homme. L’homme mord le chien. Mêmes mots, mais un seul des deux fait la une. Rappelez-vous maintenant ce que vous avez construit au chapitre 4 : l’attention compare des requêtes et des clés par produits scalaires, et rien - littéralement rien - dans un produit scalaire ne sait où se trouve un token. Que fait donc de l’ordre des mots le mécanisme qui fait parler les tokens ? Avant de l’empiler dans un vrai modèle, la question mérite une réponse exacte - et, si la réponse vous inquiète, un correctif.
Observez l’angle mort de la machine
Un Transformer est une tour d’étages identiques, et ce chapitre parcourt un étage entier : ajouter les vecteurs de position, normaliser, faire jouer l’attention, réinjecter le résultat, normaliser encore, transformer chaque token par un petit réseau, réinjecter à nouveau. L’instrument ci-dessous fait passer le même mot par le même étage deux fois - dans l’ordre original, puis dans l’ordre inversé. Toute différence entre les deux passages ne peut venir que de l’ordre.
Prédisez l’effet du mélange
Laissez les vecteurs de position désactivés. Le token suivi, avocat, termine « manger un avocat » et ouvre la phrase inversée.
Votre pari
Positions désactivées : que fait l’inversion de l’ordre à la sortie du bloc pour avocat ?
Personne ne corrige. Engagez-vous, l’instrument tranchera.
Le même mot traverse le même bloc dans deux ordres de phrase. Activez ou non les vecteurs de position, et mesurez ce que le bloc voit - ou pas.
Ordre original
mangerunavocat
- position
- p2
- vecteur ajouté
- aucun
- sortie du bloc
- [-1.197, 1.385]
Ordre inversé
avocatunmanger
- position
- p0
- vecteur ajouté
- aucun
- sortie du bloc
- [-1.197, 1.385]
Sorties identiques : sans positions, le bloc traite la phrase comme un sac de mots.
Inspecter l’étage complet (ordre original)
| Étape | Vecteur |
|---|---|
| Embedding d’entrée | [-0.680, 0.440] |
| + vecteur de position | [-0.680, 0.440] |
| RMSNorm (avant attention) | [-1.187, 0.768] |
| Mélange d’attention | [-0.517, 0.243] |
| + résidu (flux + attention) | [-1.197, 0.683] |
| RMSNorm (avant MLP) | [-1.228, 0.701] |
| MLP (2 → 3 → 2, ReLU) | [0.000, 0.701] |
| + résidu = sortie du bloc | [-1.197, 1.385] |
| Q ↓ / K → | manger | un | avocat |
|---|---|---|---|
| manger | 0.482 | 0.482 | 0.036 |
| un | 0.482 | 0.482 | 0.036 |
| avocat | 0.065 | 0.065 | 0.871 |
Chaque ligne totalise 1. Le masque causal du chapitre 4 reste utilisé dans un vrai décodeur ; il est retiré ici pour que l’expérience d’ordre soit exacte.
Manipulez l’étage
Si vous avez parié « identique », vous venez de vérifier ce que la plupart des explications passent sous silence : l’étage entier - attention, normalisation, MLP, résidus - est équivariant par permutation. Mélangez la phrase : la sortie de chaque mot le suit, inchangée jusqu’à la dernière décimale.
Activez maintenant les vecteurs de position. Chaque place ajoute son petit vecteur (p0, p1, p2) au token qui l’occupe, avant toute autre opération. Les deux passages divergent aussitôt : l’ordre est entré dans le calcul sous forme de géométrie. Ouvrez l’inspecteur et suivez les huit étapes ; remarquez la sortie du MLP pour la cible - sa première coordonnée vaut exactement 0.000, coupée par la ReLU, la porte max(0, z) définie plus bas : petite cicatrice honnête de la façon dont ces réseaux calculent.
Défi Deux missions. Un : positions activées, suivez le mot du milieu, un. Inverser une phrase de trois mots laisse le milieu en place : il reçoit le même vecteur de position dans les deux passages - et pourtant sa sortie change. Expliquez par où la différence s’infiltre. Deux : dans la matrice des poids, chaque ligne totalise exactement 1. Dites quel ingrédient du chapitre 4 le garantit.
Expliquez le plan de l’étage
Voici l’étage dans l’ordre, et ce qui justifie chaque pièce :
- Les vecteurs de position impriment « tu es en place 2 » dans la géométrie du token, car rien en aval ne peut voir l’ordre autrement.
- RMSNorm ramène chaque vecteur à une taille standard avant chaque sous-couche - après des dizaines d’étages, des valeurs libres dériveraient vers l’immense ou le minuscule. Elle remet à l’échelle sans recentrer : la direction survit.
- L’attention est la seule étape où les positions échangent de l’information ; vous l’avez construite au chapitre 4.
- Le MLP (un petit perceptron multicouche) est son complément : il ne regarde jamais de côté. Chaque token, seul, est dilaté (2 → 3 ici), passé par une ReLU qui ne garde que les indices positifs, puis recontracté (3 → 2). Les vrais modèles dilatent environ quatre fois, sur des milliers de dimensions.
- Les additions résiduelles sont le coup de maître discret. Le bloc ne remplace pas le vecteur du token ; il l’amende :
sortie = entrée + correction, deux fois par étage. Ce total courant s’appelle le flux résiduel, et c’est lui qui permet d’empiler des dizaines d’étages sans dissoudre le signal.
- Le chapitre 4 a construitl’attention : les tokens se parlent
- Cet étage ajoutepositions · norme · MLP · résidus
- Un vrai modèle empileN × cet étage
Le même étage, en formules
RMSNorm ramène un vecteur x à x / √(moyenne(x²)) : sa moyenne quadratique devient 1, sa direction est préservée (les vrais modèles multiplient ensuite par un petit gain appris).
Le MLP calcule W₂ · ReLU(W₁x + b₁) + b₂, avec ReLU(z) = max(0, z).
Un étage pré-normalisé, écrit comme des amendements au flux résiduel h :
h ← h + Attention(RMSNorm(h))
h ← h + MLP(RMSNorm(h))
Ce laboratoire ajoute des vecteurs de position écrits à la main. Les modèles de production apprennent leurs encodages de position ou font tourner Q et K selon la position (RoPE) ; la raison d’être est la même.
Aucune pièce n’est « l’endroit où le modèle pense ». L’attention déplace l’information entre les positions ; le MLP la transforme sur place ; ils alternent, étage après étage. Et un vrai décodeur garde le masque causal du chapitre 4 dans chaque étage - ce laboratoire le retire uniquement pour que l’expérience d’ordre soit mathématiquement exacte.
Réfléchissez au sac de mots
Point de contrôle
Positions désactivées (et sans masque), inverser la phrase laisse la sortie de chaque mot inchangée. Pourquoi ?
Reliez l’étage à la tour
La trace du cours vient de franchir un étage complet : la cible est entrée avec la ligne du chapitre 3, [−0,68 ; 0,44], et en ressort grandie, remodelée par ses voisins, les positions et le MLP. Un vrai modèle répète cet étage des dizaines de fois, avec plusieurs têtes d’attention par étage, avant de dire quoi que ce soit à voix haute. Reste la dernière question mécanique : au sommet de la tour, il y a un vecteur - et le lecteur attend un mot. Transformer ce vecteur en pari sur tout le vocabulaire, puis en token choisi, c’est le prochain chapitre.
Sources et périmètre
- Vaswani et al. (2017) définissent le bloc Transformer : attention plus réseau feed-forward par position, connexions résiduelles et normalisation.
- Zhang et Sennrich (2019) introduisent RMSNorm, la normalisation sans recentrage utilisée dans ce laboratoire et dans de nombreux modèles récents.
- Su et al. (2021) présentent les positions rotatives (RoPE), l’alternative de production aux vecteurs additifs montrés ici.
- L’étage est un bloc 2D fabriqué à la main avec un MLP à 3 unités ; l’attention y tourne sans masque pour que l’expérience de permutation soit exacte.
- Contenu et affirmations relus le 18 juillet 2026.