Dans cette leçon
Le bloc Transformer, l’étage que l’on empile
Un étage complet après les positions : normalisation, attention, MLP et deux additions résiduelles qui préservent un flux continu.
Le parcours
Du texte au chatbot
C’est l’ordre du cours, pas celui d’une passe avant.
I · Du texte aux représentations
II · Dans le Transformer
- 04Attentionétape TransformerPas commencé
- 05Positionsétape TransformerPas commencé
- 06Bloc Transformerétape TransformerPas commencé
III · Prédire et apprendre
IV · Du modèle au chatbot
À la fin, vous saurez
- Tracer un vecteur sensible à la position à travers normalisation, attention, MLP et les deux additions résiduelles.
- Expliquer comment les additions résiduelles préservent un flux continu pendant que chaque sous-couche apporte une correction.
Avant de commencer : L’ordre entre dans la machine
Voici le secret des diagrammes intimidants : une tour Transformer, c’est surtout un même étage, photocopié. L’attention, construite au chapitre 4, en occupe une pièce. L’astuce discrète promise au chapitre 5 s’y joue deux fois.
Observez le flux continu
Partez du flux résiduel : un vecteur par position, déjà chargé de son token et de la marque de place posée au chapitre 5.
RMSNorm remet ce flux à l’échelle, l’attention mélange les informations entre positions, et le mélange retrouve le flux d’origine le temps d’un petit signe +.
Une seconde RMSNorm, puis le MLP (perceptron multicouche), un petit réseau appris qui travaille chaque position séparément, puis un autre +. Deux fois par étage, la même question : que devient tout ce que le flux transporte déjà ?
Prédisez le rôle d’un résidu
Les positions, gagnées au chapitre 5, restent activées. Votre pari porte sur l’étape 8, + résidu = sortie du bloc, le dernier + de l’étage.
Votre pari
Quand le MLP apporte une correction, que devient le flux résiduel entrant ?
Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.
Faites traverser les huit étapes d’un étage à un même mot. À chaque addition résiduelle, vérifiez ce que l’addition a conservé.
Missions en cours
- Suivez le mot du milieu et déclarez la première étape où ses deux traces divergent
1 / 8 · Embedding d’entrée
Ordre original
mangerunavocat
- position
- p2
- vecteur ajouté
- [0,000 ; 0,400]
- Embedding d’entrée
- [-0,680 ; 0,440]
Ordre inversé
avocatunmanger
- position
- p0
- vecteur ajouté
- [0,400 ; 0,000]
- Embedding d’entrée
- [-0,680 ; 0,440]
Mêmes vecteurs à cette étape : les marques de position n’ont encore rien changé à ce que le bloc a lu. Avancez pour trouver où elles commencent à compter.
L’étage complet (ordre original)
| Étape | Vecteur |
|---|---|
| Embedding d’entrée | [-0,680 ; 0,440] |
| + vecteur de position | [-0,680 ; 0,840] |
| RMSNorm (avant attention) | [-0,890 ; 1,099] |
| Mélange d’attention | [-0,143 ; 0,680] |
| + résidu (après l’attention) | [-0,823 ; 1,520] |
| RMSNorm (avant MLP) | [-0,673 ; 1,244] |
| MLP (2 → 3 → 2, ReLU) | [0,000 ; 1,244] |
| + résidu = sortie du bloc | [-0,823 ; 2,764] |
Inspecter les poids d’attention (ordre original)
| Q ↓ / K → | manger | un | avocat |
|---|---|---|---|
| manger | 0,339 | 0,480 | 0,181 |
| un | 0,261 | 0,401 | 0,338 |
| avocat | 0,053 | 0,055 | 0,892 |
Chaque ligne affichée totalise 1,000. Le masque causal du chapitre 4 reste utilisé dans un vrai décodeur ; il est retiré ici pour que l’expérience d’ordre soit exacte.
Manipulez l’étage
Gardez les vecteurs de position activés. Avancez du flux muni de sa position à RMSNorm, puis à l’attention.
À l’étape + résidu, comparez cette ligne à + vecteur de position et à Mélange d’attention avant de décider ce que l’addition a gardé.
Continuez jusqu’à la seconde RMSNorm et au MLP. Ce laboratoire passe de 2 à 3 caractéristiques, applique ReLU, puis revient à 2.
La première coordonnée de sortie du MLP affiche 0,000 parce que ReLU a ramené à zéro les activations cachées qui l’alimentent.
Tout le cérémonial d’un gratte-ciel, joué sur trois nombres cachés.
À l’étape 8, + résidu = sortie du bloc, votre pari se règle : flux entrant plus correction du MLP, rien n’est jeté.
Choisissez maintenant un comme mot suivi, puis avancez étape par étape. Le panneau fait tourner les deux ordres côte à côte, de quoi repérer la première étape où ils divergent.
Un garde la même place dans les deux ordres, si bien que l’écart commence seulement quand une opération lit ses voisins réordonnés.
Quand vous pensez tenir cette étape, cliquez sur C’est ici la première divergence. L’instrument vous dira si vous déclarez trop tôt, trop tard, ou au bon endroit.
Ouvrez Inspecter les poids d’attention si vous souhaitez voir les parts de ce mélange.
Ne désactivez les positions que si vous voulez revoir l’expérience du chapitre 5. L’astuce discrète qu’il promettait est l’idée nouvelle de cet étage : le flux résiduel, un espace de travail continu que chaque sous-couche lit et corrige.
Défi Gardez les positions activées et suivez le mot du milieu, un. L’inversion le laisse au même endroit avec le même vecteur de position. Déclarez la première étape où les deux traces divergent, puis expliquez pourquoi.
Comparez votre réponse
Les traces divergent d’abord à l’attention. Avant elle, un garde le même token, la même position, le même vecteur de position et le même vecteur normalisé.
L’attention lit les autres positions. Inverser la phrase change les clés et les valeurs voisines que un mélange, donc sa correction d’attention change.
Inspectez la matrice d’attention et expliquez pourquoi chaque ligne totalise 1. Le comptable du chapitre 4, le softmax, est toujours de service : il équilibre chaque ligne de scores non masqués à ce total exact.
Expliquez le plan de l’étage
Voici l’étage dans l’ordre, et ce qui justifie chaque pièce :
- Les vecteurs de position donnent à chaque token une information sur sa place. Ils brisent ainsi la symétrie de l’expérience du chapitre 5, non masquée et fondée sur le seul contenu.
- RMSNorm ramène chaque vecteur à une taille standard avant chaque sous-couche, pour que les valeurs ne dérivent pas vers l’immense ou le minuscule à mesure que les étages s’empilent.
- L’attention est la seule étape où les positions échangent de l’information ; vous l’avez construite au chapitre 4.
- Le MLP complète l’attention : il ne regarde jamais les positions voisines. Il applique la même transformation apprise à chaque position, et ses nombres appris représentent souvent une grande part des paramètres d’un bloc dense.
- Les additions résiduelles préservent le vecteur entrant et ajoutent une correction :
sortie = entrée + correction, deux fois par étage. Ce cumul, mis à jour à chaque addition, est le flux résiduel.
Il manque à cet étage un mur, le masque causal du chapitre 4, qui sépare le passé autorisé du futur interdit. Ici, l’ordre ne vient que des marques de place.
Pourquoi photocopier l’étage ? Dans la copie suivante, l’attention lit des vecteurs déjà contextualisés par l’étage précédent, si bien que chaque mélange et chaque transformation locale reprennent les corrections antérieures.
La profondeur permet cette composition. Le flux résiduel offre à chaque bloc un chemin continu vers l’état accumulé.
Les deux étapes qui normalisent et transforment ont des formules exactes, mais vous pouvez traverser l’étage sans elles ; ouvrez le panneau ci-dessous quand la mécanique vous tente.
- Le chapitre 4 a construitl’attention : les tokens se parlent
- Cet étage ajoutepositions · norme · MLP · résidus
- Un modèle complet empileN × cet étage
Le même étage, en formules
Dans la version simplifiée du laboratoire, RMSNorm transforme x en x / √(moyenne(x²)). Sa moyenne quadratique vaut alors 1 et sa direction reste inchangée.
Les implémentations ajoutent aussi un gain appris et un petit terme de stabilisation.
Le MLP du laboratoire calcule W₂ · ReLU(W₁x + b₁) + b₂, avec ReLU(z) = max(0, z). ReLU ramène les activations négatives à zéro.
Ici, le MLP passe de 2 à 3 dimensions, puis revient à 2. Dans les Transformers denses, sa largeur est généralement plusieurs fois supérieure avant la projection de retour.
Un étage pré-normalisé, écrit comme deux mises à jour du flux résiduel h :
h ← h + Attention(RMSNorm(h))
h ← h + MLP(RMSNorm(h))
Ce laboratoire ajoute des vecteurs de position construits à la main. D’autres modèles apprennent un encodage ou font tourner Q et K selon la position avec RoPE. Ces méthodes injectent l’ordre par des opérations différentes.
L’attention déplace l’information entre positions ; le MLP transforme chaque position séparément. Ils alternent de bloc en bloc.
Un décodeur laisse normalement debout le mur du masque causal. Ce laboratoire le retire pour préserver l’expérience non masquée du chapitre 5.
Réfléchissez à ce que le flux conserve
Point de contrôle
Pourquoi les deux sous-couches utilisent-elles des additions résiduelles ?
Choisissez d’abord une réponse.
Point de contrôle
Pourquoi empiler de nombreux étages identiques apporte-t-il plus qu’un seul étage ?
Choisissez d’abord une réponse.
Reliez l’étage à la tour
Le vecteur a traversé un bloc complet : deux normalisations, l’attention, un MLP et deux additions résiduelles. Le modèle photocopie cet étage N fois et laisse un vecteur au sommet de la tour.
Ce vecteur n’est encore qu’une suite de nombres, deux dans ce laboratoire. Comment la tour en fait-elle un pari sur tout le vocabulaire ? La leçon suivante place cette mise.
Sources et périmètre
- Vaswani et al. (2017) définissent le bloc Transformer : attention plus réseau feed-forward par position, connexions résiduelles et normalisation.
- Zhang et Sennrich (2019) introduisent RMSNorm, la normalisation sans recentrage utilisée dans ce laboratoire et dans de nombreux modèles récents.
- Su et al. (2021) présentent les positions rotatives (RoPE), l’alternative de production aux vecteurs additifs montrés ici.
- L’étage est un bloc 2D fabriqué à la main avec un MLP à 3 unités ; l’attention y tourne sans masque pour que l’expérience de permutation soit exacte.
- Contenu et affirmations relus le 28 juillet 2026.