Chapitre 06II · Dans le Transformer9 min de lecture · ~15 min de manipulation

II · Dans le Transformer

Dans cette leçon

Le bloc Transformer, l’étage que l’on empile

Un étage complet après les positions : normalisation, attention, MLP et deux additions résiduelles qui préservent un flux continu.

À la fin, vous saurez

  • Tracer un vecteur sensible à la position à travers normalisation, attention, MLP et les deux additions résiduelles.
  • Expliquer comment les additions résiduelles préservent un flux continu pendant que chaque sous-couche apporte une correction.

Avant de commencer : L’ordre entre dans la machine

Voici le secret des diagrammes intimidants : une tour Transformer, c’est surtout un même étage, photocopié. L’attention, construite au chapitre 4, en occupe une pièce. L’astuce discrète promise au chapitre 5 s’y joue deux fois.

Observez le flux continu

Partez du flux résiduel : un vecteur par position, déjà chargé de son token et de la marque de place posée au chapitre 5.

RMSNorm remet ce flux à l’échelle, l’attention mélange les informations entre positions, et le mélange retrouve le flux d’origine le temps d’un petit signe +.

Une seconde RMSNorm, puis le MLP (perceptron multicouche), un petit réseau appris qui travaille chaque position séparément, puis un autre +. Deux fois par étage, la même question : que devient tout ce que le flux transporte déjà ?

Prédisez le rôle d’un résidu

Les positions, gagnées au chapitre 5, restent activées. Votre pari porte sur l’étape 8, + résidu = sortie du bloc, le dernier + de l’étage.

Votre pari

Quand le MLP apporte une correction, que devient le flux résiduel entrant ?

Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.

Explorateur de bloc / un étage complet

Faites traverser les huit étapes d’un étage à un même mot. À chaque addition résiduelle, vérifiez ce que l’addition a conservé.

Missions en cours

  • Suivez le mot du milieu et déclarez la première étape où ses deux traces divergent

1 / 8 · Embedding d’entrée

Ordre original

mangerunavocat

position
p2
vecteur ajouté
[0,000 ; 0,400]
Embedding d’entrée
[-0,680 ; 0,440]

Ordre inversé

avocatunmanger

position
p0
vecteur ajouté
[0,400 ; 0,000]
Embedding d’entrée
[-0,680 ; 0,440]

Mêmes vecteurs à cette étape : les marques de position n’ont encore rien changé à ce que le bloc a lu. Avancez pour trouver où elles commencent à compter.

L’étage complet (ordre original)

avocat · #901
ÉtapeVecteur
Embedding d’entrée[-0,680 ; 0,440]
+ vecteur de position[-0,680 ; 0,840]
RMSNorm (avant attention)[-0,890 ; 1,099]
Mélange d’attention[-0,143 ; 0,680]
+ résidu (après l’attention)[-0,823 ; 1,520]
RMSNorm (avant MLP)[-0,673 ; 1,244]
MLP (2 → 3 → 2, ReLU)[0,000 ; 1,244]
+ résidu = sortie du bloc[-0,823 ; 2,764]
Inspecter les poids d’attention (ordre original)
Poids d’attention (sans masque, dans ce laboratoire)
Q ↓ / K →mangerunavocat
manger0,3390,4800,181
un0,2610,4010,338
avocat0,0530,0550,892

Chaque ligne affichée totalise 1,000. Le masque causal du chapitre 4 reste utilisé dans un vrai décodeur ; il est retiré ici pour que l’expérience d’ordre soit exacte.

Manipulez l’étage

Gardez les vecteurs de position activés. Avancez du flux muni de sa position à RMSNorm, puis à l’attention.

À l’étape + résidu, comparez cette ligne à + vecteur de position et à Mélange d’attention avant de décider ce que l’addition a gardé.

Continuez jusqu’à la seconde RMSNorm et au MLP. Ce laboratoire passe de 2 à 3 caractéristiques, applique ReLU, puis revient à 2.

La première coordonnée de sortie du MLP affiche 0,000 parce que ReLU a ramené à zéro les activations cachées qui l’alimentent.

Tout le cérémonial d’un gratte-ciel, joué sur trois nombres cachés.

À l’étape 8, + résidu = sortie du bloc, votre pari se règle : flux entrant plus correction du MLP, rien n’est jeté.

Choisissez maintenant un comme mot suivi, puis avancez étape par étape. Le panneau fait tourner les deux ordres côte à côte, de quoi repérer la première étape où ils divergent.

Un garde la même place dans les deux ordres, si bien que l’écart commence seulement quand une opération lit ses voisins réordonnés.

Quand vous pensez tenir cette étape, cliquez sur C’est ici la première divergence. L’instrument vous dira si vous déclarez trop tôt, trop tard, ou au bon endroit.

Ouvrez Inspecter les poids d’attention si vous souhaitez voir les parts de ce mélange.

Ne désactivez les positions que si vous voulez revoir l’expérience du chapitre 5. L’astuce discrète qu’il promettait est l’idée nouvelle de cet étage : le flux résiduel, un espace de travail continu que chaque sous-couche lit et corrige.

Défi Gardez les positions activées et suivez le mot du milieu, un. L’inversion le laisse au même endroit avec le même vecteur de position. Déclarez la première étape où les deux traces divergent, puis expliquez pourquoi.

Comparez votre réponse

Les traces divergent d’abord à l’attention. Avant elle, un garde le même token, la même position, le même vecteur de position et le même vecteur normalisé.

L’attention lit les autres positions. Inverser la phrase change les clés et les valeurs voisines que un mélange, donc sa correction d’attention change.

Prolongement facultatif.

Inspectez la matrice d’attention et expliquez pourquoi chaque ligne totalise 1. Le comptable du chapitre 4, le softmax, est toujours de service : il équilibre chaque ligne de scores non masqués à ce total exact.

Expliquez le plan de l’étage

Voici l’étage dans l’ordre, et ce qui justifie chaque pièce :

  • Les vecteurs de position donnent à chaque token une information sur sa place. Ils brisent ainsi la symétrie de l’expérience du chapitre 5, non masquée et fondée sur le seul contenu.
  • RMSNorm ramène chaque vecteur à une taille standard avant chaque sous-couche, pour que les valeurs ne dérivent pas vers l’immense ou le minuscule à mesure que les étages s’empilent.
  • L’attention est la seule étape où les positions échangent de l’information ; vous l’avez construite au chapitre 4.
  • Le MLP complète l’attention : il ne regarde jamais les positions voisines. Il applique la même transformation apprise à chaque position, et ses nombres appris représentent souvent une grande part des paramètres d’un bloc dense.
  • Les additions résiduelles préservent le vecteur entrant et ajoutent une correction : sortie = entrée + correction, deux fois par étage. Ce cumul, mis à jour à chaque addition, est le flux résiduel.

Il manque à cet étage un mur, le masque causal du chapitre 4, qui sépare le passé autorisé du futur interdit. Ici, l’ordre ne vient que des marques de place.

Pourquoi photocopier l’étage ? Dans la copie suivante, l’attention lit des vecteurs déjà contextualisés par l’étage précédent, si bien que chaque mélange et chaque transformation locale reprennent les corrections antérieures.

La profondeur permet cette composition. Le flux résiduel offre à chaque bloc un chemin continu vers l’état accumulé.

Les deux étapes qui normalisent et transforment ont des formules exactes, mais vous pouvez traverser l’étage sans elles ; ouvrez le panneau ci-dessous quand la mécanique vous tente.

  1. Le chapitre 4 a construitl’attention : les tokens se parlent
  2. Cet étage ajoutepositions · norme · MLP · résidus
  3. Un modèle complet empileN × cet étage
Le même étage, en formules

Dans la version simplifiée du laboratoire, RMSNorm transforme x en x / √(moyenne(x²)). Sa moyenne quadratique vaut alors 1 et sa direction reste inchangée.

Les implémentations ajoutent aussi un gain appris et un petit terme de stabilisation.

Le MLP du laboratoire calcule W₂ · ReLU(W₁x + b₁) + b₂, avec ReLU(z) = max(0, z). ReLU ramène les activations négatives à zéro.

Ici, le MLP passe de 2 à 3 dimensions, puis revient à 2. Dans les Transformers denses, sa largeur est généralement plusieurs fois supérieure avant la projection de retour.

Un étage pré-normalisé, écrit comme deux mises à jour du flux résiduel h :

h ← h + Attention(RMSNorm(h)) h ← h + MLP(RMSNorm(h))

Ce laboratoire ajoute des vecteurs de position construits à la main. D’autres modèles apprennent un encodage ou font tourner Q et K selon la position avec RoPE. Ces méthodes injectent l’ordre par des opérations différentes.

Aucune opération n’est « l’endroit où le modèle pense ».

L’attention déplace l’information entre positions ; le MLP transforme chaque position séparément. Ils alternent de bloc en bloc.

Un décodeur laisse normalement debout le mur du masque causal. Ce laboratoire le retire pour préserver l’expérience non masquée du chapitre 5.

Réfléchissez à ce que le flux conserve

Point de contrôle

Pourquoi les deux sous-couches utilisent-elles des additions résiduelles ?

Pourquoi les deux sous-couches utilisent-elles des additions résiduelles ?

Choisissez d’abord une réponse.

Point de contrôle

Pourquoi empiler de nombreux étages identiques apporte-t-il plus qu’un seul étage ?

Pourquoi empiler de nombreux étages identiques apporte-t-il plus qu’un seul étage ?

Choisissez d’abord une réponse.

Reliez l’étage à la tour

Le vecteur a traversé un bloc complet : deux normalisations, l’attention, un MLP et deux additions résiduelles. Le modèle photocopie cet étage N fois et laisse un vecteur au sommet de la tour.

Ce vecteur n’est encore qu’une suite de nombres, deux dans ce laboratoire. Comment la tour en fait-elle un pari sur tout le vocabulaire ? La leçon suivante place cette mise.

Sources et périmètre
  • Vaswani et al. (2017) définissent le bloc Transformer : attention plus réseau feed-forward par position, connexions résiduelles et normalisation.
  • Zhang et Sennrich (2019) introduisent RMSNorm, la normalisation sans recentrage utilisée dans ce laboratoire et dans de nombreux modèles récents.
  • Su et al. (2021) présentent les positions rotatives (RoPE), l’alternative de production aux vecteurs additifs montrés ici.
  • L’étage est un bloc 2D fabriqué à la main avec un MLP à 3 unités ; l’attention y tourne sans masque pour que l’expérience de permutation soit exacte.
  • Contenu et affirmations relus le 28 juillet 2026.