Chapitre 05II · Dans le Transformer5 min de lecture · ~8 min de manipulation

II · Dans le Transformer

Dans cette leçon

L’ordre entre dans la machine

Mêmes tokens, ordre différent, sens différent. Menez une expérience de permutation exacte au chiffre près et donnez à chaque place sa marque géométrique.

À la fin, vous saurez

  • Démontrer pourquoi une attention fondée sur le seul contenu ne distingue pas un token déplacé.
  • Expliquer comment un signal de position rend l’ordre disponible pour tous les calculs suivants.

Avant de commencer : L’attention, le moment où les tokens se parlent

« Le chien mord l’homme » et « l’homme mord le chien » contiennent les mêmes pièces. Inversez leur ordre et toute la scène bascule.

Sans masque, la tête du chapitre 4 ignorait lequel venait en premier. Le laboratoire la réduit au seul contenu : ni signal de position, ni masque causal. Avocat remarquera-t-il qu’il a bougé, ou le calcul ne verra-t-il que son contenu ?

Pariez avant de donner une marque géométrique à chaque place. Dans ce laboratoire, tout ce que l’attention pourra jamais savoir de l’ordre devra tenir dans cette marque.

Observez la coordonnée manquante

Le laboratoire fait passer avocat par le même bloc d’attention non masqué - une tête et le petit réseau appris qui l’entoure - dans deux phrases : manger un avocat et avocat un manger.

Sans vecteurs de position, chaque opération agit sur le contenu des tokens, et rien ne marque la place qu’ils occupent. Le bloc reçoit les pièces de la phrase ; ce qu’il perçoit de leur ordre, c’est justement l’objet de votre pari.

Prédisez ce que l’inversion peut changer

Votre pari

Sans vecteurs de position, que devient la sortie d’avocat quand il passe de la dernière à la première place ?

Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.

Laboratoire de position / donner une coordonnée à l’ordre

Inversez les trois mêmes tokens sans signal de position, puis ajoutez les vecteurs de position et regardez ce qui change.

Second pari. Une fois les positions actives, quel token produira encore des sorties identiques dans les deux ordres ?

Missions en cours

  • Suivre avocat entre deux marques de position
  • Trancher le second pari, puis faire changer le token central immobile

Ordre original

mangerunavocat

place
p2
marque de position
aucune
sortie du même bloc
[-1,225 ; 1,360]

Ordre inversé

avocatunmanger

place
p0
marque de position
aucune
sortie du même bloc
[-1,225 ; 1,360]

Calcul réel du bloc avec embeddings 2D et vecteurs de position fabriqués.

Manipulez la marque de position

Suivez d’abord chaque token sans positions. Quand la phrase s’inverse, la sortie d’avocat bouge-t-elle d’un seul chiffre ? Comparez les deux cartes avant de trancher.

avocat un manger n’est du charabia que pour vous ; pour le bloc, trois tokens parfaitement fréquentables. Le bloc est équivariant par permutation : réordonner les entrées réordonne les sorties correspondantes.

Avant d’activer les marques, le laboratoire exige un second pari. Quel token produira encore des sorties identiques dans les deux ordres ? Misez ; le verdict tombe aussitôt.

Activez ensuite les positions. La place p0 ajoute [0,4 ; 0] ; la place p2 ajoute [0 ; 0,4]. Ces coordonnées appartiennent aux places, pas aux mots.

Quand avocat bouge, sa ligne de contenu reste [−0,68 ; 0,44], mais la somme qui entre dans l’attention change. Le bloc peut désormais réagir à la position que le token occupe.

Défi Deux missions. D’abord, gardez les positions actives et prédisez quelle marque ([0,4 ; 0] ou [0 ; 0,4]) avocat reçoit dans chaque phrase, puis vérifiez.

Réglez ensuite Token suivi sur un. Regardez le token qui n’a pas bougé changer quand même : les marques de ses voisins lui parviennent par l’attention.

Expliquez pourquoi cette marque suffit pour que l’attention réagisse à l’ordre, alors qu’elle ne lit jamais de numéro de place écrit.

Comparez votre réponse

Avocat reçoit la marque de sa place : [0 ; 0,4] en dernier et [0,4 ; 0] en premier.

Pour le token central immobile, l’attention mélange des voisins dont les vecteurs marqués ont changé.

Cette marque change les nombres qui produisent Q, K et V : les calculs suivants peuvent tenir compte de la position sans lire d’étiquette séparée.

Expliquez pourquoi les positions fonctionnent

Un Transformer ne reçoit pas l’ordre comme une métadonnée invisible. L’ordre doit modifier les nombres qu’il calcule.

Ce jouet ajoute un vecteur à chaque token. Beaucoup de modèles de production font plutôt pivoter les requêtes et les clés selon la position. Les mécanismes diffèrent, le contrat reste le même :

représentation du token + signal de position → représentation sensible à la place

  1. Même ligne du tokenavocat · [−0,68 ; 0,44]
  2. Marque de place différente+ p0 ou + p2
  3. Entrée différente pour Q, K, Vl’attention peut réagir à l’ordre

Le signal ne dit pas ce que signifie la phrase ; il permet aux couches suivantes d’apprendre des motifs comme « le sujet précède » ou « cette parenthèse ferme celle-là ».

Pourquoi retirer le masque causal ? Un masque causal est déjà asymétrique : la première place voit un token, la suivante en voit deux, et ainsi de suite.

Un modèle peut exploiter ce motif pour reconstituer une partie de la position en contrebande, sans signal explicite. Ce laboratoire retire le masque pour que seule la marque de place brise la symétrie.

Réfléchissez aux deux expériences

Point de contrôle

Pourquoi le bloc fondé sur le seul contenu ne remarque-t-il pas qu’avocat a bougé ?

Pourquoi le bloc fondé sur le seul contenu ne remarque-t-il pas qu’avocat a bougé ?

Choisissez d’abord une réponse.

Reliez l’ordre à un étage complet

Les tokens transportent maintenant contenu et place. Dans cette expérience sans masque, exacte au chiffre près, vous avez établi le résultat vous-même : pas de marque, pas d’ordre.

La leçon suivante garde les marques actives et parcourt le reste de l’étage - normalisation, MLP et l’astuce discrète qui permet d’en empiler une centaine.

Sources et périmètre
  • Vaswani et al. (2017) introduisent les encodages de position ajoutés du Transformer.
  • Su et al. (2021) décrivent RoPE, qui code la position en faisant tourner requêtes et clés.
  • Haviv et al. (2022) montrent que les modèles causaux peuvent inférer la position sans encodage explicite, probablement en exploitant le masque causal.
  • Le laboratoire utilise des marques additives 2D fabriquées et retire le masque causal uniquement pour rendre l’expérience de permutation exacte.
  • Contenu et affirmations relus le 28 juillet 2026.