Dans cette leçon
Les embeddings : le sens devient géométrie
Le parcours
Du texte au chatbot
Ordre du cours, pas un seul appel du modèle.
I · Du texte aux représentations
- 01Prédictionappel modèlePas commencé
- 02Tokenisationappel modèlePas commencé
- 03Embeddingsappel modèlePas commencé
II · Dans le Transformer
III · Prédire et apprendre
IV · Du modèle au chatbot
Chaque identifiant ouvre un casier qui contient un vecteur appris. Faites glisser des mots sur une carte jouet et mesurez ce qui se ressemble.
À la fin, vous saurez
- Expliquer comment une table d’embeddings transforme un identifiant en vecteur.
- Interpréter la similarité cosinus sans la confondre avec une mesure de vérité.
Avant de commencer : La tokenisation, ou comment un modèle lit
La leçon précédente s’est terminée sur trois adresses : #120, #18, #901. Une adresse suffit à distinguer avocat de chat, mais sa grandeur ne porte aucun sens : le token #901 n’est pas « plus avocat » que le token #314. Pour calculer des relations utiles, ce numéro de casier ne suffit pas. Le modèle a besoin d’un vecteur. Un vecteur n’est rien de plus effrayant qu’une courte liste de nombres - deux dans ce laboratoire - dessinée comme une flèche partant du centre d’une carte. Commencez par manipuler la géométrie qu’il emploiera.
Observez un vocabulaire devenir une carte
La carte ci-dessous place chat et chien dans des directions presque identiques, tandis que pomme se tient à l’écart. Cette carte n’a pas été apprise par un modèle : elle est dessinée à la main pour isoler la géométrie.
Prédisez le grand voyage du chat
Le classement de l’instrument note la ressemblance de chaque mot avec le token observé. Supposez maintenant qu’on attrape chat et qu’on le traîne jusque chez pomme, à l’autre bout de la carte.
Votre pari
Si chat déménage chez pomme, que devient sa similarité avec chien ?
Personne ne corrige. Engagez-vous, l’instrument tranchera.
Cette petite carte est dessinée à la main. Attrapez un point, faites-le glisser (les curseurs et les flèches du clavier marchent aussi) et regardez le classement cosinus suivre.
Missions en cours
- Rapprocher voiture de reine plutôt que de vélo
- Faire franchir zéro à un cosinus
| Token | ID | x | y | cosinus |
|---|---|---|---|---|
| #314 | 0.82 | 0.72 | 1.00 | |
| #271 | 0.74 | 0.68 | 1.00 | |
| #408 | 0.34 | 0.86 | 0.89 | |
| #409 | 0.30 | 0.96 | 0.85 | |
| #901 | -0.68 | 0.44 | -0.27 | |
| #612 | -0.78 | 0.32 | -0.44 | |
| #733 | 0.20 | -0.82 | -0.46 | |
| #734 | 0.12 | -0.66 | -0.51 |
Jouet pédagogique : ces huit points ne viennent pas d’un modèle entraîné. Un véritable embedding est appris et possède souvent des centaines de dimensions.
Manipulez les directions
Attrapez un point et faites-le glisser ; la carte et le tableau se recalculent ensemble. Suivez le classement plutôt que la distance à l’écran : le cosinus observe la direction depuis l’origine, pas la position absolue.
Défi Rendez voiture plus proche de reine que de vélo, en un minimum de gestes. Puis cassez tout : trouvez un déplacement d’un seul point qui retourne son cosinus de positif à négatif. Le bouton de réinitialisation pardonne tout.
Comparez votre réponse
Voiture et vélo pointent d’abord toutes deux vers le bas de la carte tandis que reine pointe vers le haut : un seul geste règle la première mission, faites glisser voiture vers le haut jusqu’à ce que sa flèche s’aligne sur la direction de reine. Le cosinus juge la direction depuis l’origine, pas la distance à l’écran : voiture ressemble désormais plus à reine qu’à vélo. Ce même geste casse un signe : voiture remontée et vélo toujours vers le bas, l’angle entre elles dépasse 90 degrés, donc leur produit scalaire, et donc cos(voiture, vélo), franchit zéro et devient négatif.
Ces huit points sont fabriqués à la main ; ils ne proviennent pas de la projection d’un modèle entraîné. Une véritable table d’embeddings est apprise et possède souvent des centaines ou des milliers de dimensions. Ses axes n’arrivent pas avec des étiquettes humaines comme « animal » ou « royal » : les régularités utiles se répartissent dans de nombreuses directions.
Expliquez la mécanique de la table
En 2013, des chercheurs ont montré que certains écarts entre vecteurs de mots appris capturaient des relations récurrentes. Le raccourci devenu célèbre était roi − homme + femme ≈ reine. C’est un exemple frappant, pas une loi algébrique : le résultat dépend du modèle et de ses données d’entraînement.
- Identifiant du tokenavocat · #901
- Recherche dans la tableE[901]
- Vecteur de départ[−0,68 ; 0,44]
Une table d’embeddings est une matrice E - une grille de nombres - avec une ligne par token. Pour l’identifiant i, E[i] renvoie le vecteur eᵢ. Pendant l’entraînement, les valeurs de E sont ajustées chaque fois que cela aide le modèle à mieux prédire le token suivant.
Le produit scalaire est l’outil à tout faire du cours pour comparer et noter des vecteurs : multiplier les cases correspondantes, puis additionner. Pour [a, b] et [c, d], cela donne ac + bd, un nombre qui grandit quand deux flèches pointent dans la même direction. Le chapitre 4 l’emploie pour noter quels tokens correspondent ; le chapitre 7, pour noter chaque mot du vocabulaire.
Pour comparer deux vecteurs, l’instrument utilise la similarité cosinus : un score qui ne regarde que la direction, jamais la longueur. Une valeur proche de 1 signifie « directions proches » dans cet espace appris ; elle ne signifie pas « mots identiques » ni « affirmation vraie ». Au point [0, 0], il n’existe aucune direction : la similarité cosinus est indéfinie, et le laboratoire l’indique au lieu d’inventer un zéro.
Le même score, en formules
cos(a, b) = (a · b) / (||a|| × ||b||)
Le produit scalaire a · b augmente quand les directions s’alignent ; la division par les deux longueurs retire l’échelle, et seul l’angle survit.
Pause maths : les vecteurs sans brouillard
Un vecteur n’est ici qu’une ligne ordonnée de nombres. [0,8 ; 0,7] signifie avancer de 0,8 sur l’axe horizontal et de 0,7 sur le vertical. Un produit scalaire multiplie les coordonnées correspondantes puis les additionne : [a, b] · [c, d] = ac + bd. Le vrai modèle utilise des milliers de coordonnées, mais le geste reste multiplier les mêmes cases, puis additionner.
Il manque encore le contexte. Pour un même identifiant du token avocat, la table renvoie la même ligne dans « manger un avocat » et « appeler un avocat ». L’embedding initial porte des régularités apprises, avec les imperfections et biais des données d’entraînement ; il n’exprime pas encore le rôle précis de cette occurrence. Gardez ces deux phrases en tête : elles ouvrent le chapitre 4.
Réfléchissez à ce que dit un cosinus
Point de contrôle
Les lignes E[271] et E[314] ont des longueurs différentes, mais pointent presque dans la même direction. Que conclure ?
Reliez le vecteur fixe à sa phrase
Nous avons maintenant un vecteur de départ par token, mais chaque recherche ignore superbement la phrase qui l’entoure : le vecteur d’avocat ne sait pas s’il est question de guacamole ou de tribunal. Dans la prochaine leçon, ce même vecteur initial entrera dans deux contextes et produira deux sorties différentes. Il est temps de faire parler les tokens entre eux.
Sources et périmètre
- Mikolov, Yih et Zweig (2013) décrivent des écarts syntaxiques et sémantiques récurrents dans des espaces de vecteurs de mots appris.
- Les huit points 2D du laboratoire sont fabriqués pour enseigner la recherche dans une table et la géométrie du cosinus ; ils ne proviennent pas d’un modèle de langage entraîné.
- Contenu et affirmations relus le 18 juillet 2026.