Chapitre 03I · Du texte aux représentations6 min de lecture · ~10 min de manipulation

I · Du texte aux représentations

Dans cette leçon

Les embeddings : le sens devient géométrie

Chaque identifiant ouvre une ligne, et cette ligne devient une flèche sur une carte. Faites-y glisser les mots et mesurez ce qui se ressemble.

À la fin, vous saurez

  • Expliquer comment une table d’embeddings transforme un identifiant en vecteur.
  • Interpréter la similarité cosinus sans la confondre avec une mesure de vérité.

Avant de commencer : La tokenisation, ou comment un modèle lit

Le token #901 n’est pas « plus avocat » que le token #120. Une adresse ne dit rien de son contenu, et le tokeniseur n’a transmis que des adresses. Pourtant, le modèle a besoin de nombres utiles avant de parier.

Une table d’embeddings les fournit sur simple présentation de l’identifiant : la ligne ouverte est un vecteur, une liste ordonnée de coordonnées.

Ici, en 2D, le vecteur devient une flèche sur une carte ; commencez par déplacer ces flèches vous-même.

Observez un vocabulaire devenir une carte

Ici, les huit points sont dessinés à la main pour isoler la géométrie ; aucun modèle entraîné ne les a produits. La carte place chat et chien dans des directions presque identiques, tandis que pomme reste à l’écart.

Prédisez comment la carte bouleverse le classement

Le classement compare chaque flèche au token observé. Avant de toucher la carte, pariez sur ce qui arrive quand chat déménage chez pomme, de l’autre côté de l’origine par rapport à chien.

Votre pari

Si chat déménage chez pomme, que devient sa similarité avec chien ?

Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.

Carte vectorielle / jouet 2D

Cette petite carte est dessinée à la main. Attrapez un point, faites-le glisser (les curseurs et les flèches du clavier marchent aussi) et regardez le classement cosinus suivre.

Missions en cours

  • Rapprocher voiture de reine plutôt que de vélo
  • Faire franchir zéro à un cosinus

Voisin le plus proche: chien (cosinus 1,00).

Embedding jouet
Embedding jouetJouet pédagogique : ces huit points ne viennent pas d’un modèle entraîné. Un véritable embedding est appris et possède souvent des centaines de dimensions.chatchienroireinepommeavocatvoiturevélo
Valeurs et similarités
TokenIDxycosinus
#3140,820,721,00
#2710,740,681,00
#4080,340,860,89
#4090,300,960,85
#901-0,680,44-0,27
#612-0,780,32-0,44
#7330,20-0,82-0,46
#7340,12-0,66-0,51

Jouet pédagogique : ces huit points ne viennent pas d’un modèle entraîné. Un véritable embedding est appris et possède souvent des centaines de dimensions.

Manipulez les directions

Commencez par votre pari : sélectionnez chat, faites-le glisser sur pomme, puis lisez la ligne chien dans la colonne cosinus.

Faites glisser un point. La carte et le tableau se recalculent ensemble, et le classement remet chaque pari en jeu. Suivez le classement plutôt que la distance à l’écran : le cosinus compare la direction de chaque flèche depuis l’origine.

Défi

Mission principale. Rendez voiture plus semblable à reine qu’à vélo en un geste. Expliquez le résultat avec les directions depuis l’origine.

Pour aller plus loin. Trouvez un geste qui fait passer un cosinus de positif à négatif. Le bouton Réinitialiser pardonne le vandalisme cartographique.

Comparez votre réponse

Mission principale. Faites monter voiture jusqu’à aligner sa flèche sur celle de reine. Le cosinus suit la direction depuis l’origine : voiture classe alors reine devant vélo, quelle que soit la distance apparente.

Pour aller plus loin. Laissez vélo pointer vers le bas tandis que voiture monte. Leur angle dépasse 90 degrés ; leur produit scalaire et leur cosinus passent sous zéro.

Une vraie table d’embeddings, une fois apprise, compte souvent des centaines ou des milliers de dimensions, quand ce laboratoire en a deux.

Aucun nord « animal » ou « royal » : chaque régularité utile se répartit entre de nombreuses directions.

Expliquez la mécanique de la table

D’abord, la recherche dans la table. Une table d’embeddings est une matrice E, avec une ligne par token. L’identifiant i ouvre la ligne E[i] et renvoie le vecteur initial eᵢ.

  1. Identifiant du tokenavocat · #901
  2. Recherche dans la tableE[901]
  3. Vecteur de départ[−0,68 ; 0,44]

Pendant l’entraînement, les coordonnées de E changent quand cela aide le modèle à prédire le token suivant. La ligne obtenue place le token sur la carte apprise avant d’y mêler le contexte de la phrase.

Vient ensuite la comparaison. L’outil à tout faire du cours est le produit scalaire : multiplier les coordonnées correspondantes, puis additionner. Pour [a, b] et [c, d], cela donne ac + bd.

Le produit scalaire tend à augmenter quand les flèches s’alignent. Le chapitre 4 l’utilise pour noter les correspondances ; le chapitre 7, pour noter le vocabulaire lors du prochain pari.

L’instrument emploie la similarité cosinus, qui retire la longueur et compare la direction. Une valeur proche de 1 indique des directions alignées dans cet espace.

Elle ne dit ni que les mots sont interchangeables, ni que la phrase est vraie.

Au point [0 ; 0], aucune direction n’existe : le cosinus est indéfini. La carte le dit au lieu d’inventer discrètement un zéro.

Recherche et comparaison en main, vous pouvez remettre à sa place un exemple célèbre. Une étude de 2013 a trouvé des écarts récurrents dans certains vecteurs appris, résumés par roi − homme + femme ≈ reine.

Ce motif dépend de modèles et de données précis ; ce n’est pas une loi algébrique. Une carte apprise peut porter des régularités utiles sans offrir un sens humain propre à chaque axe.

Le même score, en formules

cos(a, b) = (a · b) / (||a|| × ||b||)

Le produit scalaire a · b augmente quand les directions s’alignent ; la division par les deux longueurs retire l’échelle, et seul l’angle survit.

Pause maths : les vecteurs sans brouillard

Un vecteur n’est ici qu’une ligne ordonnée de nombres. [0,8 ; 0,7] signifie avancer de 0,8 sur l’axe horizontal et de 0,7 sur le vertical.

Un produit scalaire multiplie les coordonnées correspondantes puis les additionne : [a, b] · [c, d] = ac + bd. Un vrai modèle peut employer des milliers de coordonnées ; le geste reste identique.

Il manque encore le contexte. Le même identifiant avocat ouvre la même ligne dans « manger un avocat » et « appeler un avocat ». La carte a placé le token, mais elle n’a pas lu sa phrase.

Cette ligne porte des régularités apprises, imperfections et biais de l’entraînement compris. Ce qu’elle ne sait pas encore dire : de quel avocat parle la phrase. Gardez les deux phrases en tête ; elles ouvrent le chapitre 4.

Réfléchissez à ce que dit un cosinus

Point de contrôle

Le tokeniseur produit l’identifiant #901 pour avocat. Que fait d’abord la couche d’embedding ?

Le tokeniseur produit l’identifiant #901 pour avocat. Que fait d’abord la couche d’embedding ?

Choisissez d’abord une réponse.

Reliez le vecteur fixe à sa phrase

Chaque recherche place maintenant un token sur la carte de départ, sans égard pour sa phrase. La ligne d’avocat ignore encore si elle prépare du guacamole ou plaide au tribunal.

Ensuite, ce même vecteur entrera dans deux contextes et produira deux sorties différentes. Quelle opération permettra aux autres tokens de redessiner sa position ?

Sources et périmètre
  • Mikolov, Yih et Zweig (2013) décrivent des écarts syntaxiques et sémantiques récurrents dans des espaces de vecteurs de mots appris.
  • Les huit points 2D du laboratoire sont fabriqués pour enseigner la recherche dans une table et la géométrie du cosinus ; ils ne proviennent pas d’un modèle de langage entraîné.
  • Contenu et affirmations relus le 28 juillet 2026.