Chapitre 09III · Prédire et apprendre8 min de lecture · ~10 min de manipulation

III · Prédire et apprendre

Dans cette leçon

Ce que permet le passage à l’échelle

De soixante paramètres à 405 milliards : voyez où logent les nombres, pourquoi données et calcul doivent grandir avec eux, et ce qu’a demandé l’entraînement publié d’un modèle ouvert.

À la fin, vous saurez

  • Situer où logent les paramètres d’un Transformer : la table d’embeddings, l’attention et le MLP par token.
  • Expliquer pourquoi le passage à l’échelle couple davantage de paramètres, de données d’entraînement et de calcul.
  • Donner les vrais ordres de grandeur d’un entraînement : tokens, paramètres, heures-GPU et dollars.

Avant de commencer : L’entraînement, la machine qui corrige ses nombres

Le jouet que vous avez entraîné contient environ soixante nombres ajustables, de quoi apprendre qu’avocat suit « manger un ». Llama 3.1 405B en contient 405 milliards, aux trois mêmes endroits. La différence tient au passage à l’échelle.

Une cuisine plus grande réclame de la place pour les paramètres, des provisions pour les nourrir et du temps de four pour l’entraînement. Avant de lire l’addition, pariez : où sont passés tous ces paramètres ?

Ici, aucune fausse facture d’un modèle secret. Chaque nombre est publié, calculé sous vos yeux, ou signalé comme estimation ou illustration.

Observez le budget de paramètres

Un budget de paramètres répartit les nombres appris entre trois endroits déjà rencontrés : la table d’embeddings, les projections d’attention et le MLP par token de chaque bloc.

La taille du vocabulaire commande la pile des embeddings ; la largeur (longueur de chaque vecteur de token) et la profondeur (nombre d’étages empilés) font grandir les piles de l’attention et du MLP.

Ces deux piles suivent à peu près le carré de la largeur. Changez la forme, et l’équilibre bascule.

L’explorateur ne garde que ces termes dominants et omet biais, normalisation et liage des poids. Ses totaux préservent malgré tout la forme du budget.

Prédisez où s’accumulent les paramètres

Votre pari

Dans le préréglage dense du petit modèle ouvert, quelle partie détient le plus de paramètres ?

Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.

Explorateur d’échelle / où logent les paramètres

Un modèle plus grand, c’est la même recette avec de plus grands nombres. Réglez la forme, regardez où s’accumulent les paramètres, puis voyez ce que coûte vraiment un entraînement de cette taille.

Charger une forme

Missions en cours

  • Réduire le vocabulaire jusqu’à ce que les projections d’attention dépassent la table d’embedding
  • Charger la référence publiée de 405 Md et lire son budget d’entraînement

Budget de paramètres

  1. Table d’embedding30,3 % 37 M
  2. Projections d’attention23,2 % 28 M
  3. MLP par token46,5 % 57 M

Paramètres au total122 M

Ce que coûte un entraînement de cette taille

Forme personnalisée. Le nombre de paramètres est calculé ; tokens, heures-GPU et dollars ne sont connus que pour les vrais modèles ci-dessus - chargez-en un pour les lire.

D’où viennent les données d’entraînement

Les tokens consommés par la boucle du chapitre 8 n’arrivent pas propres. Un corpus à l’échelle du web est collecté, puis l’essentiel est filtré.

  1. Collecte web brute1000 T
  2. Filtre langue + qualité150 T15 % gardé
  3. Suppression des quasi-doublons45 T30 % gardé
  4. Tokens effectivement utilisés pour l’entraînement15 T33 % gardé

T = mille milliards de tokens.

Perte en fonction du calcul

Ajoutez du calcul - avec un modèle plus grand et davantage de tokens - et la perte suit une courbe descendante. À chaque multiplication par dix du calcul, le gain diminue et la courbe se rapproche d’un plancher sans l’atteindre.

FLOP = une opération en virgule flottante ; un entraînement en utilise des milliards de milliards.

plancher irréductible (1,85)

Le repère chaud couple le nombre de paramètres à l’estimation Chinchilla de 2022, environ 20 tokens par paramètre. Il est indicatif. Les points ~8 Md et ~400 Md représentent des entraînements publiés.

Sur cette courbe illustrative, chaque facteur dix réduit moins la perte. La tendance suit les lois publiées ; les valeurs tracées ne sont pas des mesures.

Plus loin : doubler le modèle ou doubler les données ?

À calcul fixé, paramètres et données doivent rester équilibrés. Hoffmann et al. (2022) estimaient environ 20 tokens par paramètre dans leur cadre. C’est un résultat daté.

Formule dense simplifiée, pas le détail GQA et SwiGLU de Llama. Formes, tokens et heures-GPU sont publics ; dollars, entonnoir et courbe restent des estimations signalées. Aucun entraînement ici.

Manipulez la forme

Chargez le préréglage petit modèle ouvert et tranchez votre pari. Avant de toucher un curseur, lisez les trois parts : dans cette forme dense (chaque bloc tourne pour chaque token), laquelle domine ? Est-ce celle de votre pari ?

Augmentez la largeur. Attention et MLP grandissent à peu près avec son carré, et leurs parts prennent de l’avance. Réduisez le vocabulaire, seule la table d’embeddings rétrécit.

Deux modèles au même total de paramètres peuvent le dépenser à des endroits très différents.

Chargez ensuite Modèle publié de 405 Md. Sa fiche de coût chiffre un entraînement documenté : les étagères (paramètres), les provisions (tokens d’entraînement) et le temps de four, facturé en heures-GPU - une puce H100 pendant une heure.

Sous la fiche, une seule question demande ces heures-GPU à un facteur dix près. Répondez d’après la fiche, pas de mémoire ; la mission ne passe au vert que si votre lecture est juste.

Lisez D’où viennent les données d’entraînement et regardez le nombre de tokens fondre à chaque étape : collecte, filtrage, déduplication.

Les étapes sont illustratives - la recette de Llama 3.1 reste privée - mais l’entonnoir est celui de FineWeb, publié.

Lisez enfin la courbe perte en fonction du calcul. Personne n’a mesuré cette pente sur Llama. Elle est tracée à la main d’après la forme publiée : chaque multiplication par dix du calcul réduit un peu moins la perte, jusqu’à un plancher.

Défi Mission principale : réinitialisez l’explorateur, gardez la profondeur fixe, puis réduisez le vocabulaire jusqu’à ce que l’attention dépasse l’embedding. Expliquez en opposant vocabulaire × largeur à largeur².

Pour aller plus loin : chargez Modèle publié de 405 Md et donnez les ordres de grandeur des paramètres, tokens d’entraînement et heures-GPU. Signalez que le montant en dollars est une estimation, puisque personne n’a publié la facture.

Comparez votre réponse

La table d’embeddings grandit comme vocabulaire fois largeur. L’attention grandit à peu près comme largeur au carré par couche. Réduire le vocabulaire peut donc la faire passer devant sans changer la profondeur.

Des centaines de milliards de paramètres, des dizaines de milliers de milliards de tokens, des dizaines de millions d’heures-GPU sur H100. Le total en dollars multiplie ces heures par un tarif cloud illustratif : d’où l’estimation.

Expliquez ce que multiplie le passage à l’échelle

Le passage à l’échelle couple trois budgets : les paramètres achètent de la capacité, les données fournissent les exemples, et le calcul paie l’arithmétique qui transforme ces exemples en meilleurs paramètres.

Trop de paramètres pour trop peu de données laissent de la capacité inutilisée. Plus de données sans assez de calcul laissent des exemples inexploités.

La cuisine ne s’agrandit que si étagères, provisions et temps de four grandissent de concert.

Une loi d’échelle est une relation empirique publiée entre ces budgets et la perte. Kaplan et al. ont mesuré des lois de puissance régulières ; d’autres ont ensuite montré qu’à calcul fixé, taille et données doivent s’équilibrer.

Plus loin : un équilibre daté, pas une constante universelle

Hoffmann et al. (2022) ont estimé environ 20 tokens d’entraînement par paramètre pour les modèles et le régime de calcul étudiés.

Ce chiffre appartient au régime qui l’a produit. Ce qui survit, c’est le couplage : des paramètres sans données ni calcul à la hauteur, ce sont des étagères payées et à moitié vides.

Comme point de repère public, Llama 3.1 décrit un modèle dense de 405 milliards de paramètres, entraîné sur environ 15 000 milliards de tokens. L’article rapporte près de 31 millions d’heures-GPU sur H100.

Au tarif illustratif de l’explorateur, ces heures donnent environ 60 à 120 millions de dollars. La fourchette est une estimation bâtie sur ce tarif, et tout est dépensé avant la première réponse du modèle.

Réfléchissez au budget couplé

Point de contrôle

Quels trois budgets doivent grandir ensemble lors d’un grand entraînement ?

Quels trois budgets doivent grandir ensemble lors d’un grand entraînement ?

Choisissez d’abord une réponse.

Vous venez aussi de chiffrer un vrai entraînement. Retenez les ordres de grandeur ; les valeurs exactes, elles, appartiennent à ce seul article.

Point de contrôle

Pour le modèle publié de 405 Md affiché dans l’explorateur, quel jeu de nombres a le bon ordre de grandeur ?

Pour le modèle publié de 405 Md affiché dans l’explorateur, quel jeu de nombres a le bon ordre de grandeur ?

Choisissez d’abord une réponse.

Reliez le passage à l’échelle à l’assistant

Étagères garnies, provisions faites, temps de four payé : 405 milliards de paramètres là où le jouet en comptait soixante. Ce qui sort de cette cuisine reste pourtant un modèle de base : un continuateur de texte.

Une question reste ouverte pour la leçon suivante. Comment une seconde phase, bien plus petite, peut-elle orienter ses paris vers des réponses utiles sans remplacer la tour ?

Sources et périmètre
  • Kaplan et al. (2020) rapportent des lois d’échelle empiriques reliant la perte aux paramètres, aux données et au calcul.
  • Hoffmann et al. (2022) (Chinchilla) soutiennent que beaucoup de grands modèles étaient sous-entraînés pour leur taille et estiment l’équilibre optimal tokens-par-paramètre.
  • Grattafiori et al. (2024) (The Llama 3 Herd of Models) rapportent le modèle dense 405B, environ 15 000 milliards de tokens d’entraînement et près de 30,84 millions d’heures-GPU sur H100.
  • Penedo et al. (2024) (FineWeb) documentent le pipeline de collecte, filtrage et déduplication dont le panneau de données illustre la forme.
  • L’arithmétique de paramètres de l’explorateur est écrite à la main et ne garde que les termes dominants (embedding, attention, MLP) ; elle omet biais, normalisation et liage des poids, c’est donc une forme, pas un décompte exact.
  • Le chiffre en dollars est un ordre de grandeur (heures-GPU publiées fois un tarif cloud), les totaux du pipeline de données sont illustratifs, et la courbe perte en fonction du calcul est tracée à la main pour montrer la forme publiée de la loi d’échelle, pas des valeurs reproduites.
  • Contenu et affirmations relus le 28 juillet 2026.