Chapitre 10III · Prédire et apprendre6 min de lecture · ~12 min de manipulation

III · Prédire et apprendre

Dans cette leçon

Du continuateur brut à l’assistant

Faites passer une même architecture par l’affinage supervisé puis les préférences. Voyez comment l’entraînement oriente ses paris, ce que fait la perte limitée à la réponse et ce qu’il ne garantit pas.

À la fin, vous saurez

  • Expliquer comment l’affinage supervisé et l’ajustement par préférences orientent les poids d’un modèle de base.
  • Expliquer pourquoi le SFT limité à la réponse concentre la perte sur les tokens de la réponse sans cacher le prompt au modèle.
  • Énoncer pourquoi ces phases d’entraînement ultérieures changent le comportement sans installer de vérificateur de vérité ni de moteur de règles.

Avant de commencer : Ce que permet le passage à l’échelle

Au sortir du préentraînement - le régime du token suivant du chapitre 8, à l’échelle du chapitre 9 - un modèle peut répondre à une question par une autre.

Pas un assistant cassé : un continuateur efficace qui parie sur la suite habituelle du texte visible.

Pour en faire un assistant, on envoie cette même tour à l’école des bonnes manières - aucune boîte d’obéissance ni module de règles séparé, juste un entraînement supplémentaire, jusqu’à ce que le pari penche vers la réponse.

Observez une tour, trois écoles

Le laboratoire compare trois instantanés d’une même architecture, fabriqués à la main : base, affinage supervisé (SFT), puis ajustement par préférences. Attention, blocs et softmax restent en place ; seuls les poids changent.

Chaque continuation et chaque part de token est fabriquée pour rendre les étapes lisibles. Ce qui est réel, c’est le mécanisme démontré : des poids modifiés peuvent déplacer les paris. Commencez où la tour commence, avant toute école.

Prédisez la réaction du modèle de base

Soumettez à l’instantané de base la consigne Traduisez « chat » en anglais.

Votre pari

Dans ce dispositif fabriqué à la main, que fait l’instantané de base de la consigne de traduction ?

Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.

Labo d’adaptation / la même tour, trois écoles

Une seule architecture, trois jeux de nombres. Devinez d’abord, comparez ensuite.

Continuations, indices et parts de tokens sont fabriqués pour ce dispositif. Ils illustrent des étapes d’entraînement, pas le comportement mesuré d’un modèle réel.

Vue

Lisez la continuation, puis nommez l’école qui l’a produite - avant la révélation.

Manche 1 sur 8Score 0 / 8
Prompt

Traduisez « chat » en anglais.

« cat ».
Quelle école a produit cela ?

Missions en cours

  • Attribuer 6 sur 8 correctement
  • Réussir un sans-faute (8 sur 8)

Comparer côte à côte s’ouvre sur le prompt de traduction. Quelle colonne ne répond jamais et distribue des exercices à la place ? Lisez les deux colonnes, puis tranchez votre pari.

Manipulez les trois étapes

Ouvrez Devinez l’école. Les indices sont volontairement appuyés, avec davantage d’exercices pour l’instantané de base, une réponse directe après SFT, puis une forme plus complète ou un refus après les préférences.

Apprenez la grille de lecture de ce dispositif avant de le prendre pour une preuve générale.

Passez à Comparer côte à côte et choisissez le prompt d’insulte. Suivez le token qui ouvre le refus : un outsider fabriqué à 5 %, à peine 8 % après SFT, puis favori à 64 % - sans qu’une seule couche de l’architecture ait bougé.

Cette montée est le mécanisme à retenir. Poursuivre l’entraînement peut déplacer la masse de probabilité vers un comportement.

Ouvrez Inspecter le masque SFT et regardez quelles positions portent la perte, notée sur la réponse seule. Le prompt n’apporte aucun terme de perte, et pourtant chaque gradient de réponse retraverse l’attention qui l’a lu.

Défi

Mission principale : suivez le token de refus aux trois étapes. Nommez ce qui change, ce qui reste fixe et ce que ce déplacement fabriqué démontre vraiment.

Pour aller plus loin : inspectez le masque SFT. Expliquez pourquoi le prompt façonne encore la réponse alors qu’aucune perte ne tombe sur lui.

Comparez votre réponse

Les auteurs ont relevé la part du refus pour illustrer ce qui peut arriver quand les préférences récompensent refus et réorientation. Le jouet ne calcule pas cet ajustement.

Dans ce SFT, le prompt est un pur contexte, que l’optimiseur ne note jamais. Les gradients nés sur la réponse retraversent tout ce que le prompt a conditionné ; non noté ne veut pas dire inutile.

Sans ce masque, l’entraînement dépenserait aussi de la perte sur le texte utilisateur ou système, et le modèle apprendrait à écrire les prompts autant qu’à y répondre.

Expliquez l’école des bonnes manières

  • Le SFT applique l’entropie croisée du chapitre 8 à des dialogues choisis. Dans cette recette limitée à la réponse, le prompt sert d’entrée et la réponse de cible notée.
  • L’ajustement par préférences apprend de réponses comparées. Le RLHF (apprentissage par renforcement sur retours humains) et la DPO (optimisation directe des préférences) déplacent la probabilité vers le comportement choisi plutôt que vers une réponse type.
  1. Le préentraînement construitun continuateur de texte
  2. Le SFT renforcedes formes de réponse utiles
  3. Les préférences renforcentcertains genres de réponse

Ces étapes peuvent enseigner des comportements, des formats et du contenu propre à une tâche. Leur mécanisme commun reste un entraînement ordinaire, où les gradients changent les poids, qui refaçonnent ensuite les paris.

L’école des bonnes manières n’installe ni moteur de règles ni test de vérité. Refus, phrase au ton de citation et date affirmée avec aplomb sont autant de continuations générées.

Un meilleur pilotage peut réduire certaines erreurs, sans certifier le moindre token. L’école note les manières, et une date fausse peut être parfaitement bien élevée.

La complaisance : c’est l’accord qui marque des points.

Des évaluations publiées montrent que juges humains et modèles de préférence peuvent favoriser une réponse qui épouse l’avis de l’utilisateur plutôt qu’un désaccord exact. Reste à savoir quels ajustements en héritent : question empirique.

Réfléchissez à ce qui a réellement changé

Point de contrôle

Que fait le masque limité à la réponse dans l’exemple de SFT ?

Que fait le masque limité à la réponse dans l’exemple de SFT ?

Choisissez d’abord une réponse.

Point de contrôle

Un assistant ajusté par préférences annonce une date fausse avec aplomb. Qu’en conclure ?

Un assistant ajusté par préférences annonce une date fausse avec aplomb. Qu’en conclure ?

Choisissez d’abord une réponse.

Reliez l’assistant entraîné au contexte d’exécution

L’école des bonnes manières a changé des poids désormais gelés. Rien de ce que vous taperez ce soir ne les fera bouger.

Sans réentraînement, la leçon suivante pilotera pourtant cet assistant. D’où la question à garder en tête : où loge un prompt, si ce n’est dans les poids ?

Sources et périmètre
  • Ouyang et al. (2022) documentent un pipeline SFT puis RLHF, ses gains en suivi de consignes et les erreurs qui demeurent.
  • Rafailov et al. (2023) présentent la Direct Preference Optimization, qui apprend de réponses choisies et rejetées.
  • Sharma et al. (2023) mesurent la complaisance et étudient comment des jugements humains ou automatisés peuvent préférer l’accord à l’exactitude.
  • Continuations et parts de tokens sont des exemples fabriqués. Ils illustrent le pilotage des probabilités dans un jouet, pas le comportement mesuré de modèles réels.
  • Contenu et affirmations relus le 28 juillet 2026.