Dans cette leçon
Le raisonnement - s’offrir du temps pour réfléchir
Des tokens intermédiaires peuvent porter un résultat vers les paris suivants. Testez quand cela aide, ce que cela coûte et pourquoi une trace limpide peut tout de même mentir.
Le parcours
Du texte au chatbot
C’est l’ordre du cours, pas celui d’une passe avant.
I · Du texte aux représentations
II · Dans le Transformer
III · Prédire et apprendre
IV · Du modèle au chatbot
- 11Promptcontexte d’exécutionPas commencé
- 12Raisonnementpenser en tokensPas commencé
- 13Ancragesystème externePas commencé
- 14Trace finaleboucle entièrePas commencé
À la fin, vous saurez
- Expliquer comment un brouillon autorégressif porte un état intermédiaire vers les étapes de génération suivantes.
- Expliquer comment traces longues et échantillons multiples consomment du calcul au moment du test sans modifier les poids.
- Séparer raisonnement suscité et raisonnement entraîné sans ériger une recette ni une trace visible en règle universelle.
Avant de commencer : Le prompt est le programme
Un modèle ne se réécrit pas en répondant. Il peut pourtant améliorer ses chances, grâce à la boucle que vous avez lancée au chapitre 7. Ses poids sont figés depuis bien avant votre question ; l’état de travail, lui, continue de bouger.
Chaque token généré revient comme contexte, et le modèle peut écrire un résultat intermédiaire avant de parier dessus. Appelons chaque évaluation de plus une pièce de calcul : elle achète un passage, à un prix qui monte avec le contexte.
Certains produits affichent ces étapes intermédiaires, d’autres les résument ou les masquent. Sous le capot, l’achat est le même : du travail au moment de répondre, dépensé pour déplacer les chances.
Observez une question à deux sauts
La trace du cours reste sur la touche - « manger un avocat » n’a jamais demandé de relier deux faits. Ici, trouvez d’abord la ville de la Tour Bleue, puis reliez Ana à cette ville.
Les logits de ce laboratoire sont écrits à la main, pas mesurés sur un modèle de production. L’instrument vous laisse comparer ce que ses deux modes de réponse font des mêmes faits énoncés.
Prédisez ce que la réflexion préalable va faire
Votre pari
Dans ce dispositif à deux sauts écrit à la main, quel mode donne une meilleure chance à la bonne ville ?
Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.
Chaque token émis lance une nouvelle étape autorégressive et devient le contexte des paris suivants. Choisissez une question, puis répondez directement ou gardez une trace en jouant le juge.
Missions en cours
- Activer la réflexion et gagner le pari à deux sauts
- Pour aller plus loin : faire échouer la réflexion sur la question à un saut
- La Tour Bleue se dresse à Mira.
- Ana habite la ville de la Tour Bleue.
utilisateur: Où habite Ana ?
Réponse directe : ce dispositif n’émet aucun brouillon intermédiaire ; ses logits directs couvrent les faits d’un coup.
Distribution de réponse
Dans ce dispositif, les logits directs hésitent et la mauvaise ville prend les devants. Essayez de réfléchir d’abord.
Dispositif fabriqué : une trace choisie change le contexte, puis les logits. Il ne mesure aucun modèle réel ni ne prétend que toute tâche à deux sauts exige un brouillon. Un vrai système peut cacher les traces et employer un vote.
Manipulez le budget de réflexion
Commencez par la question à deux sauts, en mode répondre directement. Ici, la mauvaise ville passe devant. Les barres calculent un vrai softmax ; les logits, eux, sont écrits à la main, sans modèle de production.
Passez en réfléchir d’abord. Le laboratoire vous présente ses traces écrites à la main, puis vous laisse trancher. Gardez celle qui inscrit la ville manquante dans le contexte et regardez le pari final basculer vers la bonne réponse.
Montez les échantillons de réflexion et regardez grimper le compteur. C’est du best-of-N : tirer N traces candidates et en garder une.
Avec les deux échantillons par défaut, une trace comble le saut et une autre est fluide mais fausse ; avec cinq échantillons, vous payez cinq traces. En production, lots, cache et contexte changent la facture.
Gardez plutôt la trace fluide mais fausse. Son affirmation entre aussi dans le contexte, et la mauvaise réponse gagne. Plusieurs candidats n’aident que si un juge, un vote ou un vérificateur retient le travail utile.
Choisissez enfin la question témoin, à un saut. Son pari direct est déjà juste. Une bonne trace ne l’améliore pas ; une mauvaise peut le renverser.
Ici, la seule façon de perdre un pari déjà gagné, c’est d’y réfléchir.
Mission principale. Sur la question à deux sauts, activez la réflexion et gardez une trace qui fait gagner la bonne réponse.
Pour aller plus loin. Avec au moins deux échantillons sur la question à un saut, gardez une trace fluide mais fausse et regardez-la renverser une réponse déjà juste.
Comparez votre réponse
Les logits directs ont été écrits pour hésiter. Une bonne trace inscrit la ville manquante dans le contexte ; le pari suivant peut alors s’appuyer dessus.
Plus d’échantillons mettent plus de candidats sur la table ; encore faut-il sélectionner le travail utile. Sur le témoin, le texte ajouté n’apporte rien et une mauvaise trace détourne le pari.
Vous avez démontré l’arithmétique du laboratoire, rien de plus. Cela ne prouve pas que toute question à deux sauts exige un brouillon, ni qu’une réflexion à un saut est toujours nuisible.
Expliquez d’où vient le calcul supplémentaire
Chaque token généré réclame une nouvelle évaluation autorégressive. Le cache KV réutilise clés et valeurs antérieures, mais le nouveau token parcourt un cache croissant. Une pièce achetée tard coûte plus cher qu’une pièce achetée tôt.
Les tokens intermédiaires servent de brouillon externe. Une étape ultérieure reçoit leur résultat comme contexte au lieu de tout reconstruire. Les couches gardent le gros du calcul ; le brouillon leur épargne de repartir de zéro.
La chaîne de pensée désigne les étapes intermédiaires elles-mêmes, qu’un prompt les suscite ou que l’entraînement les façonne.
Les tokens de réflexion sont les pièces dépensées avant la réponse finale. Selon le produit, le raisonnement brut peut être affiché, résumé ou caché. Caché ne veut pas dire gratuit ; visible ne veut pas dire fidèle.
Le calcul au moment du test est plus large encore. Le système peut allonger une trace, échantillonner plusieurs candidats, explorer, lancer un vérificateur ou appeler un outil, sans mettre les poids à jour.
En best-of-N, la personne qui définit la fonction de score décide de ce que « meilleur » veut dire.
DeepSeek-R1 illustre l’apprentissage par renforcement sur des récompenses vérifiables, le RLVR en abrégé. Une réponse mathématique ou des tests de code peuvent fournir le signal qui façonne le raisonnement.
D’autres modèles peuvent mêler exemples supervisés, distillation, apprentissage par renforcement, recherche ou autres pipelines. Le RLVR nomme un chemin vers ce comportement, parmi d’autres.
Un modèle de base guidé par un prompt peut aussi produire un brouillon utile. Entraîner un modèle au raisonnement inscrit ce comportement dans les poids, mais la recette et les commandes proposées varient.
Une chaîne fluide peut finir sur une erreur. Des tests causaux montrent aussi qu’elle peut raconter infidèlement ce qui a conduit le modèle à sa réponse.
Lisez les étapes visibles comme une sortie que vous pouvez inspecter : elles peuvent aider, elles peuvent révéler une erreur. Ce qu’elles ne feront jamais, c’est témoigner de la cause de la réponse.
Réfléchissez au calcul acheté
Point de contrôle
Pourquoi des tokens de réflexion peuvent-ils aider sur une question difficile ?
Choisissez d’abord une réponse.
Dans le laboratoire, c’est vous qui avez suscité la trace et gardé la gagnante. L’entraînement peut inscrire cette habitude dans les poids. Reste à savoir par quelle recette.
Point de contrôle
Quelle affirmation décrit correctement les modèles de raisonnement ?
Choisissez d’abord une réponse.
Reliez la réflexion au monde extérieur
Raisonner, c’est dépenser plus de calcul sur ce que les poids et le contexte contiennent déjà. Aucun effort ne fera surgir un fait absent.
La leçon suivante ajoute récupération et outils : qui rapporte les preuves, et quels risques demeurent ?
Sources et périmètre
- Wei et al. (2022) rapportent des gains de chaîne de pensée sur certains tests à plusieurs étapes avec des modèles assez grands.
- Wang et al. (2022) échantillonnent divers chemins de raisonnement et retiennent la réponse finale la plus cohérente.
- Kwon et al. (2023) décrivent la gestion du cache KV en production, où le coût du décodage ne dépend pas d’un simple nombre fixe par token.
- DeepSeek-AI (2025) documente l’apprentissage par renforcement sur des récompenses vérifiables comme une recette d’entraînement.
- Lanham et al. (2023) utilisent des tests causaux pour montrer qu’une chaîne de pensée peut expliquer infidèlement la réponse.
- Tour Bleue, villes, traces, logits et pourcentages sont écrits à la main. Le laboratoire montre seulement que la trace choisie change le contexte, puis son pari final.
- Contenu et affirmations relus le 28 juillet 2026.