Dans cette leçon
Le prompt est le programme
Gardez tous les poids gelés, changez messages et exemples dans le contexte, puis regardez bouger la distribution du prochain token.
Le parcours
Du texte au chatbot
C’est l’ordre du cours, pas celui d’une passe avant.
I · Du texte aux représentations
II · Dans le Transformer
III · Prédire et apprendre
IV · Du modèle au chatbot
- 11Promptcontexte d’exécutionPas commencé
- 12Raisonnementpenser en tokensPas commencé
- 13Ancragesystème externePas commencé
- 14Trace finaleboucle entièrePas commencé
À la fin, vous saurez
- Démontrer que des instructions et exemples changent une prédiction sans modifier les poids du modèle.
- Expliquer les rôles comme un contexte formaté appris au post-entraînement, pas comme une autorité infaillible.
Avant de commencer : Du continuateur brut à l’assistant
Le jouet mise 43,7 % sur pomme. Ajoutez deux exemples au-dessus de la même question, et il mise 77,7 % sur avocat. Aucun entraînement ne sépare les deux paris. Qu’est-ce qui a bougé ?
Seulement le texte envoyé au modèle. L’application assemble instructions, messages, exemples et réponses précédentes dans le contexte d’exécution. Le modèle parie sur ce qui suit.
En ce sens, le prompt est un programme - probabiliste, exécuté par une machine dont le comportement est déjà inscrit dans les poids.
Observez un même modèle gelé
L’instrument fait tourner un petit jeu de poids fabriqués à la main, résumés à l’écran par une empreinte : une courte signature calculée sur tous les poids. Elle ne change jamais.
Activez ou désactivez instructions et exemples. Seuls changent l’entrée et les nombres temporaires qu’elle produit. L’entraînement est hors jeu. Jusqu’où un simple texte peut-il pousser le pari ?
Prédisez ce que les exemples déplacent
Votre pari
Si deux exemples installent avocat comme suite attendue d’une demande sur le guacamole, qu’est-ce qui doit changer dans le jouet gelé ?
Engagez-vous avant de manipuler l’instrument. Ce choix est définitif.
Composez le message qui atteint un même petit modèle gelé. Instructions et exemples deviennent des tokens dans son contexte ; ils ne réécrivent pas ses poids.
Activez d’abord l’instruction avec rôle.
Missions en cours
- Faire basculer le gagnant avec le seul contexte
- Miser sur les exemples et gagner le duel de la contradiction
Texte complet envoyé au modèle
utilisateur : fruit du guacamole → assistant :8 tokens
empreinte des poids : fnv1a-38b2e9f9, inchangéeDistribution du prochain token
Sans indication, le petit modèle gelé préfère pomme.
Mise en scène à trois effets, avec logits et softmax réels. Ici, les effets s’additionnent ; dans un vrai modèle, instructions, exemples et ordre interagissent. Les rôles comptent par apprentissage, pas par magie.
Manipulez le contexte, pas les poids
Partez des exemples réglés sur Aucun : le jouet préfère pomme. Activez l’instruction avec rôle et regardez chat, seul candidat qui n’est pas un fruit, sortir de la course.
Montez ensuite les exemples. Le pari bascule-t-il dès Un exemple, ou seulement à Deux ? Dans les deux cas, les mêmes poids traitent une autre séquence et produisent d’autres valeurs temporaires et d’autres logits.
Avant le duel, une limite : ce jouet additionne trois effets écrits à la main. Il ne reproduit aucune hiérarchie universelle entre message système et exemples.
Gardez Instruction avec rôle active, puis activez Instruction contradictoire en gardant Deux exemples. La ligne système exige pomme, les exemples répondent avocat, et les barres restent cachées tant que vous n’avez pas misé sur un gagnant.
Après la révélation, redescendez à Un exemple. Le duel finit-il de la même façon ? Rien ici n’établit de hiérarchie générale entre ligne système et exemples.
Comparez l’instruction seule et les exemples seuls : quel levier fait le plus bouger la cote ? Dans les deux cas, vous avez réécrit le programme ; les poids enregistrés, eux, n’ont pas bougé.
Défi Trouvez le plus petit changement de contexte qui fait basculer le gagnant. Nommez le levier employé : poids, contexte ou orchestration.
Pour aller plus loin, montez le duel avec deux exemples et annoncez le gagnant avant le retour des barres. Expliquez ensuite pourquoi ce résultat fabriqué n’établit aucune hiérarchie pour les vrais modèles.
Comparez votre réponse
Le pari bascule dès un exemple, et deux creusent l’écart. Seul le contexte d’exécution a changé.
Dans ce jouet, deux exemples l’emportent sur l’instruction contradictoire ; avec un seul exemple, l’instruction gagne à 70 %.
Les vrais effets dépendent de l’entraînement et du prompt entier, si bien que ce résultat ne prouve aucune hiérarchie.
Expliquez les rôles et l’apprentissage en contexte
La ligne de rôle que vous avez activée sort d’un gabarit de chat : il sérialise les messages structurés en une séquence de tokens, souvent avec des tokens spéciaux qui marquent chaque rôle.
L’entraînement au token suivant du chapitre 8, mené sur la montagne de texte du chapitre 9, est le préentraînement. Le pilotage ultérieur du chapitre 10, dont l’affinage supervisé et l’ajustement par préférences, est le post-entraînement.
Pendant ce post-entraînement, le modèle voit des conversations formatées. Il apprend à répondre après certains marqueurs, à s’arrêter aux frontières d’une réponse et à donner du poids à ce qui occupe la place de l’instruction.
Un message système est donc un contexte influent, pas un registre de commandes sécurisé dans le Transformer. Son influence vient du format, de l’entraînement et parfois de règles appliquées par l’application.
Il peut entrer en conflit avec le reste du contexte, ou n’être suivi qu’à moitié. Vous venez de vivre une version inoffensive de ce bras de fer, où deux exemples ont fait plier la ligne système.
Quand l’instruction concurrente est hostile et glissée par un tiers, on parle d’injection de prompt.
Si cette instruction arrive par une page web, un document récupéré ou le résultat d’un outil, l’injection est indirecte. L’instruction hostile voyage comme une donnée dans le contexte.
Donner quelques exemples dans le prompt s’appelle le few-shot prompting. Ils montrent un motif local dans le contexte, et le réseau calcule une nouvelle distribution conditionnelle à paramètres inchangés.
- Mécanique geléemême empreinte des poids
- Entrée différenterôles + instruction + exemples
- Résultat temporaire différentnouveaux logits, nouveau pari
Réfléchissez à l’empreinte gelée
Point de contrôle
Le prompt change la réponse tandis que l’empreinte des poids reste fixe. Que s’est-il passé ?
Choisissez d’abord une réponse.
Reliez le modèle à la conversation
L’assistant possède maintenant deux leviers. Le post-entraînement réécrit les poids. Le prompt réécrit le programme qu’ils exécutent.
Au chapitre suivant, le modèle écrira des étapes intermédiaires dans ce contexte. Les tokens suivants peuvent-ils s’en servir pour améliorer le pari final ?
Sources et périmètre
- Brown et al. (2020) démontrent l’apprentissage en contexte à partir d’instructions et d’exemples, sans mise à jour par gradient.
- Perez et Ribeiro (2022) nomment et démontrent l’injection de prompt, où des instructions placées dans le contexte l’emportent sur celles prévues.
- Greshake et al. (2023) démontrent l’injection indirecte par des données récupérées par une application qui intègre un LLM.
- Les trois effets du laboratoire sont fabriqués ; logits et softmax sont calculés en direct. L’expérience montre la frontière entre poids gelés et contexte changeant, pas une hiérarchie universelle des prompts.
- Contenu et affirmations relus le 28 juillet 2026.