Prompt, token, MCP, harness. Si tu suis l’IA de loin, le jargon IA t’a déjà fait lâcher un article en cours de route, à cause d’un mot que personne n’a pris la peine d’expliquer.
Le vocabulaire bouge vite, et les lexiques français ont souvent un train de retard. Ils en sont encore à définir « prompt » pendant que les développeurs parlent de harness depuis des mois. Voilà neuf mots de jargon IA, rangés du plus simple au plus technique. Tu t’arrêtes où tu veux 😉 et n’hésite pas à ajouter en favoris pour revenir quand tu veux !
Pourquoi le jargon IA mérite dix minutes de ton temps
Pas pour briller en réunion. Mais ça peut ! Par contre, grâce à cette petit apprentissage, tu gagneras du temps (et de l’argent).
Quelqu’un qui ne sait pas ce qu’est une fenêtre de contexte va coller un PDF de 400 pages dans un chat et s’étonner du résultat. Quelqu’un qui confond RAG et fine-tuning va demander un devis à cinq chiffres pour un problème qui se règle avec un dossier de documents bien rangé. Ces deux erreurs reviennent tout le temps.
1. Prompt, la base
Le prompt, c’est ce que tu écris dans la fenêtre de chat. Ta consigne.
C’est le mot le plus connu du jargon IA et le plus mal compris. Beaucoup cherchent des prompts magiques à copier-coller. Ce qui change vraiment le résultat, c’est le contexte que tu donnes : à qui tu parles, ce que tu attends en sortie, ce que tu as déjà essayé et qui n’a pas marché.
« Écris-moi un article sur le café » et « Écris 800 mots pour des baristas qui hésitent entre deux machines à levier, ton technique, pas de conclusion en forme de résumé » ne donnent pas la même chose. Même modèle, même seconde.
2. Token, le coût
Un token, c’est un morceau de mot. Le modèle ne lit ni des lettres ni des phrases : il lit des tokens.
En français, un mot pèse en général entre 1 et 3 tokens. « Chat » en fait un. « Anticonstitutionnellement » en fait une poignée. Le français consomme d’ailleurs plus de tokens que l’anglais pour dire la même chose, ce qui explique une partie des écarts de prix. D’ailleurs, c’est une astuce qui peut être utilisée pour limiter l’usage de tokens.
👉 Deux raisons de s’y intéresser : tu paies au token, en entrée comme en sortie. Et la limite de ce que le modèle avale se compte en tokens, pas en pages.
3. Fenêtre de contexte
La fenêtre de contexte, c’est tout ce que le modèle a sous les yeux à l’instant T : ton prompt, les messages précédents, les fichiers joints, les instructions système.
Quand elle est pleine, le plus ancien dégage. C’est pour ça qu’une longue conversation finit par « oublier » ce que tu as dit au début.
Les modèles récents affichent des fenêtres énormes, plusieurs centaines de milliers de tokens. Méfie-toi quand même : plus la fenêtre se remplit, plus le modèle a tendance à perdre ce qui se trouve au milieu. Remplir n’est pas comprendre.
💡 Astuce
Quand ta conversation commence par devenir trop grande, dis à l’IA que tu dois clôturer la session et de résumer, lister les actions réalisées / restantes pour une prochaine session. Une bonne pratique peut être d’écrire ceci dans un fichier Markdown (.md) par exemple.
4. Hallucination
Quand le modèle invente et l’affirme avec le même aplomb que le reste, le jargon IA parle d’hallucination.
Un numéro d’article de loi qui n’existe pas. Une fonction PHP qui n’a jamais été écrite. Une citation attribuée au mauvais auteur. Ce n’est pas un bug qu’on corrigera dans la prochaine version : le modèle prédit le mot suivant le plus probable, il n’a aucun mécanisme interne pour vérifier ce qu’il avance.
D’où les deux mots qui suivent. Les deux cherchent à résoudre le même problème, par deux chemins différents.
5. RAG
RAG, pour Retrieval-Augmented Generation. En clair : le modèle va d’abord chercher des documents, puis répond en s’appuyant dessus.
Tu déposes tes PDF, tes fiches produit ou ta documentation interne quelque part. Au moment de la question, un moteur de recherche sélectionne les passages utiles et les glisse dans la fenêtre de contexte. Le modèle répond avec ça sous les yeux, et peut citer ses sources.
NotebookLM fonctionne comme ça. La plupart des chatbots d’entreprise aussi. L’avantage : tu corriges un document, la réponse change le lendemain. Aucun réentraînement.
6. Fine-tuning
Le fine-tuning, c’est réentraîner un modèle existant sur tes propres données pour modifier son comportement.
La différence avec le RAG tient en une phrase : le RAG ajoute de la connaissance au moment de la question, le fine-tuning modifie le modèle lui-même. On s’en sert surtout pour le style, le format, le ton. Beaucoup moins pour les faits.
Quand quelqu’un dit « il faudrait fine-tuner un modèle sur nos données », il veut presque toujours du RAG. C’est moins cher, ça se met à jour, et ça se teste en une après-midi.
7. MCP
MCP veut dire Model Context Protocol. C’est une prise standard entre un modèle et un outil extérieur.
Avant, chaque intégration était du sur-mesure. Avec MCP, un serveur expose ses fonctions une fois, et n’importe quel client compatible s’y branche : Gmail, une base de données, un CRM, un outil de génération d’images. Le protocole a été ouvert par Anthropic fin 2024, puis repris par les autres éditeurs (la documentation officielle est ici).
J’ai testé le truc en branchant Higgsfield en MCP dans Claude : tu demandes une image en langage naturel, le modèle appelle l’outil, l’image arrive dans la conversation. Plus de copier-coller entre quinze onglets.
C’est le terme de jargon IA qui est passé le plus vite du statut de « truc de développeur » à celui de ligne dans les réglages.
8. Agent IA
Un agent, c’est un modèle à qui on a donné des outils et le droit de boucler.
Toute la nuance est dans « boucler ». Un chatbot répond une fois et attend. Un agent lit ta demande, choisit un outil, regarde le résultat, recommence, et s’arrête quand il estime avoir fini. C’est ce qui lui permet de lire un fichier, de le corriger, de lancer les tests, de voir qu’ils échouent et de repartir.
Trois ingrédients, donc : des outils, une boucle, un critère d’arrêt. J’ai comparé plusieurs de ces agents dans mon article sur l’agent IA à choisir pour son second cerveau.
9. Harness
On arrive au mot que tu ne trouveras dans presque aucun lexique français. Le jargon IA a toujours un cran d’avance sur les glossaires.
Un harness (« harnais »), c’est tout le logiciel qui entoure le modèle. La formule qui circule chez les développeurs tient en trois mots : agent = modèle + harness.
Le modèle raisonne. Le harness s’occupe de tout le reste :
- le prompt système et les règles de comportement
- la liste des outils disponibles et la façon de les appeler
- la mémoire : ce qu’on garde d’un tour à l’autre, ce qu’on jette
- l’environnement d’exécution, souvent un conteneur isolé
- les garde-fous : ce qui se lance tout seul, ce qui demande ta validation
- les traces, pour comprendre après coup ce qui s’est passé
Pourquoi ce mot est devenu central ? Sur beaucoup de tâches, changer de harness change plus le résultat que changer de modèle. Deux outils qui tournent sur le même modèle se comportent différemment, parce qu’ils ne gèrent pas le contexte, les permissions et les erreurs de la même façon. En 2026 (et bientôt 2027), on change encore très souvent de LLM, le harness permet permet de travailler correctement, peu importe le LLM (aussi performant soit-il).
Tu peux le vérifier toi-même en regardant ce que donne OpenClaw au quotidien : le modèle derrière est le même que celui de ton chat habituel, et pourtant l’expérience n’a rien à voir (idem pour Hermès Agent, que j’utilise quotidiennement désormais).
Le jargon IA en résumé
- Prompt : ta consigne.
- Token : l’unité que le modèle lit et que tu paies.
- Fenêtre de contexte : ce qu’il a sous les yeux, compté en tokens.
- Hallucination : quand il invente sans prévenir.
- RAG : aller chercher les documents avant de répondre.
- Fine-tuning : réentraîner le modèle pour changer son comportement.
- MCP : la prise standard entre le modèle et tes outils.
- Agent : un modèle avec des outils et le droit de boucler.
- Harness : tout le logiciel autour du modèle.
Le jargon IA va continuer de bouger, et une partie de ces mots aura disparu dans deux ans. Mais les neuf ci-dessus suffisent à comprendre 90 % de ce qui se dit aujourd’hui, y compris chez les gens qui construisent ces outils.
Si tu ne devais en retenir qu’un : harness. C’est celui qui explique pourquoi deux produits basés sur le même modèle ne se valent pas du tout.


