Backend ≠ Harness

Atelier LLM · Séance 1

Modèle, harness et APIComprendre les couches d’un agent IA et le coût de ses appels.

Le parcours

01Du modèle à l’agentAppel, boucle, harness, skills et MCP.
02Modèles, accès et coûtsAPI, fournisseurs, prix et cache.
03Installer et utiliserHarness, configuration et mode Plan.

01 — Du modèle à l’agent

Partie 1Transformer un modèle
de langage en agent.

Du modèle seul au harness

Un appel
VousUne question
Prompt systèmeSYSTEM
Tu aides un étudiant.
CONTEXTE
Cours LLM, séance 1.
QUESTION
Explique le cache KV.
ModèleUn appel API
RéponseDu texte
Une boucle
VousUne mission
HarnessExécute et vérifie
FichiersTerminalWebMCP.mdSkills
↔︎
ModèlePropose la suite

Le résultat d’un outil revient au modèle. La mission continue.

La boucle, avec de vraies directions

PENSEChoisit la suiteAGITAppelle un outilOBSERVELit le résultatFINI ?Sinon, recommence
Une action par tour.

Le modèle demande. Le harness exécute dans le monde réel et remet l’observation dans le contexte du tour suivant.

Exemple · « Corrige le titre de la page d’accueil »
PENSELire le fichier.
AGITread(“index.html”)
OBSERVE<h1>Accueil</h1>
PENSECorriger le titre.
AGITedit(“Bienvenue”)
FINIRéponse envoyée.

Harness et modèles

Harness Les applications qui pilotent les appels et les outils
OpenCode
Cursor
Étoile ClaudeClaude Code
Codex
Copilot
Kimi Code
DeepSeek Harness
Kilo Code
Cline
Pi
Oh My Pi
ZCode
Modèles Les familles de modèles qui génèrent les réponses
GPT
Claude
Gemini
DeepSeek
Qwen
Kimi
Muse Spark
Mistral
MiniMax
GLM

Un skill est un fichier de travail

SKILL.md · extrait réel
name: humanizer
description: Rewrite AI-sounding text so it reads
like the writer without changing what it says.

1. Mark the tells.
2. Draft the rewrite. Keep every supported claim.
Avant

« Cette mise à jour marque un tournant majeur. »

Après

« Cette mise à jour change le fonctionnement du produit. »

Un MCP expose des commandes

WolframWolfram MCP
Découvertetools/listNoms et descriptions des commandes.
Le modèle choisitla commande adaptée à sa tâche.
WolframContextContexte et ressources.
WolframAlphaQuestion en langage naturel.
WolframLanguageEvaluatorExécute du Wolfram Language.
Appel choisi · WolframLanguageEvaluatorSolve[x^3 - 6x^2 + 11x - 6 == 0, x]Résultat renvoyé au modèle{{x → 1}, {x → 2}, {x → 3}}

02 — Modèles, accès et coûts

Partie 2Choisir l’accès,
comprendre le prix.

L’accès : direct, passerelle ou abonnement

Directement

Votre harness → API du fournisseur → modèle

OpenAIAnthropicDeepSeekQwen

Par une passerelle

Votre harness → passerelle → modèle

OpenRouterVercelCloudflare

Par abonnement

Un forfait mensuel → modèles inclus.

OpenAIChatGPT Plus 23 €/moisChatGPT Pro 230 €/mois
AnthropicClaude Pro 20 €/moisClaude Max 5x 100 €/moisClaude Max 20x 200 €/mois
GoogleGoogle AI Pro 22 €/moisGoogle AI Ultra 275 €/mois
OpenCodeOpenCode Go 10 $/mois

Direct, passerelle ou abonnement : trois façons d’accéder aux modèles.

Le prix d’un appel se lit en trois colonnes

USD par million de tokens · prix indicatifs au 21 septembre 2026

Input = ce qu’on envoie   ·   Output = ce que le modèle produit
Modèle / accès Input Input en cache Output
GPT-6 Astra OpenAI 10 $ 1 $ 50 $
GPT-5.6 Sol OpenAI 4 $ 0,40 $ 20 $
Claude Opus 4.8 OpenCode Zen 5 $ 0,50 $ 25 $
DeepSeek V4.1 Flash direct, heures pleines 0,30 $ 0,006 $ 1,20 $
Qwen3.7 Max OpenCode Zen 2,50 $ 0,50 $ 7,50 $
Kimi K3 OpenCode Go 3 $ 0,30 $ 15 $
Muse Spark 1.3 OpenCode Zen 1,25 $ 0,15 $ 4,25 $
Muse Spark Contributor Zen · temporaire 0 $ 0 $ 0 $

Sources : OpenAI · DeepSeek · OpenCode Zen · OpenCode Go. Tarifs variables selon contexte, horaires, option de cache et fournisseur.

Le cache KV dans l’attention

Attn(Q, K, V) = softmax(QKT / √d + M) V
q₁qₙ
×
k₁TkₙT
=
q₁k₁Tq₁kₙTqₙk₁TqₙkₙT
+
0−∞−∞00−∞000
softmax(x)i = exi / Σj exj

Un token ne doit pas voir les suivants : M vaut 0 sur le token courant et le passé, −∞ sur le futur. Après softmax, e−∞ = 0 : le futur reçoit un poids nul.

K et V restent en cache. Le prochain token ajoute une ligne.

Plus de tours, plus de tokens réutilisés

Appel 1 2 3 n
Tokens du cache relus 0 1 2 n − 1
0 + 1 + ⋯ + (n − 1) = n(n − 1) / 2

10 appels → 45 tokens relus.

OpenCode Go : 10 $ / mois

10 $abonnement mensuel Go
accès inclus selon le modèle15 $ à 60 $de consommation API équivalente indiquée par OpenCode : Kimi K3 ≈ 15 $, Qwen3.7 Plus ≈ 60 $ ; limites par modèle.
Capture officielle OpenCode Go, recadrée sur les limites mensuelles par modèle

Capture recadrée sur les montants affichés par OpenCode Go (septembre 2026). Les montants sont des plafonds d’usage estimés, pas un crédit librement échangeable contre n’importe quel modèle. Détails des limites.

Le choix utile : séparer les trois couches

01Harness

OpenCode, Codex, Claude Code…
Comment travaille l’agent ?

02Accès API

Direct, OpenRouter, Vercel, Cloudflare, OpenCode…
Qui sert et facture l’appel ?

03Modèle

Astra, Sol, Opus, DeepSeek, Qwen, Muse…
Qui génère les tokens ?

Les trois couches évoluent séparément : changer l’une ne modifie pas automatiquement les deux autres.

03 — Installer et utiliser

Partie 3 · à venirInstaller un harness,
connecter un modèle,
travailler en mode Plan.

À retenir

Le backend est le moteur.

Le harness fait avancer
le travail.
La boucle donne de l’autonomie. L’API donne accès au modèle. Le prix dépend des tokens réellement consommés.