Kvmzen Blog
← Retour à La tech en pratique

Claude Code vs Codex vs Gemini 3.8 Flash : comparaison des agents de code IA 2026, qualité de code, Context, MCP, Subagents, Terminal, coût des tokens et efficacité

AIDevelopment ·~14 min de lecture

Développeur lançant des agents de code IA en parallèle dans un terminal multi-écrans

Deux ou trois agents de code ouverts dans le même terminal, ce n’est plus rare. Les noms sont connus : Claude Code, Codex, Gemini 3.8 Flash. Les comparer à « qui complète mieux une ligne », c’est souvent choisir le mauvais outil.

Les deux premiers sont des produits agents, capables de tourner en boucle. Flash est d’abord un modèle : sans CLI ou Antigravity, il ne travaille pas. Les tests passent-ils, la facture explose-t-elle avec le contexte, les outils se branchent-ils vraiment : ça ne se tranche pas en un paragraphe d’ouverture. Les sections suivantes le déplient.

Quotas et forfaits : voir le guide complet des quotas et limites Claude Code 2026. Si vous hésitez encore entre abonnement IDE et agent CLI, lisez les alternatives moins chères à Cursor en 2026.

1M
Échelle de la fenêtre Context
$0.75
Prix promo Flash en entrée
51.8%
Un score sur un bench long

D’abord aligner : vous ne comparez pas la même sorte de chose

Votre priorité Plutôt choisir Pourquoi
Refactor multi-fichiers, longues tâches, peu de retours Claude Code Sous-agents matures ; Opus 5 mène nettement les benches d’agent généraux
Auditable et sandboxé par défaut, open source Codex CLI Apache-2.0, réseau coupé par défaut, sous-agents levés explicitement
Gros volume, multimodal, tokens unitaires au plus bas Gemini 3.8 Flash Prix promo ≈ 1/3 de Sonnet 5 ; très solide sur le SWE court

Il n’y a pas de « premier partout ». DeepMind le dit dans la fiche modèle Gemini 3.8 Flash (septembre 2026) : Flash frôle les fleurons sur l’ingénierie logicielle courte, mais reste derrière Opus 5 sur les tâches d’agent générales plus longues.

Qualité de code : courte et longue distance, même compétence ?

Découpez « qualité de code » en deux couches : corriger les bons fichiers en une passe (le patch compile et passe les tests) et finir la tâche d’une session à l’autre (sans dériver ni toucher des modules hors sujet).

Comparaison publique de la fiche DeepMind (septembre 2026) :

Bench Ce qui est mesuré Gemini 3.8 Flash Claude Opus 5 Claude Sonnet 5 GPT-5.6 Sol GPT-5.6 Terra
DeepSWE v1.1 Génie logiciel long 73.7% 74.0% 53.8% 72.7% 69.6%
Terminal-bench 2.1 Écrire du code dans le terminal 89.4% 89.1% 80.4% 88.8% 87.4%
Terminal-bench 4.0 Agent plus général 19.1% 51.8% 12.4% 37.3% 23.6%
OSWorld-2.0 Piloter un ordinateur 59.0% 75.4% 42.6% 62.6% 50.2%

Lecture :

  • Patches du quotidien, scripts terminal, dépôts moyens : Flash, Opus 5 et GPT-5.6 Sol sont sur le même palier. Flash est même un peu devant sur Terminal-bench 2.1.
  • Outils multiples, plusieurs sessions, planification autonome : Opus 5 hisse Terminal-bench 4.0 à 51.8 %, Sol à 37.3 %, Flash à 19.1 % seulement. C’est la version chiffrée de « le modèle pas cher écrit des fonctions, il ne tient pas le rôle de chef de projet ».
  • Sonnet 5 reste le cheval de trait par défaut de Claude Code : prix unitaire bas, contexte 1M natif, mais DeepSWE à 53.8 % seulement. Pour un refactor dur, basculez explicitement vers Opus ; n’attendez pas du modèle par défaut un travail de fleuron.

Au feeling, Claude Code casse moins souvent B en corrigeant A. Codex est très stable en ligne de commande et sur les scripts multi-étapes, et le bac à sable par défaut vous laisse oser les tests. Gemini 3.8 Flash est rapide, bon marché, fort en multimodal — sur une longue chaîne, il lâche plus facilement l’objectif. Coupez les tâches, ou montez le thinking effort.

Context : une fois la fenêtre assez grande, où va l’argent

Produit Contexte du modèle par défaut Sortie max Tarification long contexte
Claude Code (Sonnet 5 / Opus 5) 1M (natif API) 128k Pas de surcoût long contexte annoncé
Codex (GPT-5.6) environ 1.05M 128k Au-delà d’environ 272k en entrée, certains paliers majorent
Gemini 3.8 Flash 1,048,576 64k Promo au même prix unitaire ; à partir de 2027, tarif standard doublé

Le chiffre de fenêtre n’est plus un argument de vente. Ce qui brûle l’argent : renvoyer à chaque requête l’historique, les sorties d’outils et les tranches de dépôt.

  • Claude Code : plus le dialogue s’allonge, plus ça coûte ; /clear est moins cher que /compact. Skills, résultats MCP et journaux de tests entrent dans la session principale. L’un des intérêts des sous-agents : laisser le bruit de recherche dans la sous-fenêtre et ne remonter qu’un résumé.
  • Codex : spawn explicite des sous-agents, session principale plus propre, tokens plus prévisibles ; à vous d’écrire clairement « combien, pour quoi ».
  • Gemini 3.8 Flash : fenêtre 1M + effort réglable (low / medium / high). Plus l’effort monte, plus les tokens de réflexion et la latence montent. Coupure de connaissances vers mars 2026 : les API de libs récentes passent encore par la recherche ou MCP ; ne supposez pas que le modèle « sait tout ».

N’enfournez pas un gros dépôt entier. Balayez d’abord en lecture seule avec Explore / explorer, puis laissez l’agent principal toucher les fichiers critiques. Pour l’isolation en parallèle : guide Parallel AI Coding.

MCP : le protocole est commun, les pièges non

Les trois parlent Model Context Protocol. En 2026, la question n’est plus « MCP ou pas », mais : qui a l’écosystème le plus profond, qui se configure sans piège, et vos serveurs survivront-ils au prochain changement de gamme.

Claude Code Codex CLI Pile autour de Gemini 3.8 Flash
Branchement claude mcp add (http / stdio ; SSE obsolète) config.toml settings.json / plugins Antigravity
Écosystème le plus profond (initiateur du protocole) Suffisant, plutôt ingénierie Branchable, plus complet côté entreprise
Extensions Skills, Hooks, Plugins Skills, mode exec, backend de modèle interchangeable Skills / Hooks / Subagents migrent vers Antigravity

Claude Code reste le chemin de moindre résistance pour brancher d’abord GitHub, des bases et des API internes. L’atout Codex : une config versionnable, auditable, pointable vers n’importe quel backend compatible Chat Completions / Responses — si un modèle disparaît, la chaîne ne meurt pas. Côté Gemini, le développeur individuel doit séparer : modèle pas cher ≠ produit agent stable. Après le resserrement des forfaits personnels Gemini CLI à la mi-2026, la communauté a basculé vers Antigravity ; la surface d’extensions est encore là, mais le duo « CLI open source + endpoint subventionné » est défait. Si votre feuille de route mise encore sur une grande version Gemini, voir Gemini 4 vaut-il la peine d’attendre.

MCP mange du contexte
Chaque réponse d’outil entre dans la fenêtre. Journaux, dumps de tables entières et gros diffs coûtent souvent plus que le modèle. Filtres, pagination et droits lecture seule sur MCP rapportent plus qu’un palier d’abonnement.

Sous-agents : deux façons d’appeler de l’aide

Les deux camps font « orchestrateur + sous-agents », avec des philosophies opposées.

Claude Code traite les sous-agents comme des citoyens de premier rang : Explore, Plan et workers génériques ont leur contexte, leur liste blanche d’outils et leurs droits. L’agent principal délègue tout seul d’après la description ; vous n’avez pas à écrire « ouvre un explorateur ». Les sous-agents d’arrière-plan continuent, et peuvent passer dans un worktree dédié. Vous économisez le bruit de recherche dans la fenêtre principale ; vous payez des tokens — officiellement, une équipe d’agents en mode plan peut coûter plusieurs fois une session normale. Les rôles custom vivent en frontmatter YAML, même logique de distribution que les Skills.

Codex n’ouvre pas de processus enfants par défaut. Il faut écrire dans le prompt : « à chaque checkpoint, spawn un agent ». Explorer est plutôt lecture seule, combinable avec sandbox_mode. Avantage : coût prévisible, parallèle que vous bornez. Inconvénient : une phrase oubliée, et il ne fait que chercher lentement dans la session principale.

Gemini 3.8 Flash n’est pas un runtime. Antigravity / Managed Agents annoncent Skills, Hooks et Subagents, mais maturité et profondeur de doc restent en retrait de Claude Code. Brancher Flash sur un orchestrateur maison (ou le multi-backend Codex) est souvent plus contrôlable : le travail cher à Opus / Sol, les scans de dépôt en masse à Flash.

# Claude Code : répartition implicite dans la session principale
Agent principal (Opus / Sonnet)
  ├─ Explore (Haiku, lecture seule) → résumé seulement
  ├─ Plan → plan, pas de fichiers de prod directs
  └─ Implémentation / vérif → contexte isolé, fond si besoin

# Codex : ça ne démarre que si vous le nommez
Session principale (GPT-5.6 Terra / Sol)
  └─ Vous écrivez “spawn explorer + reviewer”
        └─ Le sous-agent livre, la session principale tranche

Terminal : peut-on lui laisser taper des commandes

La productivité d’un agent = le nombre de fois où il lance vraiment pytest, npm test, git. Le risque est au même endroit.

Question Claude Code Codex CLI Pile Gemini 3.8 Flash
Bac à sable par défaut Seatbelt / bubblewrap activé par défaut, seccomp sous Linux selon l’agent hôte ; le modèle ne gère pas les processus
Réseau par défaut nouveaux domaines à approuver coupé par défaut selon Antigravity / votre runtime
Windows via WSL2 bac à sable natif ou WSL2 selon le produit
Noyau open source non (dépôt de release + plugins) oui, Apache-2.0, Rust modèle fermé ; l’ancienne Gemini CLI est ouverte, le canal perso s’est resserré

Le réseau coupé par défaut de Codex est, en 2026, le durcissement de sécurité le plus franc : sans Internet, l’agent a du mal à coller un .env sur une machine inconnue. Claude Code est plus souple — autorisation par domaine, adapté à la doc et aux paquets au quotidien — mais Anthropic a écrit que le proxy ne termine pas le TLS, un contournement par domain fronting reste possible. En entreprise, posez un proxy inspectable.

Gemini 3.8 Flash à 89.4 % sur Terminal-bench 2.1 : le modèle sait se servir du terminal. S’il fait n’importe quoi sur votre machine dépend de l’enveloppe : Antigravity, un runner maison, ou Flash comme backend pas cher derrière Codex / Claude. Un bon score de modèle n’est pas une sandbox livrée.

Facture tokens : trois façons de la calculer

Les prix font foi sur les pages officielles. Les chiffres ici suivent les listes publiques de septembre 2026 (fiche DeepMind + grilles Anthropic / Google). Changes et promos bougent ; revérifiez le budget.

Prix API (par million de tokens)

Modèle Entrée Sortie Rôle
Gemini 3.8 Flash (jusqu’au 2026-12-31) $0.75 $3.75 Batch, tâches courtes, multimodal
Gemini 3.8 Flash (à partir du 2027-01-01) $1.50 $7.50 idem, promo terminée
Claude Sonnet 5 $2 $10 Défaut Claude Code
GPT-5.6 Terra $2 $12 Quotidien Codex
GPT-5.6 Sol $4 $20 Fleuron Codex
Claude Opus 5 $5 $25 Refactors durs, agent long
Claude Fable 5 $10 $50 Très long horizon, choix explicite

Un tour d’agent moyen, ordre de grandeur 80k en entrée + 8k en sortie : Flash ≈ $0.09, Sonnet 5 ≈ $0.24, Sol ≈ $0.48, Opus 5 ≈ $0.60. Un hit de cache peut encore faire chuter l’entrée d’un ordre de grandeur. Le « pas cher » de Flash s’évapore vite à effort élevé, avec des retries, ou une fenêtre 1M remplie.

Forme des abonnements

  • Claude Code : Pro ≈ $20 / mois, Max 5x $100, 20x $200. Claude web et CLI partagent le quota. Pas de palier perso sous $20. Détails dans le guide des quotas.
  • Codex : suit ChatGPT — Free / Go (≈ $8) / Plus $20, plus 5x et 20x. La seule porte grand public où un agent terminal complet démarre sous vingt dollars.
  • Gemini 3.8 Flash : côté perso surtout API à l’usage + Google AI / Gemini Enterprise Agent Platform. La coque agent (Antigravity, Code Assist) se facture à part. Un modèle bon marché n’est pas un « poste de développement » bon marché.
Mélanger coûte souvent moins que choisir un camp
Session principale Claude Code ou Codex pour l’architecture et les bugs durs ; Flash pour générer des tests, de la doc, des scans lecture seule à grande échelle. Les modèles chers pour le jugement, les modèles bon marché pour le débit.

Efficacité : comment choisir sans se brûler

L’efficacité n’est pas un score de bench, c’est le volume de changements fiables que vous fusionnez chaque semaine.

  1. Seul, refactor profond : Claude Code + Sonnet 5, Opus sur les passages durs. Brancher Skills et MCP réduit plus les allers-retours qu’un second abonnement.
  2. Audit, sécurité par défaut, Windows natif : Codex CLI. Les règles de spawn dans le dépôt : la facture ne double pas pendant vos réunions.
  3. Pipelines, lots de nuit, multimodal (captures / enregistrements / PDF) : Gemini 3.8 Flash. 64k de sortie suffisent pour une note de patch, pas pour cracher un gros fichier d’un coup — segmentez.
  4. Équipe : mêmes MCP et mêmes portes de revue, modèles mixables. Verrouiller un seul fournisseur vous laisse à la merci d’un changement de prix ou d’un canal perso refermé.
  5. Machine : un agent doit lire le disque 24 h, lancer des tests, tenir MCP. Un portable refermé = cache mort, contexte à payer une deuxième fois. Un Mac cloud stable et peu gourmand est plus souvent le goulot caché que « encore un palier Max ».
# Même tâche : d’abord le modèle pas cher en éclaireur, puis le diff au fleuron
# Flash / Terra : script de repro et brouillon de tests
# Sonnet / Opus / Sol : relire le diff, toucher les API publiques, fermer la PR

Questions fréquentes

Gemini 3.8 Flash peut-il remplacer Claude Code tel quel ?
Non. C’est un modèle. Pour la boucle terminal, les droits et MCP, il faut encore Antigravity, un agent Gemini entreprise, ou votre runner. Brancher Flash sur une CLI multi-backend comme Codex est aujourd’hui le combo le plus courant : cerveau pas cher, coque mature.

Reste-t-il en 2026 un forfait Gemini CLI perso gratuit ?
Ne budgétez pas avec l’image de 2025. Depuis le milieu de l’année, le canal perso s’est resserré ; la communauté bascule vers Antigravity et l’API à l’usage. Code Assist entreprise reste une autre ligne. Lisez la page de licence du jour, pas un vieux billet.

Contexte à 1M partout : plus on en met, mieux c’est ?
Non. La fenêtre est un plafond, pas un objectif. Les sorties d’outils en trop et les fichiers morts tapent à la fois la qualité, la latence et la facture. Cherchez d’abord, lisez ensuite.

Terminal-bench 2.1 suffit-il pour trancher ?
Non. Sur 2.1, les trois fleurons sont quasi à égalité ; 4.0 et OSWorld montrent l’écart long terme. Script court : Flash est raisonnable. Refactor sur plusieurs semaines : Opus / Sol tiennent mieux.

Les prix bougeront-ils la semaine prochaine ?
Oui. La promo Flash court jusqu’au 31 décembre 2026 ; les $2 / $10 de Sonnet 5 sont le tarif de fond. Font foi les pages du jour chez Anthropic, OpenAI et Google Cloud.

Un agent fort a encore besoin d’une machine qui ne se referme pas

Claude Code, Codex et Gemini 3.8 Flash se comparent sur les tokens cloud, mais lire le dépôt, lancer les tests et tenir MCP se passe sur la machine devant vous. Un portable refermé coupe la session, vide le bac à sable, fait expirer le Prompt Cache : le tour suivant est facturé en entrée pleine. Un Mac mini consomme environ 4W au repos : l’agent terminal suit votre fenêtre glissante, au lieu de redémarrer à chaque clapet.

La mémoire unifiée Apple Silicon tient mieux l’indexation des gros dépôts et les tests en parallèle ; macOS apporte Unix, Homebrew, Docker et SSH, et les boucles computer-use / terminal de Claude Code et Codex tournent plus fluides. Face à un hôte Windows au même prix : moins de plantages, plus de stabilité sans surveillance ; Gatekeeper et SIP réduisent le risque d’un agent qui tourne en continu.

Si vous comptez déjà les tokens et le contexte, une machine qui ne décroche pas rapporte souvent plus qu’un palier d’abonnement — voir les forfaits et dépenser sur le code, pas sur les échauffements répétés.

Pour aller plus loin

Offre à durée limitée

Plus qu'un Mac — votre base de développement dans le cloud

Calcul dédié · Nœuds mondiaux · Abonnement mensuel · Sans matériel à acheter

Retour à l'accueil
Offre limitée Voir les offres