Deux ou trois agents de code ouverts dans le même terminal, ce n’est plus rare. Les noms sont connus : Claude Code, Codex, Gemini 3.8 Flash. Les comparer à « qui complète mieux une ligne », c’est souvent choisir le mauvais outil.
Les deux premiers sont des produits agents, capables de tourner en boucle. Flash est d’abord un modèle : sans CLI ou Antigravity, il ne travaille pas. Les tests passent-ils, la facture explose-t-elle avec le contexte, les outils se branchent-ils vraiment : ça ne se tranche pas en un paragraphe d’ouverture. Les sections suivantes le déplient.
Quotas et forfaits : voir le guide complet des quotas et limites Claude Code 2026. Si vous hésitez encore entre abonnement IDE et agent CLI, lisez les alternatives moins chères à Cursor en 2026.
D’abord aligner : vous ne comparez pas la même sorte de chose
| Votre priorité | Plutôt choisir | Pourquoi |
|---|---|---|
| Refactor multi-fichiers, longues tâches, peu de retours | Claude Code | Sous-agents matures ; Opus 5 mène nettement les benches d’agent généraux |
| Auditable et sandboxé par défaut, open source | Codex CLI | Apache-2.0, réseau coupé par défaut, sous-agents levés explicitement |
| Gros volume, multimodal, tokens unitaires au plus bas | Gemini 3.8 Flash | Prix promo ≈ 1/3 de Sonnet 5 ; très solide sur le SWE court |
Il n’y a pas de « premier partout ». DeepMind le dit dans la fiche modèle Gemini 3.8 Flash (septembre 2026) : Flash frôle les fleurons sur l’ingénierie logicielle courte, mais reste derrière Opus 5 sur les tâches d’agent générales plus longues.
Qualité de code : courte et longue distance, même compétence ?
Découpez « qualité de code » en deux couches : corriger les bons fichiers en une passe (le patch compile et passe les tests) et finir la tâche d’une session à l’autre (sans dériver ni toucher des modules hors sujet).
Comparaison publique de la fiche DeepMind (septembre 2026) :
| Bench | Ce qui est mesuré | Gemini 3.8 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|
| DeepSWE v1.1 | Génie logiciel long | 73.7% | 74.0% | 53.8% | 72.7% | 69.6% |
| Terminal-bench 2.1 | Écrire du code dans le terminal | 89.4% | 89.1% | 80.4% | 88.8% | 87.4% |
| Terminal-bench 4.0 | Agent plus général | 19.1% | 51.8% | 12.4% | 37.3% | 23.6% |
| OSWorld-2.0 | Piloter un ordinateur | 59.0% | 75.4% | 42.6% | 62.6% | 50.2% |
Lecture :
- Patches du quotidien, scripts terminal, dépôts moyens : Flash, Opus 5 et GPT-5.6 Sol sont sur le même palier. Flash est même un peu devant sur Terminal-bench 2.1.
- Outils multiples, plusieurs sessions, planification autonome : Opus 5 hisse Terminal-bench 4.0 à 51.8 %, Sol à 37.3 %, Flash à 19.1 % seulement. C’est la version chiffrée de « le modèle pas cher écrit des fonctions, il ne tient pas le rôle de chef de projet ».
- Sonnet 5 reste le cheval de trait par défaut de Claude Code : prix unitaire bas, contexte 1M natif, mais DeepSWE à 53.8 % seulement. Pour un refactor dur, basculez explicitement vers Opus ; n’attendez pas du modèle par défaut un travail de fleuron.
Au feeling, Claude Code casse moins souvent B en corrigeant A. Codex est très stable en ligne de commande et sur les scripts multi-étapes, et le bac à sable par défaut vous laisse oser les tests. Gemini 3.8 Flash est rapide, bon marché, fort en multimodal — sur une longue chaîne, il lâche plus facilement l’objectif. Coupez les tâches, ou montez le thinking effort.
Context : une fois la fenêtre assez grande, où va l’argent
| Produit | Contexte du modèle par défaut | Sortie max | Tarification long contexte |
|---|---|---|---|
| Claude Code (Sonnet 5 / Opus 5) | 1M (natif API) | 128k | Pas de surcoût long contexte annoncé |
| Codex (GPT-5.6) | environ 1.05M | 128k | Au-delà d’environ 272k en entrée, certains paliers majorent |
| Gemini 3.8 Flash | 1,048,576 | 64k | Promo au même prix unitaire ; à partir de 2027, tarif standard doublé |
Le chiffre de fenêtre n’est plus un argument de vente. Ce qui brûle l’argent : renvoyer à chaque requête l’historique, les sorties d’outils et les tranches de dépôt.
- Claude Code : plus le dialogue s’allonge, plus ça coûte ;
/clearest moins cher que/compact. Skills, résultats MCP et journaux de tests entrent dans la session principale. L’un des intérêts des sous-agents : laisser le bruit de recherche dans la sous-fenêtre et ne remonter qu’un résumé. - Codex : spawn explicite des sous-agents, session principale plus propre, tokens plus prévisibles ; à vous d’écrire clairement « combien, pour quoi ».
- Gemini 3.8 Flash : fenêtre 1M + effort réglable (
low/medium/high). Plus l’effort monte, plus les tokens de réflexion et la latence montent. Coupure de connaissances vers mars 2026 : les API de libs récentes passent encore par la recherche ou MCP ; ne supposez pas que le modèle « sait tout ».
N’enfournez pas un gros dépôt entier. Balayez d’abord en lecture seule avec Explore / explorer, puis laissez l’agent principal toucher les fichiers critiques. Pour l’isolation en parallèle : guide Parallel AI Coding.
MCP : le protocole est commun, les pièges non
Les trois parlent Model Context Protocol. En 2026, la question n’est plus « MCP ou pas », mais : qui a l’écosystème le plus profond, qui se configure sans piège, et vos serveurs survivront-ils au prochain changement de gamme.
| Claude Code | Codex CLI | Pile autour de Gemini 3.8 Flash | |
|---|---|---|---|
| Branchement | claude mcp add (http / stdio ; SSE obsolète) |
config.toml |
settings.json / plugins Antigravity |
| Écosystème | le plus profond (initiateur du protocole) | Suffisant, plutôt ingénierie | Branchable, plus complet côté entreprise |
| Extensions | Skills, Hooks, Plugins | Skills, mode exec, backend de modèle interchangeable | Skills / Hooks / Subagents migrent vers Antigravity |
Claude Code reste le chemin de moindre résistance pour brancher d’abord GitHub, des bases et des API internes. L’atout Codex : une config versionnable, auditable, pointable vers n’importe quel backend compatible Chat Completions / Responses — si un modèle disparaît, la chaîne ne meurt pas. Côté Gemini, le développeur individuel doit séparer : modèle pas cher ≠ produit agent stable. Après le resserrement des forfaits personnels Gemini CLI à la mi-2026, la communauté a basculé vers Antigravity ; la surface d’extensions est encore là, mais le duo « CLI open source + endpoint subventionné » est défait. Si votre feuille de route mise encore sur une grande version Gemini, voir Gemini 4 vaut-il la peine d’attendre.
Sous-agents : deux façons d’appeler de l’aide
Les deux camps font « orchestrateur + sous-agents », avec des philosophies opposées.
Claude Code traite les sous-agents comme des citoyens de premier rang : Explore, Plan et workers génériques ont leur contexte, leur liste blanche d’outils et leurs droits. L’agent principal délègue tout seul d’après la description ; vous n’avez pas à écrire « ouvre un explorateur ». Les sous-agents d’arrière-plan continuent, et peuvent passer dans un worktree dédié. Vous économisez le bruit de recherche dans la fenêtre principale ; vous payez des tokens — officiellement, une équipe d’agents en mode plan peut coûter plusieurs fois une session normale. Les rôles custom vivent en frontmatter YAML, même logique de distribution que les Skills.
Codex n’ouvre pas de processus enfants par défaut. Il faut écrire dans le prompt : « à chaque checkpoint, spawn un agent ». Explorer est plutôt lecture seule, combinable avec sandbox_mode. Avantage : coût prévisible, parallèle que vous bornez. Inconvénient : une phrase oubliée, et il ne fait que chercher lentement dans la session principale.
Gemini 3.8 Flash n’est pas un runtime. Antigravity / Managed Agents annoncent Skills, Hooks et Subagents, mais maturité et profondeur de doc restent en retrait de Claude Code. Brancher Flash sur un orchestrateur maison (ou le multi-backend Codex) est souvent plus contrôlable : le travail cher à Opus / Sol, les scans de dépôt en masse à Flash.
# Claude Code : répartition implicite dans la session principale
Agent principal (Opus / Sonnet)
├─ Explore (Haiku, lecture seule) → résumé seulement
├─ Plan → plan, pas de fichiers de prod directs
└─ Implémentation / vérif → contexte isolé, fond si besoin
# Codex : ça ne démarre que si vous le nommez
Session principale (GPT-5.6 Terra / Sol)
└─ Vous écrivez “spawn explorer + reviewer”
└─ Le sous-agent livre, la session principale tranche
Terminal : peut-on lui laisser taper des commandes
La productivité d’un agent = le nombre de fois où il lance vraiment pytest, npm test, git. Le risque est au même endroit.
| Question | Claude Code | Codex CLI | Pile Gemini 3.8 Flash |
|---|---|---|---|
| Bac à sable par défaut | Seatbelt / bubblewrap | activé par défaut, seccomp sous Linux | selon l’agent hôte ; le modèle ne gère pas les processus |
| Réseau par défaut | nouveaux domaines à approuver | coupé par défaut | selon Antigravity / votre runtime |
| Windows | via WSL2 | bac à sable natif ou WSL2 | selon le produit |
| Noyau open source | non (dépôt de release + plugins) | oui, Apache-2.0, Rust | modèle fermé ; l’ancienne Gemini CLI est ouverte, le canal perso s’est resserré |
Le réseau coupé par défaut de Codex est, en 2026, le durcissement de sécurité le plus franc : sans Internet, l’agent a du mal à coller un .env sur une machine inconnue. Claude Code est plus souple — autorisation par domaine, adapté à la doc et aux paquets au quotidien — mais Anthropic a écrit que le proxy ne termine pas le TLS, un contournement par domain fronting reste possible. En entreprise, posez un proxy inspectable.
Gemini 3.8 Flash à 89.4 % sur Terminal-bench 2.1 : le modèle sait se servir du terminal. S’il fait n’importe quoi sur votre machine dépend de l’enveloppe : Antigravity, un runner maison, ou Flash comme backend pas cher derrière Codex / Claude. Un bon score de modèle n’est pas une sandbox livrée.
Facture tokens : trois façons de la calculer
Les prix font foi sur les pages officielles. Les chiffres ici suivent les listes publiques de septembre 2026 (fiche DeepMind + grilles Anthropic / Google). Changes et promos bougent ; revérifiez le budget.
Prix API (par million de tokens)
| Modèle | Entrée | Sortie | Rôle |
|---|---|---|---|
| Gemini 3.8 Flash (jusqu’au 2026-12-31) | $0.75 | $3.75 | Batch, tâches courtes, multimodal |
| Gemini 3.8 Flash (à partir du 2027-01-01) | $1.50 | $7.50 | idem, promo terminée |
| Claude Sonnet 5 | $2 | $10 | Défaut Claude Code |
| GPT-5.6 Terra | $2 | $12 | Quotidien Codex |
| GPT-5.6 Sol | $4 | $20 | Fleuron Codex |
| Claude Opus 5 | $5 | $25 | Refactors durs, agent long |
| Claude Fable 5 | $10 | $50 | Très long horizon, choix explicite |
Un tour d’agent moyen, ordre de grandeur 80k en entrée + 8k en sortie : Flash ≈ $0.09, Sonnet 5 ≈ $0.24, Sol ≈ $0.48, Opus 5 ≈ $0.60. Un hit de cache peut encore faire chuter l’entrée d’un ordre de grandeur. Le « pas cher » de Flash s’évapore vite à effort élevé, avec des retries, ou une fenêtre 1M remplie.
Forme des abonnements
- Claude Code : Pro ≈ $20 / mois, Max 5x $100, 20x $200. Claude web et CLI partagent le quota. Pas de palier perso sous $20. Détails dans le guide des quotas.
- Codex : suit ChatGPT — Free / Go (≈ $8) / Plus $20, plus 5x et 20x. La seule porte grand public où un agent terminal complet démarre sous vingt dollars.
- Gemini 3.8 Flash : côté perso surtout API à l’usage + Google AI / Gemini Enterprise Agent Platform. La coque agent (Antigravity, Code Assist) se facture à part. Un modèle bon marché n’est pas un « poste de développement » bon marché.
Efficacité : comment choisir sans se brûler
L’efficacité n’est pas un score de bench, c’est le volume de changements fiables que vous fusionnez chaque semaine.
- Seul, refactor profond : Claude Code + Sonnet 5, Opus sur les passages durs. Brancher Skills et MCP réduit plus les allers-retours qu’un second abonnement.
- Audit, sécurité par défaut, Windows natif : Codex CLI. Les règles de spawn dans le dépôt : la facture ne double pas pendant vos réunions.
- Pipelines, lots de nuit, multimodal (captures / enregistrements / PDF) : Gemini 3.8 Flash. 64k de sortie suffisent pour une note de patch, pas pour cracher un gros fichier d’un coup — segmentez.
- Équipe : mêmes MCP et mêmes portes de revue, modèles mixables. Verrouiller un seul fournisseur vous laisse à la merci d’un changement de prix ou d’un canal perso refermé.
- Machine : un agent doit lire le disque 24 h, lancer des tests, tenir MCP. Un portable refermé = cache mort, contexte à payer une deuxième fois. Un Mac cloud stable et peu gourmand est plus souvent le goulot caché que « encore un palier Max ».
# Même tâche : d’abord le modèle pas cher en éclaireur, puis le diff au fleuron
# Flash / Terra : script de repro et brouillon de tests
# Sonnet / Opus / Sol : relire le diff, toucher les API publiques, fermer la PR
Questions fréquentes
Gemini 3.8 Flash peut-il remplacer Claude Code tel quel ?
Non. C’est un modèle. Pour la boucle terminal, les droits et MCP, il faut encore Antigravity, un agent Gemini entreprise, ou votre runner. Brancher Flash sur une CLI multi-backend comme Codex est aujourd’hui le combo le plus courant : cerveau pas cher, coque mature.
Reste-t-il en 2026 un forfait Gemini CLI perso gratuit ?
Ne budgétez pas avec l’image de 2025. Depuis le milieu de l’année, le canal perso s’est resserré ; la communauté bascule vers Antigravity et l’API à l’usage. Code Assist entreprise reste une autre ligne. Lisez la page de licence du jour, pas un vieux billet.
Contexte à 1M partout : plus on en met, mieux c’est ?
Non. La fenêtre est un plafond, pas un objectif. Les sorties d’outils en trop et les fichiers morts tapent à la fois la qualité, la latence et la facture. Cherchez d’abord, lisez ensuite.
Terminal-bench 2.1 suffit-il pour trancher ?
Non. Sur 2.1, les trois fleurons sont quasi à égalité ; 4.0 et OSWorld montrent l’écart long terme. Script court : Flash est raisonnable. Refactor sur plusieurs semaines : Opus / Sol tiennent mieux.
Les prix bougeront-ils la semaine prochaine ?
Oui. La promo Flash court jusqu’au 31 décembre 2026 ; les $2 / $10 de Sonnet 5 sont le tarif de fond. Font foi les pages du jour chez Anthropic, OpenAI et Google Cloud.
Un agent fort a encore besoin d’une machine qui ne se referme pas
Claude Code, Codex et Gemini 3.8 Flash se comparent sur les tokens cloud, mais lire le dépôt, lancer les tests et tenir MCP se passe sur la machine devant vous. Un portable refermé coupe la session, vide le bac à sable, fait expirer le Prompt Cache : le tour suivant est facturé en entrée pleine. Un Mac mini consomme environ 4W au repos : l’agent terminal suit votre fenêtre glissante, au lieu de redémarrer à chaque clapet.
La mémoire unifiée Apple Silicon tient mieux l’indexation des gros dépôts et les tests en parallèle ; macOS apporte Unix, Homebrew, Docker et SSH, et les boucles computer-use / terminal de Claude Code et Codex tournent plus fluides. Face à un hôte Windows au même prix : moins de plantages, plus de stabilité sans surveillance ; Gatekeeper et SIP réduisent le risque d’un agent qui tourne en continu.
Si vous comptez déjà les tokens et le contexte, une machine qui ne décroche pas rapporte souvent plus qu’un palier d’abonnement — voir les forfaits et dépenser sur le code, pas sur les échauffements répétés.