La semaine après le DevDay, le fil n’est pas « Astra a gagné ». Ce sont trois captures de console : l’Agents API d’OpenAI, le tarif cache Fable d’Anthropic, le compte à rebours promo Flash de Google. Le même ticket « ajouter un export à l’admin » reçoit $10/$50 d’un côté et $0.75 de l’autre. La finance demande si la facture de fin de mois va différer d’un ordre de grandeur.
La page modèle, la page agent et la page sièges sont souvent trois factures. Pour découper les coques produit, voir Claude Code, Codex et Gemini 3.8 Flash ; pour l’horloge et les tokens d’Astra, voir le test de code GPT-6 Astra. Ici, seulement l’API : prix, vitesse, capacité Agent — et pourquoi on ne peut pas les lire séparément.
Après cette vague, quelles factures l’API compare-t-elle
En septembre 2026, le public a vu au moins ceci se superposer : gpt-6-astra dans l’API ainsi qu’Azure / Bedrock ; l’Agents API en bêta publique le 10 septembre (harness Codex hébergé, pas de frais d’interface en plus, facturation tokens et outils) ; Anthropic baisse les lectures cache Fable 5.1 à $0.25 ; Gemini 3.8 Flash affiche le tarif d’intro jusqu’au 2026-12-31. Le canevas Agent Builder s’arrête le 30 novembre — migrer vers l’Agents SDK.
Ne pas commencer par « qui est plus intelligent ». Aligner d’abord la forme de la facture :
| Grand livre | OpenAI | Anthropic | |
|---|---|---|---|
| API modèle | Astra / Sol / Terra au token | Fable / Opus / Sonnet au token | Flash au token (sièges à part) |
| Cache | Lecture $1, écriture $12.50 ; surcoût sur toute la requête au-delà de 272K | Lectures Fable 5.1 $0.25 | Cache pris en charge, toujours très sous le flagship |
| Runtime Agent | Agents API : bac à sable, MCP, compaction, sous-agents | Boucle d’outils Claude Code / Messages | Antigravity, Managed Agents |
| Extras | Computer use par appel d’outil ; Fast environ ×2 | Opus Fast (aperçu, pas Fable) | Niveau de réflexion et tours d’outils gonflent les tokens |
Les chiffres suivent les tarifs publics de septembre 2026. Change, taxe, promos bougent — revérifier la page vendeur avant d’acheter.
Le prix unitaire est-il le coût d’une tâche finie
Par million de tokens (entrée / sortie) :
| Modèle | Entrée | Sortie | Lecture cache | À lire d’abord |
|---|---|---|---|---|
| Gemini 3.8 Flash (jusqu’au 2026-12-31) | $0.75 | $3.75 | Très sous le flagship | $1.50 / $7.50 à partir du 2027-01-01 |
| GPT-5.6 Terra | $2 | $12 | — | Palier quotidien Codex / API |
| Claude Sonnet 5 | $2 | $10 | 0,1× entrée | Point de départ par défaut pour la plupart du code |
| GPT-5.6 Sol | $4 | $20 | — | Flagship précédent |
| Claude Opus 5 | $5 | $25 | 0,1× entrée | Anthropic : « commencez par ça pour la plupart des travaux » |
| GPT-6 Astra | $10 | $50 | $1 | Au-delà de 272K : entrée/cache ~×2, sortie ~×1,5 ; Fast ×2 |
| Claude Fable 5.1 | $10 | $50 | $0.25 | Écriture cache 5 min $12.50 ; 1 h $20 |
Un tour moyen à 80k in + 8k out fait environ $0.09 Flash, $0.24 Sonnet, $0.26 Terra, $0.48 Sol, $0.60 Opus, $1.20 Astra / Fable. Un agent tire rarement une seule fois. Hits de cache, crans de réflexion et tours d’outils séparent « pas cher au token » et « pas cher au ticket ».
Le tarif d’intro Flash vaut environ un treizième du sticker flagship. Ce n’est pas « Claude gratuit ». Google le dit : sur le travail dur, 3.8 ajoute des pas de raisonnement et des tours d’outils. Un cerveau bon marché + des outils denses peut encore approcher un modèle milieu de gamme en tokens. Pour empiler abonnement, API et machine sur un mois, voir combien coûte vraiment un agent de code IA par mois.
Où vit vraiment l’horloge murale
Les trois cachent « plus vite » dans des crans, pas dans le nom du modèle.
- Astra :
reasoning.effortvaut low / medium / high / xhigh / max (pas denone). Plus le cran est haut, plus il aime les tours et les contrôles navigateur. Fast API ≈ 2× horloge et 2× tarif. Sur la page de lancement, OSWorld 2.0 : Astra environ 72,6 % / 40 minutes, Sol environ 65,7 % / 75 minutes. - Fable 5.1 : le tableau officiel est plus lent qu’Opus 5 et Sonnet 5 ; la réflexion est adaptative, défaut
high. On achète le jugement longue distance, pas le premier token. - Flash : premier octet classe Flash ; réflexion low / medium / high (
minimalerreur). Le quotidien en low baisse horloge et tokens ensemble ; sur les tâches dures, il ajoute des tours tout seul.
Un premier token rapide n’est pas un ticket fini. Astra verdit plus souvent la file et la CI d’abord, les états vides demandent souvent un second passage ; Fable économise plus souvent une réécriture UI et notes de risque. Le même projet face à face : GPT-6 Astra vs Claude Fable 5.1 sur le même projet.
Capacité Agent : séparer le modèle, la coque et le runtime hébergé
Choisir une API en 2026, c’est au moins trois couches :
- Modèle : change-t-il les bons fichiers, reste-t-il dans le périmètre, n’explose-t-il pas le dépôt dans le contexte.
- Coque : Codex, Claude Code, Antigravity — les défauts de droits, bac à sable, MCP et sous-agents diffèrent.
- Runtime hébergé : l’Agents API accroche le harness Codex à un appel HTTP ; vous choisissez bac à sable ou machine à vous, OpenAI orchestre, compacte, reprend. Pas de frais d’interface en plus ; computer use et outils similaires à part.
OpenAI ajoute deux frottements : les outils exigent l’Responses API (Chat Completions ne suffit pas) ; le monitoring de désalignement en prod peut arrêter net une tâche API, pas seulement demander confirmation. Le computer use d’Astra est fort sur Agents' Last Exam et OSWorld — formulaires, CRM, QA navigateur. Le cyber atteint Critical : revue défensive oui, demandes d’exploit avancées non.
L’avantage restant de Claude est encore MCP + économie de cache + prudence longue distance. Celui de Gemini est débit bon marché + agents gérés, mais les sièges Code Assist / Enterprise sont une deuxième ligne. Brancher Flash dans une coque multi-backends comme Codex, c’est le classique « cerveau pas cher + boucle mature ».
# Découpage courant d’un ticket (pas le seul)
Flash / Terra / Sonnet → explorer, tests, balayage lecture seule
Sol / Opus → changer une API publique, fermer le diff
Astra / Fable 5.1 → inter-modules, nuit, artefacts ou cache
Agents API / Claude Code → hébergé seulement si bac à sable + reprise
Composer selon la tâche, pas selon le camp
| Ce que vous faites | Palier API à essayer d’abord |
|---|---|
| Lots courts, multimodal, balayages de docs | Gemini 3.8 Flash, thinking=low |
| Modifs API du quotidien, tests, clôture de PR | Sonnet 5 ou Terra ; Sol / Opus si besoin |
| Refactors inter-modules, agents de nuit | Fable 5.1 (cache) ou Astra (computer use / docs pro) |
| Formulaires navigateur, bureau, QA de site | Astra + Responses / Agents API |
| Une facture prévisible | Défaut bon marché + plafond API mensuel ; un abonnement s’arrête au mur, une API facture au mur |
Quelques points qui n’entrent pas dans un tableau et transpercent quand même un budget :
- Déjà payer ChatGPT Plus / Claude Pro, puis ouvrir une API sans plafond pour le même agent, c’est compter deux fois.
- Astra Fast + au-delà de 272K se multiplie ; une grande fenêtre n’autorise pas à coller le dépôt.
- Les workflows Agent Builder doivent passer à l’Agents SDK avant le 30 novembre. Le canevas n’est pas une architecture durable.
- Mélanger est souvent moins cher que choisir un camp : une coque pour les bugs durs, Flash pour le débit, un flagship ami du cache la nuit.
FAQ
Astra et Fable 5.1 ont le même sticker. On prend n’importe lequel ?
Même sticker, seconde lecture de contexte différente. Sur les longues sessions et les balayages répétés, regarder d’abord les lectures cache. S’il faut computer use, artefacts pro ou le harness Codex / Agents API, regarder Astra.
Gemini 3.8 Flash peut-il être le défaut de production ?
Oui comme défaut de débit, surtout jusqu’à fin 2026. Sur les tâches dures il ajoute des tours tout seul : une tâche n’est pas toujours la moins chère. La boucle terminal, les droits et le MCP ont encore besoin d’une coque. Code Assist personnel s’est resserré — ne pas budgéter sur le souvenir gratuit de 2025.
Faut-il basculer tout de suite sur l’Agents API ?
Si vous voulez un bac à sable cloud, une reprise de session et ne plus nourrir un harness, un pilote vaut le coup. Pas de frais d’interface en plus, mais tokens, outils et un moniteur qui peut stopper une tâche comptent. Un travail long déjà fluide dans Claude Code n’a pas à déménager parce que le DevDay a livré une nouvelle API.
Une API bon marché a encore besoin d’une machine qui reste ouverte
Les tokens se calculent dans le cloud ; le dépôt, les tests, le MCP et le bac à sable tournent sur la machine devant vous. Fermer le portable tue la session, expire le prompt cache, et « continuer » est facturé en entrée pleine — Astra surtaxe aussi toute la requête au-delà de 272K. Un Mac mini tourne à environ 4W en veille, pour que l’agent travaille contre votre fenêtre glissante plutôt que de redémarrer avec le capot.
La mémoire unifiée Apple Silicon indexe mieux un gros dépôt et les tests en parallèle ; macOS embarque Unix, Homebrew, Docker et SSH, donc Codex, Claude Code et une boucle Agents maison sautent une couche WSL. Face à un Windows au même prix : moins de plantages, runs sans surveillance plus stables, Gatekeeper et SIP pour une machine qui reste allumée avec un agent dessus.
Si vous rabotez déjà tarifs et cache sur trois API, garder la machine éveillée est souvent un meilleur achat qu’un palier flagship de plus—voir les offres et dépenser l’argent à changer du code, pas à se réchauffer.
