La page de lancement présente GPT-6 Astra comme le modèle le plus fort en code. La facture raconte autre chose : le tarif catalogue est environ 2,5× celui de la génération précédente, et l’effort va de low à max. Ce qui bloque vraiment une équipe n’est rarement « qui a deux points de plus au classement ». C’est un ticket : temps mur, tokens, fin de mois, et le premier diff est-il fusionnable.
La coquille du quotidien est souvent Codex. Pour découper les produits, voir Claude Code, Codex et Gemini 3.8 Flash en comparaison ; pour empiler l’argent, combien coûte un agent IA coding par mois. Le face-à-face avec Fable sur un même projet est dans GPT-6 Astra vs Claude Fable 5.1 : qui code vraiment mieux. Ici, on ne découpe qu’Astra en quatre axes : vitesse, tokens, coût, taux de finition.
Que mesurent vraiment les taux de finition publics ?
Les chiffres génie logiciel de la page OpenAI de septembre 2026 (coupure de connaissances 2026-04-30) ressemblent à ceci :
| Éval | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| Tâches internes de migration de base | 63.9% | 42.7% | 57.8% |
| AA Coding Agent Index | 67.0 | 65.1 | — |
Artificial Analysis donne 62 à Astra dans Codex, à égalité avec Fable 5.1 dans Claude Code. Les chiffres peuvent coller ; les définitions non. Table officielle, harness tiers, et « tests verts plus un relecteur qui fusionne » sont trois taux de finition.
Lire le temps mur et les niveaux d’effort
Le reasoning.effort d’Astra est low / medium / high / xhigh / max. Plus haut, plus de boucles, plus de contrôles navigateur, plus d’exécution plutôt qu’un apply-patch à l’aveugle — le temps mur et les tokens montent ensemble.
Deux autres chiffres de temps mur sur la page de lancement :
- Après la mise à jour du harness Codex, Mind2Web finit environ 1,9× plus vite que GPT-5.6 Sol.
- OSWorld 2.0 : Astra environ 72,6 % / 40 minutes, Sol environ 65,7 % / 75 minutes (environ 47 % de temps en moins).
- Mode API Fast : environ 2× la vitesse standard, facturé environ 2×.
Sur le même dépôt et le même ticket « export CSV asynchrone », Astra verdit plus souvent d’abord la file, les retries et la CI ; les états vides et le texte de chargement demandent souvent un second tour. Un temps mur court n’est pas une revue en une passe.
Pourquoi volume de tokens et prix catalogue tirent à l’envers
Le tarif est passé de $4 / $20 chez Sol à $10 / $50 par million d’entrée / sortie — environ 2,5×. Lecture cache $1, écriture cache $12.50. Plus cher par token ; souvent moins de tokens pour le même travail.
Chez Artificial Analysis dans Codex en max, Astra utilise environ un tiers des tokens de Sol par tâche. Coût par tâche environ $7.09 : à peu près 40 % moins cher que Fable 5.1 à score égal, seulement ~15 % au-dessus de Sol max, avec un index plus haut. Sur l’Intelligence Index, Astra max sort environ 27k tokens ; Fable tourne souvent vers 78k.
Une règle de lecture : ne pas comparer le seul prix unitaire. Les tâches courtes, denses en exécution, peuvent absorber le sticker 2,5×. Les longues sessions qui relisent le même gros dépôt — puis déclenchent le surcoût long contexte — retournent la facture.
Que cache encore une facture de tâche unique
| Ligne | Échelle catalogue | Quand ça double |
|---|---|---|
| Entrée / sortie | $10 / $50 | Fast ≈ ×2 sur toute la requête |
| Cache lu / écrit | $1 / $12.50 | Entrée au-delà de 272K → tarifs long contexte sur toute la requête (entrée et cache ≈ ×2, sortie ≈ ×1,5) |
| Siège | Dans l’offre ChatGPT | Crédits quand la fenêtre est pleine ; l’API n’a pas de plafond sauf si vous en posez un |
Plus / Pro incluent en général un quota Astra. Ce n’est pas un max illimité. Un tour d’agent moyen qui entasse dépôt, journaux et traces d’échec dans la fenêtre tape le surcoût 272K avant la ligne à $10. Si la machine s’endort, le Prompt Cache meurt et « continuer » est facturé en entrée pleine — le réchauffage le plus inutile. Comment quatre livres s’empilent dans le mois reste dans l’article coût.
Où le taux de finition chute dans un vrai dépôt
Écrire le « taux de finition projet réel » en trois colonnes plutôt qu’un classement :
- Éval finie : Terminal-Bench saute fort face à Sol ; DeepSWE seulement +1,4 — les petits correctifs étaient déjà proches.
- Démo finie : file, auth, retries — Astra lève souvent la main plus tôt.
- Merge fini : états vides, états désactivés, notes de risque inter-modules demandent encore souvent une phrase humaine ou un autre tour.
Les baisses habituelles : la revue fixe l’UI ; le second tour touche des requêtes partagées ou des clés de cache sans « lecture seule d’abord, puis diff minimal » ; on coupe le contexte pour économiser des tokens et on perd une contrainte. Des retours tiers montrent aussi une migration moyenne en low en environ une demi-heure pour environ onze dollars. C’est « ça a tourné », pas « fusionner sans lire ».
Régler effort et plafonds au quotidien
- Par défaut medium ou high. Garder max pour les refactors transverses ; low pour explorer et écrire des scripts de repro.
- Ne pas faire de Fast le défaut de nuit. Correct pour une démo urgente ; un long refactor multiplie encore le prix unitaire.
- Rester sous 272K si possible.
/clearentre tickets coûte moins cher que/compactsur un mur de logs d’échec. - Garder la machine éveillée. Une heure couvercle fermé tue le cache ; le tour suivant est une entrée pleine.
- Noter trois colonnes. Les seuls tests verts laissent le classement gonfler le taux de finition.
# trois colonnes sur le même ticket
minutes mur | tokens entrée / sortie / cache | prêt pour la revue ?
Chronométrer vitesse et tokens : ne pas laisser la machine tomber en premier
Le temps mur et la facture cache d’Astra cassent quand le couvercle se ferme : session morte, bac à sable vidé, Prompt Cache expiré, le tour suivant est une entrée pleine, le surcoût 272K peut partir pour rien. Un Mac mini idle tourne autour de 4 W — assez pour laisser Codex finir à l’effort choisi, plutôt que de redémarrer avec le portable.
La mémoire unifiée Apple Silicon convient mieux à l’index d’un dépôt moyen et aux tests en parallèle. macOS embarque Unix, Homebrew, Docker et SSH : l’agent terminal saute une couche WSL. Face à une machine Windows au même prix : moins de plantages, mieux en non-surveillé, Gatekeeper et SIP sont un meilleur défaut pour un agent qui reste allumé.
Si vous allez vraiment journaliser temps mur et tokens, même SKU, couvercle ouvert — voir les offres, et laisser l’écart sur le modèle et le curseur d’effort, pas sur le sommeil et le réchauffage.
