Kvmzen Blog
← Retour à La tech en pratique

GPT-6 Astra code-t-il vraiment si fort ? Test d’agent : vitesse, tokens, coût et taux de finition sur projet réel

La tech en pratique ·~6 min de lecture

GPT-6 Astra code-t-il vraiment si fort ? Test d’agent : vitesse, tokens, coût et taux de finition sur projet réel - Kvmzen

La page de lancement présente GPT-6 Astra comme le modèle le plus fort en code. La facture raconte autre chose : le tarif catalogue est environ 2,5× celui de la génération précédente, et l’effort va de low à max. Ce qui bloque vraiment une équipe n’est rarement « qui a deux points de plus au classement ». C’est un ticket : temps mur, tokens, fin de mois, et le premier diff est-il fusionnable.

La coquille du quotidien est souvent Codex. Pour découper les produits, voir Claude Code, Codex et Gemini 3.8 Flash en comparaison ; pour empiler l’argent, combien coûte un agent IA coding par mois. Le face-à-face avec Fable sur un même projet est dans GPT-6 Astra vs Claude Fable 5.1 : qui code vraiment mieux. Ici, on ne découpe qu’Astra en quatre axes : vitesse, tokens, coût, taux de finition.

$10/$50
Tarif catalogue / million de tokens
1.05M
Fenêtre de contexte
5 niveaux
reasoning.effort

Que mesurent vraiment les taux de finition publics ?

Les chiffres génie logiciel de la page OpenAI de septembre 2026 (coupure de connaissances 2026-04-30) ressemblent à ceci :

Éval GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0 57.9% 37.3% 55.8%
DeepSWE v1.1 74.1% 72.7% 67.4%
Tâches internes de migration de base 63.9% 42.7% 57.8%
AA Coding Agent Index 67.0 65.1

Artificial Analysis donne 62 à Astra dans Codex, à égalité avec Fable 5.1 dans Claude Code. Les chiffres peuvent coller ; les définitions non. Table officielle, harness tiers, et « tests verts plus un relecteur qui fusionne » sont trois taux de finition.

Un « pass » au classement n’est pas une barre de merge
Les évals exigent surtout un chemin reproductible et des tests verts. États vides, bords d’auth et notes de rollback entrent rarement dans le score. Lire le tableau comme « taux de finition projet réel » surestime la part livrable du premier coup.

Lire le temps mur et les niveaux d’effort

Le reasoning.effort d’Astra est low / medium / high / xhigh / max. Plus haut, plus de boucles, plus de contrôles navigateur, plus d’exécution plutôt qu’un apply-patch à l’aveugle — le temps mur et les tokens montent ensemble.

Deux autres chiffres de temps mur sur la page de lancement :

  • Après la mise à jour du harness Codex, Mind2Web finit environ 1,9× plus vite que GPT-5.6 Sol.
  • OSWorld 2.0 : Astra environ 72,6 % / 40 minutes, Sol environ 65,7 % / 75 minutes (environ 47 % de temps en moins).
  • Mode API Fast : environ 2× la vitesse standard, facturé environ 2×.

Sur le même dépôt et le même ticket « export CSV asynchrone », Astra verdit plus souvent d’abord la file, les retries et la CI ; les états vides et le texte de chargement demandent souvent un second tour. Un temps mur court n’est pas une revue en une passe.

Pourquoi volume de tokens et prix catalogue tirent à l’envers

Le tarif est passé de $4 / $20 chez Sol à $10 / $50 par million d’entrée / sortie — environ 2,5×. Lecture cache $1, écriture cache $12.50. Plus cher par token ; souvent moins de tokens pour le même travail.

Chez Artificial Analysis dans Codex en max, Astra utilise environ un tiers des tokens de Sol par tâche. Coût par tâche environ $7.09 : à peu près 40 % moins cher que Fable 5.1 à score égal, seulement ~15 % au-dessus de Sol max, avec un index plus haut. Sur l’Intelligence Index, Astra max sort environ 27k tokens ; Fable tourne souvent vers 78k.

Une règle de lecture : ne pas comparer le seul prix unitaire. Les tâches courtes, denses en exécution, peuvent absorber le sticker 2,5×. Les longues sessions qui relisent le même gros dépôt — puis déclenchent le surcoût long contexte — retournent la facture.

Que cache encore une facture de tâche unique

Ligne Échelle catalogue Quand ça double
Entrée / sortie $10 / $50 Fast ≈ ×2 sur toute la requête
Cache lu / écrit $1 / $12.50 Entrée au-delà de 272K → tarifs long contexte sur toute la requête (entrée et cache ≈ ×2, sortie ≈ ×1,5)
Siège Dans l’offre ChatGPT Crédits quand la fenêtre est pleine ; l’API n’a pas de plafond sauf si vous en posez un

Plus / Pro incluent en général un quota Astra. Ce n’est pas un max illimité. Un tour d’agent moyen qui entasse dépôt, journaux et traces d’échec dans la fenêtre tape le surcoût 272K avant la ligne à $10. Si la machine s’endort, le Prompt Cache meurt et « continuer » est facturé en entrée pleine — le réchauffage le plus inutile. Comment quatre livres s’empilent dans le mois reste dans l’article coût.

Où le taux de finition chute dans un vrai dépôt

Écrire le « taux de finition projet réel » en trois colonnes plutôt qu’un classement :

  1. Éval finie : Terminal-Bench saute fort face à Sol ; DeepSWE seulement +1,4 — les petits correctifs étaient déjà proches.
  2. Démo finie : file, auth, retries — Astra lève souvent la main plus tôt.
  3. Merge fini : états vides, états désactivés, notes de risque inter-modules demandent encore souvent une phrase humaine ou un autre tour.

Les baisses habituelles : la revue fixe l’UI ; le second tour touche des requêtes partagées ou des clés de cache sans « lecture seule d’abord, puis diff minimal » ; on coupe le contexte pour économiser des tokens et on perd une contrainte. Des retours tiers montrent aussi une migration moyenne en low en environ une demi-heure pour environ onze dollars. C’est « ça a tourné », pas « fusionner sans lire ».

Régler effort et plafonds au quotidien

  1. Par défaut medium ou high. Garder max pour les refactors transverses ; low pour explorer et écrire des scripts de repro.
  2. Ne pas faire de Fast le défaut de nuit. Correct pour une démo urgente ; un long refactor multiplie encore le prix unitaire.
  3. Rester sous 272K si possible. /clear entre tickets coûte moins cher que /compact sur un mur de logs d’échec.
  4. Garder la machine éveillée. Une heure couvercle fermé tue le cache ; le tour suivant est une entrée pleine.
  5. Noter trois colonnes. Les seuls tests verts laissent le classement gonfler le taux de finition.
# trois colonnes sur le même ticket
minutes mur | tokens entrée / sortie / cache | prêt pour la revue ?
Mesurer son dépôt avant de choisir l’effort par défaut
Copier un ticket réel de difficulté moyenne. Figer Codex et la checklist. Après deux heures, ne comparer que : tests verts, démo cliquable, PR prête à relire. Ces trois colonnes sont plus proches de « Astra code-t-il vraiment si fort » qu’une nouvelle table officielle.

Chronométrer vitesse et tokens : ne pas laisser la machine tomber en premier

Le temps mur et la facture cache d’Astra cassent quand le couvercle se ferme : session morte, bac à sable vidé, Prompt Cache expiré, le tour suivant est une entrée pleine, le surcoût 272K peut partir pour rien. Un Mac mini idle tourne autour de 4 W — assez pour laisser Codex finir à l’effort choisi, plutôt que de redémarrer avec le portable.

La mémoire unifiée Apple Silicon convient mieux à l’index d’un dépôt moyen et aux tests en parallèle. macOS embarque Unix, Homebrew, Docker et SSH : l’agent terminal saute une couche WSL. Face à une machine Windows au même prix : moins de plantages, mieux en non-surveillé, Gatekeeper et SIP sont un meilleur défaut pour un agent qui reste allumé.

Si vous allez vraiment journaliser temps mur et tokens, même SKU, couvercle ouvert — voir les offres, et laisser l’écart sur le modèle et le curseur d’effort, pas sur le sommeil et le réchauffage.

Pour aller plus loin

Offre à durée limitée

Plus qu'un Mac — votre base de développement dans le cloud

Calcul dédié · Nœuds mondiaux · Abonnement mensuel · Sans matériel à acheter

Retour à l'accueil
Offre limitée Voir les offres