Die Launch-Seite nennt GPT-6 Astra das stärkste Coding-Modell. Die Rechnung erzählt etwas anderes: der Listenpreis liegt etwa 2,5× über der Vorgängergeneration, der Effort läuft von low bis max. Was Teams wirklich stoppt, ist selten „wer steht zwei Punkte höher“. Es ist ein Ticket: Wanduhr, Tokens, Monatsende – und ob der erste Diff mergebar ist.
Die Alltagsschale ist meist Codex. Wie sich die Produkte teilen, steht unter Claude Code, Codex und Gemini 3.8 Flash im Vergleich; wie sich das Geld stapelt, unter Was kostet ein AI Coding Agent pro Monat. Der direkte Vergleich mit Fable an einem Projekt liegt in GPT-6 Astra vs Claude Fable 5.1: wer kann wirklich besser code. Hier zerlegen wir nur Astra in vier Achsen: Tempo, Tokens, Kosten, Abschlussrate.
Was messen öffentliche Abschlussraten wirklich?
Die Software-Engineering-Zahlen auf der OpenAI-Launchseite vom September 2026 (Knowledge-Cutoff 2026-04-30) sehen ungefähr so aus:
| Eval | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| Interne DB-Migrationsaufgaben | 63.9% | 42.7% | 57.8% |
| AA Coding Agent Index | 67.0 | 65.1 | — |
Artificial Analysis gibt Astra in Codex 62, gleichauf mit Fable 5.1 in Claude Code. Die Zahlen können passen, die Definitionen nicht. Offizielle Tabelle, fremdes Harness und „Tests grün plus Reviewer mergen“ sind drei Abschlussraten.
Wanduhr und Effort-Stufen lesen
Astras reasoning.effort ist low / medium / high / xhigh / max. Höherer Effort heißt mehr Schleifen, mehr Browser-Checks, mehr Ausführen statt blindem apply-patch – Wanduhr und Tokens steigen gemeinsam.
Zwei weitere Wanduhr-Zahlen von der Launchseite:
- Nach dem Codex-Harness-Update ist Mind2Web etwa 1,9× schneller fertig als GPT-5.6 Sol.
- OSWorld 2.0: Astra etwa 72,6 % / 40 Minuten, Sol etwa 65,7 % / 75 Minuten (etwa 47 % weniger Zeit).
- API-Fast: etwa 2× Standardtempo, etwa 2× Preis.
Im selben Repo und demselben Ticket „asynchroner CSV-Export“ macht Astra Queue, Retries und CI oft zuerst grün; Leerzustände und Ladehinweise brauchen meist eine zweite Runde. Kurze Wanduhr heißt nicht ein Durchgang im Review.
Warum Tokenmenge und Listenpreis gegeneinander ziehen
Der Listenpreis stieg von Sols $4 / $20 auf $10 / $50 je Million Input / Output – etwa 2,5×. Cache-Lesen $1, Cache-Schreiben $12.50. Teurer pro Token; oft weniger Tokens für dieselbe Arbeit.
Bei Artificial Analysis in Codex auf max nutzt Astra etwa ein Drittel der Sol-Tokens pro Aufgabe. Kosten pro Task etwa $7.09: rund 40 % günstiger als Fable 5.1 bei gleichem Score, nur etwa 15 % über Sol max, mit höherem Index. Im Intelligence Index liegen Astra max bei etwa 27k Output-Tokens, Fable oft nahe 78k.
Eine Lese regel: nicht nur den Stückpreis vergleichen. Kurze, ausführungsdichte Jobs können den 2,5×-Sticker auffressen. Lange Sessions, die dasselbe große Repo immer wieder lesen – und dann den Long-Context-Aufschlag auslösen – drehen die Rechnung um.
Was steckt sonst in der Einzelaufgaben-Rechnung
| Position | Öffentliche Listenskala | Wann es sich verdoppelt |
|---|---|---|
| Input / Output | $10 / $50 | Fast ≈ ×2 auf die ganze Anfrage |
| Cache lesen / schreiben | $1 / $12.50 | Input über 272K → Long-Context auf die ganze Anfrage (Input und Cache ≈ ×2, Output ≈ ×1,5) |
| Sitz | Im ChatGPT-Plan | Credits, wenn das Fenster voll ist; API ohne Deckel, außer ihr setzt einen |
Plus / Pro enthalten meist Astra-Kontingent. Das ist kein unbegrenztes max. Ein mittelgroßer Agent-Turn, der Repo, Logs und Fehlerspuren ins Fenster stopft, trifft den 272K-Aufschlag vor der $10-Zeile. Schläft die Maschine, stirbt der Prompt Cache, und „weiter“ wird als voller Input berechnet – das teuerste Aufwärmen. Wie sich vier Bücher im Monat stapeln, steht weiter im Kostenstück.
Wo die Abschlussrate im echten Repo fällt
„Reale Projektabschlussrate“ besser in drei Spalten als auf einem Board:
- Eval fertig: Terminal-Bench springt gegenüber Sol deutlich; DeepSWE nur +1,4 – kurze Patches lagen schon nah beieinander.
- Demo fertig: Queue, Auth, Retries – Astra hebt oft früher die Hand.
- Merge fertig: Leerzustände, Disabled-States, Risiken über Modulgrenzen brauchen oft noch eine menschliche Zeile oder eine weitere Runde.
Typische Abzüge: Review starrt auf die UI; Runde zwei rührt an Shared Queries oder Cache-Keys, ohne „erst nur lesen, dann minimaler Diff“; Leute kürzen Kontext, um Tokens zu sparen, und verlieren eine Constraint. Drittberichte zeigen auch eine Mid-Migration auf low in etwa einer halben Stunde für etwa elf Dollar. Das ist „es lief“, nicht „ungelesen mergen“.
Effort und Deckel im Alltag setzen
- Default medium oder high. max für Querschnitts-Refactors; low zum Sondieren und für Repro-Skripte.
- Fast nicht als Nachtdefault. Gut für eine Demo-Eile; ein langer Refactor multipliziert den Stückpreis noch einmal.
- Unter 272K bleiben, wenn möglich.
/clearzwischen Tickets ist billiger als/compactauf einer Wand aus Fehlerlogs. - Maschine wach halten. Eine Stunde Deckel zu macht den Cache tot; der nächste Turn ist ein voller Input.
- Drei Spalten abnehmen. Nur grüne Tests lassen das Board die Abschlussrate aufblasen.
# drei Spalten am selben Ticket
Wanduhr Minuten | Input / Output / Cache-Tokens | Review-reif?
Wer Tempo und Tokens misst, sollte die Maschine nicht zuerst verlieren
Astras Wanduhr und Cache-Rechnung brechen, wenn der Deckel zugeht: Session tot, Sandbox leer, Prompt Cache abgelaufen, der nächste Turn ist ein voller Input, der 272K-Aufschlag kann grundlos zünden. Ein Mac mini liegt im Idle bei etwa 4 W – genug, damit Codex den gewählten Effort zu Ende fährt statt mit dem Laptop neu zu booten.
Unified Memory von Apple Silicon eignet sich besser zum Indexieren eines mittleren Repos und parallelen Tests. macOS bringt Unix, Homebrew, Docker und SSH mit, der Terminal-Agent braucht keine WSL-Schicht. Gegenüber einem gleich teuren Windows-Kasten: weniger Abstürze, sicherer unbeaufsichtigt, Gatekeeper und SIP sind die bessere Default-Lage für einen lange laufenden Agent.
Wenn Wanduhr und Tokens ernsthaft geloggt werden sollen: gleiche SKU, Deckel offen — Tarife ansehen, und die Differenz im Modell und am Effort-Regler lassen, nicht im Schlaf und im erneuten Aufwärmen.
