Kvmzen Blog
← Zurück zu Technologie in der Praxis

Wie stark ist GPT-6 Astra beim Coden wirklich? Coding-Agent-Test: Geschwindigkeit, Tokens, Kosten und reale Projektabschlussrate

Technologie in der Praxis ·ca. 5 Min. Lesezeit

Wie stark ist GPT-6 Astra beim Coden wirklich? Coding-Agent-Test: Geschwindigkeit, Tokens, Kosten und reale Projektabschlussrate - Kvmzen

Die Launch-Seite nennt GPT-6 Astra das stärkste Coding-Modell. Die Rechnung erzählt etwas anderes: der Listenpreis liegt etwa 2,5× über der Vorgängergeneration, der Effort läuft von low bis max. Was Teams wirklich stoppt, ist selten „wer steht zwei Punkte höher“. Es ist ein Ticket: Wanduhr, Tokens, Monatsende – und ob der erste Diff mergebar ist.

Die Alltagsschale ist meist Codex. Wie sich die Produkte teilen, steht unter Claude Code, Codex und Gemini 3.8 Flash im Vergleich; wie sich das Geld stapelt, unter Was kostet ein AI Coding Agent pro Monat. Der direkte Vergleich mit Fable an einem Projekt liegt in GPT-6 Astra vs Claude Fable 5.1: wer kann wirklich besser code. Hier zerlegen wir nur Astra in vier Achsen: Tempo, Tokens, Kosten, Abschlussrate.

$10/$50
Listenpreis je 1 Mio. Tokens
1.05M
Context-Fenster
5 Stufen
reasoning.effort

Was messen öffentliche Abschlussraten wirklich?

Die Software-Engineering-Zahlen auf der OpenAI-Launchseite vom September 2026 (Knowledge-Cutoff 2026-04-30) sehen ungefähr so aus:

Eval GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0 57.9% 37.3% 55.8%
DeepSWE v1.1 74.1% 72.7% 67.4%
Interne DB-Migrationsaufgaben 63.9% 42.7% 57.8%
AA Coding Agent Index 67.0 65.1

Artificial Analysis gibt Astra in Codex 62, gleichauf mit Fable 5.1 in Claude Code. Die Zahlen können passen, die Definitionen nicht. Offizielle Tabelle, fremdes Harness und „Tests grün plus Reviewer mergen“ sind drei Abschlussraten.

Ein Board-„Pass“ ist keine Merge-Leiste
Evals verlangen meist einen reproduzierbaren Pfad und grüne Tests. Leere Zustände, Auth-Kanten und Rollback-Notizen fließen selten in die Punktzahl. Wer das Board als „reale Projektabschlussrate“ liest, überschätzt, wie oft der erste Wurf live gehen kann.

Wanduhr und Effort-Stufen lesen

Astras reasoning.effort ist low / medium / high / xhigh / max. Höherer Effort heißt mehr Schleifen, mehr Browser-Checks, mehr Ausführen statt blindem apply-patch – Wanduhr und Tokens steigen gemeinsam.

Zwei weitere Wanduhr-Zahlen von der Launchseite:

  • Nach dem Codex-Harness-Update ist Mind2Web etwa 1,9× schneller fertig als GPT-5.6 Sol.
  • OSWorld 2.0: Astra etwa 72,6 % / 40 Minuten, Sol etwa 65,7 % / 75 Minuten (etwa 47 % weniger Zeit).
  • API-Fast: etwa 2× Standardtempo, etwa 2× Preis.

Im selben Repo und demselben Ticket „asynchroner CSV-Export“ macht Astra Queue, Retries und CI oft zuerst grün; Leerzustände und Ladehinweise brauchen meist eine zweite Runde. Kurze Wanduhr heißt nicht ein Durchgang im Review.

Warum Tokenmenge und Listenpreis gegeneinander ziehen

Der Listenpreis stieg von Sols $4 / $20 auf $10 / $50 je Million Input / Output – etwa 2,5×. Cache-Lesen $1, Cache-Schreiben $12.50. Teurer pro Token; oft weniger Tokens für dieselbe Arbeit.

Bei Artificial Analysis in Codex auf max nutzt Astra etwa ein Drittel der Sol-Tokens pro Aufgabe. Kosten pro Task etwa $7.09: rund 40 % günstiger als Fable 5.1 bei gleichem Score, nur etwa 15 % über Sol max, mit höherem Index. Im Intelligence Index liegen Astra max bei etwa 27k Output-Tokens, Fable oft nahe 78k.

Eine Lese regel: nicht nur den Stückpreis vergleichen. Kurze, ausführungsdichte Jobs können den 2,5×-Sticker auffressen. Lange Sessions, die dasselbe große Repo immer wieder lesen – und dann den Long-Context-Aufschlag auslösen – drehen die Rechnung um.

Was steckt sonst in der Einzelaufgaben-Rechnung

Position Öffentliche Listenskala Wann es sich verdoppelt
Input / Output $10 / $50 Fast ≈ ×2 auf die ganze Anfrage
Cache lesen / schreiben $1 / $12.50 Input über 272K → Long-Context auf die ganze Anfrage (Input und Cache ≈ ×2, Output ≈ ×1,5)
Sitz Im ChatGPT-Plan Credits, wenn das Fenster voll ist; API ohne Deckel, außer ihr setzt einen

Plus / Pro enthalten meist Astra-Kontingent. Das ist kein unbegrenztes max. Ein mittelgroßer Agent-Turn, der Repo, Logs und Fehlerspuren ins Fenster stopft, trifft den 272K-Aufschlag vor der $10-Zeile. Schläft die Maschine, stirbt der Prompt Cache, und „weiter“ wird als voller Input berechnet – das teuerste Aufwärmen. Wie sich vier Bücher im Monat stapeln, steht weiter im Kostenstück.

Wo die Abschlussrate im echten Repo fällt

„Reale Projektabschlussrate“ besser in drei Spalten als auf einem Board:

  1. Eval fertig: Terminal-Bench springt gegenüber Sol deutlich; DeepSWE nur +1,4 – kurze Patches lagen schon nah beieinander.
  2. Demo fertig: Queue, Auth, Retries – Astra hebt oft früher die Hand.
  3. Merge fertig: Leerzustände, Disabled-States, Risiken über Modulgrenzen brauchen oft noch eine menschliche Zeile oder eine weitere Runde.

Typische Abzüge: Review starrt auf die UI; Runde zwei rührt an Shared Queries oder Cache-Keys, ohne „erst nur lesen, dann minimaler Diff“; Leute kürzen Kontext, um Tokens zu sparen, und verlieren eine Constraint. Drittberichte zeigen auch eine Mid-Migration auf low in etwa einer halben Stunde für etwa elf Dollar. Das ist „es lief“, nicht „ungelesen mergen“.

Effort und Deckel im Alltag setzen

  1. Default medium oder high. max für Querschnitts-Refactors; low zum Sondieren und für Repro-Skripte.
  2. Fast nicht als Nachtdefault. Gut für eine Demo-Eile; ein langer Refactor multipliziert den Stückpreis noch einmal.
  3. Unter 272K bleiben, wenn möglich. /clear zwischen Tickets ist billiger als /compact auf einer Wand aus Fehlerlogs.
  4. Maschine wach halten. Eine Stunde Deckel zu macht den Cache tot; der nächste Turn ist ein voller Input.
  5. Drei Spalten abnehmen. Nur grüne Tests lassen das Board die Abschlussrate aufblasen.
# drei Spalten am selben Ticket
Wanduhr Minuten | Input / Output / Cache-Tokens | Review-reif?
Erst das eigene Repo messen, dann den Default-Effort wählen
Ein mittelschweres echtes Ticket kopieren. Codex und Abnahme festhalten. Nach zwei Stunden nur vergleichen: Tests grün, Demo klickbar, PR review-fähig. Diese drei Spalten liegen näher an „wie stark ist Astra beim Coden“ als noch eine offizielle Tabelle.

Wer Tempo und Tokens misst, sollte die Maschine nicht zuerst verlieren

Astras Wanduhr und Cache-Rechnung brechen, wenn der Deckel zugeht: Session tot, Sandbox leer, Prompt Cache abgelaufen, der nächste Turn ist ein voller Input, der 272K-Aufschlag kann grundlos zünden. Ein Mac mini liegt im Idle bei etwa 4 W – genug, damit Codex den gewählten Effort zu Ende fährt statt mit dem Laptop neu zu booten.

Unified Memory von Apple Silicon eignet sich besser zum Indexieren eines mittleren Repos und parallelen Tests. macOS bringt Unix, Homebrew, Docker und SSH mit, der Terminal-Agent braucht keine WSL-Schicht. Gegenüber einem gleich teuren Windows-Kasten: weniger Abstürze, sicherer unbeaufsichtigt, Gatekeeper und SIP sind die bessere Default-Lage für einen lange laufenden Agent.

Wenn Wanduhr und Tokens ernsthaft geloggt werden sollen: gleiche SKU, Deckel offen — Tarife ansehen, und die Differenz im Modell und am Effort-Regler lassen, nicht im Schlaf und im erneuten Aufwärmen.

Weiterlesen

Zeitlich begrenztes Angebot

Mehr als ein Mac – Ihre Entwicklungsbasis in der Cloud

Dedizierte Rechenleistung · Globale Knoten · Monatsabonnement · Keine Hardware nötig

Zur Startseite
Zeitl. begr. Angebot Pläne ansehen