Anfang September kamen GPT-6 Astra und Claude Fable 5.1 kurz hintereinander. Beide Launch-Seiten haben saubere Tabellen, Unabhängige eine weitere. Je mehr man liest, desto schwerer die Entscheidung. Was Teams wirklich blockiert, ist selten „zwei Punkte höher auf einem Board“—sondern ob dasselbe Briefing einen Diff liefert, den man mergen darf.
Auch die Shells unterscheiden sich: Astra läuft meist auf Codex, Fable 5.1 auf Claude Code. Modell, Tool-Loop und Default-Sandbox sind verdreht. Produkttrennung: Claude Code, Codex und Gemini 3.8 Flash im Vergleich; Kostenstapel: Was kostet ein AI Coding Agent pro Monat. Hier nur eines: dasselbe Projekt, beide Seiten.
Dasselbe Briefing: wann sind die Regeln fair
Beide bekamen denselben Repo-Snapshot, dieselbe Cloud-Mac-SKU und dieselbe Abnahmeliste:
Async-CSV-Export in ein bestehendes Next.js-+-Postgres-Admin: Auth, Queue, Fehlschläge mit Retry, E-Mail, plus minimale Statusseite. Tests grün, PR reviewbar, Demo-Pfad klickbar.
Grenzen bewusst festgeschrieben:
- Kein Blick auf den anderen Diff. Zwei Maschinen, zwei saubere Worktrees.
- Keine Umschreibung der Abnahme. Rückfragen ok; „E-Mail“ still zu „nur Log“ machen nicht.
- Default-Shells erlaubt. Astra → Codex; Fable 5.1 → Claude Code. Vergleich ist Modell + Alltag, nicht nackte API-Chatbox.
- Runde zwei ändert die Anforderung. Exportfelder per Tenant-Allowlist filtern, ohne Peak-Queries zu zerlegen.
Leaderboards können warten. Zuerst sehen, wo jede Seite stockt, wenn das Briefing landen muss.
Vom Gerüst zur Demo: wo Runde eins auseinandergeht
Beide liefern in ein bis zwei Stunden etwas Klickbares—der Weg ist anders.
| Blick | GPT-6 Astra (Codex) | Claude Fable 5.1 (Claude Code) |
|---|---|---|
| Queue & Retries | Worker, Dead-Letter, Idempotenzschlüssel schneller komplett | Kommt auch fertig, hält öfter für Vertragschecks an |
| Auth-Verdrahtung | Nutzt bestehendes Middleware; weniger Neuerfindung | Feinere Rechte-Kommentare; manchmal ein Guard mehr |
| Admin-UI | Features first; „Engineer-Console“-Look | Stärkere Empty-/Error-/Progress-Texte |
| Tests | Integrationstests im Terminal zuerst grün | Kritischen Pfad unittesten, dann ein E2E |
Gefühl Runde eins: Astra ist der Kollege, der die Pipeline grün jagt; Fable schreibt zuerst die nutzersichtbaren Zustände. Ist Abnahme „CI grün + Demo-Skript“, meldet Astra sich oft früher. Starren Reviews auf Leerzustände und Copy, spart Fable eher einen Politur-Durchlauf.
Nach der Anforderungsänderung: wer an Shared Code geht
Runde zwei ist die Wasserscheide. Mit Allowlist-Filter stirbt „nur Export-Service“—Shared Queries, Cache-Keys, manchmal read-only Billing-Views bewegen sich mit.
Typische Spaltung:
- Astra: Hoher Ausführungsdrang, dichte Terminalbefehle, viele Dateien offen. Man muss sagen: „erst read-only scouten, dann minimaler Diff.“ Danach konvergiert es schnell.
- Fable 5.1: Vorsichtiger über Modulgrenzen; PR-Texte nennen oft die Risikofläche. Manchmal Ablehnung oder Umweg auf sicherheitsrelevanten Pfaden, bis ein explizites Business-OK kommt.
Niemand ist „immer sicherer“. Es hängt davon ab, ob das Repo „beweglich und schnell“ oder „ein Touch, zwei Reviewer“ braucht.
UI-Gefühl und Code Review: wo die Unterschiede liegen
Beide PRs in dieselbe Review—Kommentarverteilung bleibt stabil:
- Visuell & Interaktion: Fable 5.1 landet Abstände, Disabled- und Loading-Zustände öfter im ersten Wurf. Astra ist funktional richtig, braucht aber oft einen zweiten Pass, damit es nicht „hängt“ wirkt.
- Lesbarkeit: Fable-Namen und Abschnittskommentare wirken menschlicher; Astra ist dichter, denkt länger, lässt gelegentlich Wegwerf-Experimente im Diff.
- Tools & Sandbox: Codex’ Default offline/auditierbar macht Mut, Tests laufen zu lassen; reife Claude-Code-Subagents/Skills halten Scout-Müll aus der Hauptsession. Kontingent: Claude Code 2026 Nutzungslimits.
# Dieselbe Abnahme: Artefakte beider Seiten
1. Grüne CI (inkl. Retry-Fehlerfälle)
2. Klickbare Admin-Pfad-Notizen
3. PR-Beschreibung: Risikofläche + Rollback
4. Regressionsbeweis für Allowlist in Runde zwei
Gleicher Listenpreis—was Geld und Shell noch verstecken
API-Listen liegen bei etwa $10 / $50 (pro Million in/out), Fenster im Millionenbereich. Lange Agents spüren Cache-Reads und Tokens pro Task:
| Dimension | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Cache-Read (öffentliche Listengröße) | Höher | Niedriger (oft ~4×) |
| Long-Context-Zuschlag | Möglich ab hoher Input-Stufe | Voller Window-Standardpreis häufiger |
| Tokens/Task | Dichtes Denken; manchmal „gesprächig“ teuer | Cache-freundliche lange Sessions |
| Alltagsshell | Codex (sandboxfreundlich) | Claude Code (Subagent / Skills) |
Kurz und execution-heavy kann Astras Task-Kosten besser aussehen; große Repos mit wiederholtem Kontext begünstigen Fables Cache-Preis. Gleiche Aufkleber heißen nicht gleiches Monatsende.
Worauf man bei der Wahl achten sollte
„Wer kann besser code?“ in vier Repo-Fragen zerlegen—nützlicher als ein Composite-Board:
- Priorität eins: CI grün oder UI einmal durch Review? Ersteres eher Astra; letzteres eher Fable 5.1.
- Trifft Runde zwei Shared-Module hart? Braucht harte Constraints und Risikotexte → Fable; sie können Min-Diffs bewachen → Astra ist schneller.
- Lesen Sessions denselben großen Tree erneut? Cache-Preis und Long-Context-Zuschläge—nicht nur $10/$50.
- Ist das Team schon auf eine Shell gelockt? Sandbox-, Skills- und Rechte-Gewohnheiten schlagen oft den Modellwechsel.
Benchmarks bleiben als Joker nützlich. Dasselbe Projekt und dieselbe Abnahme sagen, wer in Ihrem Repository wirklich besser code.
Für einen fairen Vergleich Maschinen wach lassen
Dasselbe Briefing, beide Seiten—schlimmstenfalls Deckel zu mitten im Lauf: Session tot, Sandbox leer, Prompt Cache weg, nächster Turn volle Input-Rechnung, Vergleich unfair. Ein Mac mini idle bei etwa 4W, damit Codex und Claude Code an Ihren Fenstern arbeiten statt mit schlafendem Laptop neu zu starten.
Apple-Silicon-Unified-Memory indexiert mittelgroße Repos und Paralleltests sauber; macOS bringt Unix, Homebrew, Docker und SSH mit, beide Terminal-Agents sparen eine WSL-Schicht. Gegenüber gleichpreisigen Windows-Boxen: weniger Crashes, stabilerer Unattended-Betrieb, Gatekeeper und SIP für langlebige Agents.
Ernstes Head-to-Head: Hardware angleichen, Deckel offen—Tarife ansehen, Differenz am Modell lassen, nicht an Sleep und Cold Start.
