Zwei oder drei Coding-Agenten im selben Terminal sind kein Sonderfall mehr. Die Namen kennt man: Claude Code, Codex, Gemini 3.8 Flash. Wer sie danach sortiert, wer eine Zeile besser vervollständigt, wählt oft das falsche Werkzeug.
Die ersten beiden sind Agent-Produkte mit eigenem Loop. Flash ist zuerst ein Modell — ohne CLI oder Antigravity arbeitet es nicht. Ob Patches die Tests überstehen, ob der Kontext die Rechnung sprengt, ob Werkzeuge wirklich andocken: das steht nicht in einem Eröffnungsabsatz. Die folgenden Abschnitte zerlegen es.
Kontingente und Tarife stehen in der Claude-Code-2026-Anleitung zu Nutzungskontingenten und Limits; wer noch zwischen IDE-Abo und CLI-Agent schwankt, findet Orientierung unter günstigere Cursor-Alternativen 2026.
Zuerst klären: Sie vergleichen nicht dieselbe Sorte Ding
| Worauf Sie achten | Besser wählen | Warum |
|---|---|---|
| Mehrdatei-Refactor, lange Aufgaben, wenig Nacharbeit | Claude Code | Reife Subagents; Opus 5 führt bei allgemeinen Agent-Benchmarks klar |
| Auditierbar und sandboxbar by default, Open Source | Codex CLI | Apache-2.0, Netz standardmäßig aus, Subagents nur explizit |
| Volumen, Multimodal, Token pro Lauf möglichst klein | Gemini 3.8 Flash | Aktionspreis etwa ein Drittel von Sonnet 5; stark bei kurzen SWE-Aufgaben |
Es gibt keinen Gesamtsieger. DeepMind schreibt das in der Modellkarte zu Gemini 3.8 Flash (September 2026) selbst: Flash nähert sich bei kurzen Software-Engineering-Läufen den Flaggschiffen, bleibt bei längeren allgemeinen Agent-Aufgaben aber hinter Opus 5.
Codequalität: Sind Kurzstrecke und Langstrecke dieselbe Fähigkeit
„Codequalität“ zerfällt klarer in zwei Schichten: ein Patch, der kompiliert und Tests besteht, und eine Aufgabe, die über Sitzungen hinweg fertig wird, ohne abzudriften oder unbeteiligte Module anzufassen.
Öffentlicher Vergleich aus der DeepMind-Modellkarte (September 2026):
| Benchmark | Was gemessen wird | Gemini 3.8 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|
| DeepSWE v1.1 | Langes Software Engineering | 73.7% | 74.0% | 53.8% | 72.7% | 69.6% |
| Terminal-bench 2.1 | Code im Terminal | 89.4% | 89.1% | 80.4% | 88.8% | 87.4% |
| Terminal-bench 4.0 | Allgemeinerer Agent | 19.1% | 51.8% | 12.4% | 37.3% | 23.6% |
| OSWorld-2.0 | Rechner steuern | 59.0% | 75.4% | 42.6% | 62.6% | 50.2% |
So lesen Sie die Tabelle:
- Alltags-Patches, Terminalskripte, mittlere Repos: Flash, Opus 5 und GPT-5.6 Sol stehen praktisch auf einer Stufe. Flash liegt auf Terminal-bench 2.1 sogar leicht vorn.
- Über Tools und Sitzungen hinweg, mit eigener Planung: Opus 5 zieht Terminal-bench 4.0 auf 51.8%, Sol auf 37.3%, Flash nur auf 19.1%. Das ist die messbare Form von „günstige Modelle schreiben Funktionen, führen aber kein Projekt“.
- Sonnet 5 bleibt das Standard-Arbeitspferd in Claude Code: günstiger Stückpreis, natives 1M-Fenster — DeepSWE aber nur 53.8%. Schwere Refactors brauchen ein bewusstes Umschalten auf Opus; das Default-Modell trägt keine Flaggschiff-Last.
Im Alltag macht Claude Code seltener „Datei A geändert, Datei B kaputt“. Codex ist auf der Kommandozeile und bei mehrstufigen Skripten ruhig, und die Standardsandbox lässt Tests eher laufen. Gemini 3.8 Flash ist schnell, günstig und multimodal stark — auf langen Ketten verliert es eher das Ziel. Aufgaben kürzer schneiden oder thinking effort hochziehen.
Context: Wenn das Fenster groß genug ist, wohin das Geld fließt
| Produkt | Kontext des Standardmodells | Max. Ausgabe | Langkontext-Preis |
|---|---|---|---|
| Claude Code (Sonnet 5 / Opus 5) | 1M (nativ in der API) | 128k | Offiziell kein Extraaufschlag für langen Kontext |
| Codex (GPT-5.6) | ca. 1.05M | 128k | Ab etwa 272k Input wird ein Teil der Stufen teurer |
| Gemini 3.8 Flash | 1,048,576 | 64k | In der Aktion derselbe Stückpreis; ab 2027 der Standardpreis verdoppelt |
Die Fensterzahl ist kein Verkaufsargument mehr. Geld verbrennt, wenn jede Anfrage Historie, Tool-Ausgabe und Repo-Schnitte erneut mitschickt.
- Claude Code: Je länger der Chat, desto teurer;
/clearist günstiger als/compact. Skills, MCP-Ergebnisse und Testlogs landen in der Hauptsitzung. Ein Nutzen der Subagents: Suchmüll bleibt im Unterfenster, zurück kommt nur die Zusammenfassung. - Codex: Subagents werden explizit gestartet, die Hauptsitzung bleibt sauberer, Token sind planbarer. Dafür müssen Sie selbst festlegen, wie viele laufen und wofür.
- Gemini 3.8 Flash: 1M-Fenster plus einstellbarer Effort (
low/medium/high). Höherer Effort heißt mehr Denk-Token und mehr Latenz. Wissensstand etwa März 2026 — neue Bibliotheks-APIs brauchen Suche oder MCP; das Modell „weiß“ sie nicht von allein.
Große Repos nicht ganz ins Fenster stopfen. Erst mit Explore / explorer nur lesend scannen, dann den Hauptagenten an die kritischen Dateien lassen. Isolation beim parallelen Codieren: Parallel-AI-Coding-Anleitung.
MCP: Das Protokoll ist gemeinsam, die Fallen nicht
Alle drei sprechen Model Context Protocol. 2026 lautet die Frage nicht mehr „MCP ja oder nein“, sondern: wessen Ökosystem tiefer sitzt, wo die Konfiguration weniger Fallen hat, und ob Ihre Server nach dem nächsten Produktlinienwechsel weiterlaufen.
| Claude Code | Codex CLI | Stack um Gemini 3.8 Flash | |
|---|---|---|---|
| Anschluss | claude mcp add (http / stdio; SSE ist veraltet) |
config.toml |
settings.json / Antigravity-Plugins |
| Ökosystem | am tiefsten (Protokollinitiator) | Ausreichend, eher engineering-lastig | Anschluss möglich, auf der Unternehmensseite vollständiger |
| Extra | Skills, Hooks, Plugins | Skills, Exec-Modus, austauschbares Modell-Backend | Skills / Hooks / Subagents wandern nach Antigravity |
Claude Code bleibt der Weg mit dem geringsten Widerstand, wenn zuerst GitHub, Datenbanken und interne APIs andocken sollen. Codex gewinnt, weil die Konfiguration ins Repo und ins Audit gehört und auf jedes Chat-Completions- bzw. Responses-kompatible Backend zeigen kann — fällt ein Modell weg, stirbt die Kette nicht. Auf der Gemini-Seite müssen Einzelentwickler trennen: günstiges Modell ≠ stabiles Agent-Produkt. Nach der Verschärfung der Gemini-CLI-Privatkontingente Mitte 2026 schob die Community Richtung Antigravity; die Erweiterungsfläche bleibt im Großen und Ganzen, das Paar „Open-Source-CLI plus subventionierter Endpunkt“ ist jedoch auseinandergefallen. Wer noch auf eine große Gemini-Version wettet, liest ob sich Warten auf Gemini 4 lohnt.
Subagents: zwei Arten, Hilfe zu holen
Beide Seiten orchestrieren „Dirigent plus Unteragenten“ — mit entgegengesetzter Philosophie.
Claude Code behandelt Subagents als First-Class: Explore, Plan und allgemeine Arbeiter haben eigenen Kontext, Tool-Whitelist und Rechte. Der Hauptagent delegiert anhand der description automatisch; Sie müssen nicht schreiben „starte einen Explorer“. Hintergrund-Subagents laufen weiter und können bei Bedarf ins eigene Worktree. Gespart wird Suchmüll im Hauptfenster; dazu kommen Token — offiziell kann ein Agent-Team im Plan-Modus ein Vielfaches einer normalen Sitzung kosten. Eigene Rollen liegen in YAML-Frontmatter, verteilt wie Skills.
Codex startet standardmäßig keine Kindprozesse. Im Prompt muss stehen: „an jedem Checkpoint einen Agent spawn-en“. Explorer ist eher nur lesend und arbeitet mit sandbox_mode. Vorteil: Kosten sind planbar, Parallelität ziehen Sie selbst. Nachteil: eine fehlende Zeile, und es sucht nur langsam in der Hauptsitzung.
Gemini 3.8 Flash ist selbst keine Laufzeit. Antigravity / Managed Agents werben mit Skills, Hooks und Subagents; Reife und Dokumentationsdichte bleiben hinter Claude Code. Flash an einen eigenen Orchestrator (oder an Codex’ Multi-Backend) zu hängen, ist oft steuerbarer: teure Arbeit an Opus / Sol, Massen-Scans des Repos an Flash.
# Claude Code: implizite Aufteilung in der Hauptsitzung
Hauptagent (Opus / Sonnet)
├─ Explore (Haiku, nur lesen) → nur Zusammenfassung zurück
├─ Plan → Konzept, keine direkten Prod-Dateien
└─ Umsetzung / Prüfung → eigener Kontext, bei Bedarf im Hintergrund
# Codex: erst auf ausdrücklichen Ruf
Hauptsitzung (GPT-5.6 Terra / Sol)
└─ Sie schreiben “spawn explorer + reviewer”
└─ Unteragent liefert ab, Hauptsitzung entscheidet weiter
Terminal: Kann man ihm Befehle überlassen
Produktivität eines Agenten = wie oft er pytest, npm test und git wirklich ausführt. Genau dort sitzt das Risiko.
| Frage | Claude Code | Codex CLI | Gemini-3.8-Flash-Stack |
|---|---|---|---|
| Standard-Sandbox | Seatbelt / bubblewrap | standardmäßig an, unter Linux mit seccomp | hängt am Host-Agenten; das Modell verwaltet keine Prozesse |
| Standard-Netz | neue Domains brauchen Freigabe | standardmäßig aus | hängt an Antigravity / Ihrer Laufzeit |
| Windows | über WSL2 | native Sandbox oder WSL2 | produktabhängig |
| Offener Kern | nein (Release-Repo + Plugins) | ja, Apache-2.0, Rust | Modell geschlossen; die alte Gemini CLI ist offen, der Privatkanal aber enger |
Codex’ Netz-aus-Default ist 2026 die härteste Sicherheitsvorgabe: ohne Außennetz klebt der Agent .env kaum auf einen fremden Host. Claude Code ist beweglicher — Freigabe pro Domain, passend für Docs und Pakete im Alltag — Anthropic hat aber selbst geschrieben: der Proxy terminiert TLS nicht, Domain-Fronting bleibt denkbar. Unternehmen sollten einen prüfbaren eigenen Proxy stellen.
Gemini 3.8 Flash erreicht 89.4% auf Terminal-bench 2.1: das Modell kann Terminal. Ob es auf Ihrer Maschine Amok läuft, entscheidet die Hülle — Antigravity, eigener Runner oder Flash als günstiges Backend hinter Codex / Claude. Ein hoher Modell-Score ist keine fertige Sandbox.
Tokenrechnung: drei Arten, sie zu berechnen
Preise gelten nach den jeweiligen Official Pages. Die Zahlen hier folgen den öffentlichen Listen vom September 2026 (DeepMind-Modellkarte plus Preisangaben von Anthropic / Google). Wechselkurse und Aktionen ändern sich; das Budget bitte noch einmal gegenprüfen.
API-Stückpreise (je Million Token)
| Modell | Input | Output | Rolle |
|---|---|---|---|
| Gemini 3.8 Flash (bis 2026-12-31) | $0.75 | $3.75 | Batch, kurze Aufgaben, multimodal |
| Gemini 3.8 Flash (ab 2027-01-01) | $1.50 | $7.50 | dasselbe, nach der Aktion |
| Claude Sonnet 5 | $2 | $10 | Claude-Code-Default |
| GPT-5.6 Terra | $2 | $12 | Codex-Alltag |
| GPT-5.6 Sol | $4 | $20 | Codex-Flaggschiff |
| Claude Opus 5 | $5 | $25 | schwere Refactors, lange Agenten |
| Claude Fable 5 | $10 | $50 | ultralang, nur bewusst gewählt |
Eine mittlere Agent-Runde grob mit 80k Input + 8k Output: Flash etwa $0.09, Sonnet 5 etwa $0.24, Sol etwa $0.48, Opus 5 etwa $0.60. Bei Cache-Treffern kann Input noch eine Größenordnung fallen. Flashs „günstig“ verschwindet schnell bei hohem Effort, wiederholten Retries und einem vollen 1M-Fenster.
Abo-Formen
- Claude Code: Pro etwa $20 / Monat, Max 5x $100, 20x $200. Web-Claude und CLI teilen das Kontingent. Kein Privat-Tarif unter $20. Details in der Kontingent-Anleitung.
- Codex: läuft über ChatGPT — Free / Go (etwa $8) / Plus $20 sowie 5x und 20x. Der einzige Massen-Einstieg, bei dem ein vollständiger Terminal-Agent unter zwanzig Dollar startet.
- Gemini 3.8 Flash: privat vor allem API nach Verbrauch plus Google AI / Gemini Enterprise Agent Platform. Die Agent-Hülle (Antigravity, Code Assist) ist extra Sitz. Günstiges Modell heißt nicht „günstiger Entwicklungsplatz“.
Entwicklungseffizienz: Wählen, ohne sich zu verbrennen
Effizienz ist kein Benchmark-Punktestand, sondern zuverlässige Änderungen, die Sie pro Woche mergen.
- Eine Person, tiefes Repo: Claude Code + Sonnet 5, an Engpässen Opus. Skills und MCP sauber aufsetzen bringt mehr als ein zweites Abo.
- Audit, Sicherheit by default, natives Windows: Codex CLI. Spawn-Regeln ins Repo schreiben — die Rechnung verdoppelt sich nicht, während Sie in Meetings sitzen.
- Pipelines, Nacht-Batches, multimodal (Screenshots / Screenrecordings / PDF): Gemini 3.8 Flash. 64k Output reichen für Patch-Notizen, nicht für eine komplette große Datei in einem Rutsch — segmentieren.
- Teams: dieselben MCP-Server und Review-Gates, Modelle dürfen gemischt werden. Eine einzige Sperre macht Sie abhängig, sobald die Gegenseite Preise ändert oder den Privatkanal zuzieht.
- Maschine: Agenten sollen 24 Stunden lang Platte lesen, Tests fahren und MCP halten. Ein zugeklapptes Notebook bedeutet toten Cache und neu bezahlten Kontext. Ein stabiler, sparsamer Cloud-Mac ist öfter der versteckte Engpass als „noch eine Max-Stufe“.
# Dieselbe Aufgabe: erst günstig sondieren, dann den Diff an das Flaggschiff
# Flash / Terra: Repro-Skript und Testentwurf
# Sonnet / Opus / Sol: Diff prüfen, öffentliche APIs ändern, PR schließen
Häufige Fragen
Kann Gemini 3.8 Flash Claude Code ersetzen?
Nein. Es ist ein Modell. Terminalschleife, Rechte und MCP brauchen Antigravity, einen Gemini-Unternehmensagenten oder Ihren eigenen Runner. Flash an eine Multi-Backend-CLI wie Codex zu hängen, ist derzeit die übliche Kombination „günstiges Hirn, reife Hülle“.
Gibt es 2026 noch ein kostenloses privates Gemini-CLI-Kontingent?
Planen Sie nicht mit dem Bild von 2025. Seit Jahresmitte ist der Privatkanal enger, die Community geht zu Antigravity und Pay-as-you-go-API. Unternehmens-Code-Assist bleibt eine eigene Linie. Vor der Bestellung die aktuelle Lizenzseite lesen, nicht einen alten Blog.
Kontext überall 1M — je voller, desto besser?
Nein. Das Fenster ist eine Obergrenze, kein Ziel. Überflüssige Tool-Ausgabe und tote Dateien treffen Qualität, Latenz und Rechnung zugleich. Erst suchen, dann genau lesen.
Reicht Terminal-bench 2.1 zur Entscheidung?
Nein. Auf 2.1 liegen die drei Flaggschiffe fast gleichauf; 4.0 und OSWorld zeigen den Langstreckenabstand. Kurze Skripte: Flash ist vernünftig. Refactor über Wochen: Opus / Sol sind ruhiger.
Ändern sich die Preise nächste Woche?
Ja. Die Flash-Aktion gilt bis 31. Dezember 2026; Sonnet 5s $2 / $10 ist der Dauerpreis. Maßgeblich sind die Seiten von Anthropic, OpenAI und Google Cloud am jeweiligen Tag.
Ein starker Agent braucht eine Maschine, die nicht zuklappt
Claude Code, Codex und Gemini 3.8 Flash rechnen Cloud-Token. Repo lesen, Tests fahren und MCP halten passiert auf dem Rechner vor Ihnen. Klappen Sie das Notebook zu, bricht die Sitzung, die Sandbox leert sich, der Prompt-Cache verfällt — die nächste Runde zählt als volle Eingabe. Ein Mac mini braucht im Leerlauf etwa 4W und lässt den Terminal-Agenten Ihrem rollenden Fenster folgen, statt nach jedem Zuklappen neu zu starten.
Unified Memory von Apple Silicon trägt Indexierung großer Repos und parallele Tests besser; macOS bringt Unix, Homebrew, Docker und SSH mit, Computer-Use- und Terminalschleifen von Claude Code und Codex laufen runder. Gegen einen gleich teuren Windows-Host stürzt weniger ab, unbeaufsichtigter Betrieb ist realistischer; Gatekeeper und SIP senken das Risiko dauerhaft laufender Agents.
Wenn Sie Token und Kontext schon knapphalten, zahlt sich eine Maschine, die online bleibt, oft mehr aus als die nächste Abo-Stufe — Tarife jetzt ansehen und Geld für Code ausgeben, nicht für ständiges Aufwärmen.