Kvmzen Blog
← Zurück zu Technologie in der Praxis

Wie wählt man nach OpenAI DevDay 2026 eine KI-API? Preis, Geschwindigkeit und Agent-Fähigkeiten von OpenAI-, Claude- und Gemini-Modellen im Vergleich

AIDevelopment ·ca. 7 Min. Lesezeit

Wie wählt man nach OpenAI DevDay 2026 eine KI-API? Preis, Geschwindigkeit und Agent-Fähigkeiten von OpenAI-, Claude- und Gemini-Modellen im Vergleich - Kvmzen

In der Woche nach dem DevDay steht im Chat nicht „Astra hat gewonnen“. Es liegen drei Konsolen-Screenshots übereinander: die Agents API von OpenAI, der Fable-Cache-Preis von Anthropic, der Flash-Promo-Countdown von Google. Dieselbe Ticketzeile „Export ins Admin-Backend“ bekommt einmal $10/$50 und einmal $0.75. Die Finanzabteilung fragt, ob die Monatsrechnung um eine Größenordnung auseinanderläuft.

Modellseite, Agent-Seite und Sitzseite sind oft drei Rechnungen. Wie die Produktschalen sich teilen, steht in Claude Code vs. Codex vs. Gemini 3.8 Flash; Wanduhr und Token von Astra selbst in GPT-6 Astra Coding-Test. Hier geht es nur um die API: Preis, Tempo, Agent-Fähigkeit – und warum man die drei nicht einzeln lesen darf.

$10/$50
Üblicher Flagship-Listenpreis (pro 1 Mio. Token)
3
Konsolen, die offen bleiben müssen
272K
Astra-Schwelle für Langkontext-Aufschlag

Nach dieser Welle: welche Rechnungen vergleicht die API

Im September 2026 lag öffentlich mindestens das hier übereinander: gpt-6-astra in der API sowie Azure / Bedrock; die Agents API am 10. September in der Public Beta (gehostetes Codex-Harness, keine Extra-Schnittstellengebühr, Abrechnung über Token und Tools); Anthropic senkt Fable-5.1-Cache-Reads auf $0.25; Gemini 3.8 Flash hängt den Einführungspreis bis 2026-12-31. Die Agent-Builder-Leinwand endet am 30. November – Umzug auf das Agents SDK.

Nicht mit „wer ist schlauer“ beginnen. Zuerst die Rechnungsform ausrichten:

Buch OpenAI Anthropic Google
Modell-API Astra / Sol / Terra nach Token Fable / Opus / Sonnet nach Token Flash nach Token (Sitze extra)
Cache Read $1, Write $12.50; ganzer Request über 272K mit Aufschlag Fable 5.1 Reads $0.25 Cache ja, Listenpreis weit unter Flagship
Agent-Runtime Agents API: Sandbox, MCP, Kompaktion, Sub-Agents Claude Code / Messages-Toolschleife Antigravity, Managed Agents
Extras Computer use pro Tool-Aufruf; Fast etwa ×2 Opus Fast (Preview, nicht Fable) Denkstufe und Tool-Runden heben Token

Zahlen folgen den öffentlichen Listenpreisen von September 2026. Wechselkurs, Steuer, Promos ändern sich – vor dem Kauf die Vendor-Seite prüfen.

Ist der Listenpreis dasselbe wie die Kosten pro fertigem Task

Pro Million Token (Input / Output):

Modell Input Output Cache-Read Zuerst lesen
Gemini 3.8 Flash (bis 2026-12-31) $0.75 $3.75 Weit unter Flagship ab 2027-01-01 $1.50 / $7.50
GPT-5.6 Terra $2 $12 Alltagsstufe Codex / API
Claude Sonnet 5 $2 $10 0,1× Input Standardstart für die meiste Codierung
GPT-5.6 Sol $4 $20 Vorheriges Flagship
Claude Opus 5 $5 $25 0,1× Input Anthropic: „für die meiste Arbeit zuerst das“
GPT-6 Astra $10 $50 $1 über 272K: Input/Cache ~×2, Output ~×1,5; Fast ×2
Claude Fable 5.1 $10 $50 $0.25 5-Minuten-Cache-Write $12.50; 1-Stunden-Write $20

Ein mittlerer Zug mit 80k rein + 8k raus liegt grob bei $0.09 Flash, $0.24 Sonnet, $0.26 Terra, $0.48 Sol, $0.60 Opus, $1.20 Astra / Fable. Agents feuern selten einmal. Cache-Treffer, Denkregler und Tool-Runden trennen „billig pro Token“ von „billig pro Ticket“.

Gleicher Flagship-Sticker, andere zweite Repo-Lesung
Astra und Fable 5.1 stehen beide bei $10 / $50. In langen Sessions senkte Anthropic Cache-Reads auf $0.25 (etwa 2,5 % der Basis); OpenAI bleibt bei $1. Dasselbe große Repo immer wieder einfügen – Fable holt den Flagship-Preis eher zurück; bei Astra zuerst 272K-Schwelle und Fast-Schalter halten.

Der Flash-Einführungspreis ist etwa ein Dreizehntel des Flagship-Stickers. Das ist nicht „gratis Claude“. Google schreibt klar: bei schwerer Arbeit macht 3.8 extra Denkschritte und Tool-Runden. Billiges Gehirn plus dichte Tools kann pro Task trotzdem nahe an ein Mittelklasse-Modell kommen. Wie Abo, API und Maschine in einem Monat liegen, steht in Was kostet ein AI Coding Agent pro Monat wirklich.

Wo die Wanduhr wirklich steckt

Alle drei verstecken „schneller“ in Stufen, nicht im Modellnamen.

  • Astra: reasoning.effort ist low / medium / high / xhigh / max (kein none). Höhere Stufe mag mehr Runden und Browser-Checks. API-Fast ist etwa 2× Wanduhr und 2× Listenpreis. Auf der Launch-Seite OSWorld 2.0: Astra etwa 72,6 % / 40 Minuten, Sol etwa 65,7 % / 75 Minuten.
  • Fable 5.1: die offizielle Tabelle ist langsamer als Opus 5 und Sonnet 5; Denken ist adaptiv und default high. Gekauft wird Langstreckenurteil, nicht das erste Token.
  • Flash: First Byte auf Flash-Niveau; Denken low / medium / high (minimal fehlerhaft). Alltag auf low senkt Uhr und Token gemeinsam; bei schweren Tasks legt es selbst Runden nach.

Ein schnelles erstes Token ist kein fertiges Ticket. Astra macht Queue und CI häufiger zuerst grün, Leerzustände brauchen oft die zweite Runde; Fable spart eher UI- und Risiko-Rewrites. Derselbe Vergleich am selben Projekt: GPT-6 Astra vs. Claude Fable 5.1 am gleichen Projekt.

Agent-Fähigkeit: Modell, Schale und gehostete Runtime trennen

Eine API 2026 zu wählen heißt mindestens drei Schichten:

  1. Modell: ändert es die richtigen Dateien, bleibt es im Rahmen, sprengt es das Repo nicht in den Kontext.
  2. Schale: Codex, Claude Code, Antigravity – Defaults für Rechte, Sandbox, MCP und Sub-Agents unterscheiden sich.
  3. Gehostete Runtime: die Agents API hängt das Codex-Harness an einen HTTP-Call; ihr wählt Sandbox oder eigene Box, OpenAI orchestriert, kompaktioniert, stellt wieder her. Keine Extra-Schnittstellengebühr; Computer use und ähnliche Tools extra.

OpenAI bringt zwei Reibungen: Tool-Calls brauchen die Responses API (Chat Completions reicht nicht); das Misalignment-Monitoring in Produktion kann einen API-Task hart stoppen, nicht nur nachfragen. Astras Computer Use sieht auf Agents' Last Exam und OSWorld stark aus – Formulare, CRM, Browser-QA. Cyber liegt bei Critical: defensive Reviews ja, fortgeschrittene Exploit-Anfragen nein.

Claudes Restkante bleibt MCP + Cache-Ökonomie + Langstrecken-Vorsicht. Gemini ist günstiger Durchsatz + Managed Agents, aber Code-Assist-/Enterprise-Sitze sind eine zweite Rechnungszeile. Flash in eine Multi-Backend-Schale wie Codex zu hängen, ist das übliche „billiges Gehirn + reife Schleife“.

# Übliche Teilung für ein Ticket (nicht die einzige)
Flash / Terra / Sonnet     → Sondieren, Tests, Repo nur lesen
Sol / Opus                 → öffentliche API ändern, Diff schließen
Astra / Fable 5.1          → modulübergreifend, über Nacht, Artefakte oder Cache
Agents API / Claude Code   → hosted nur bei Sandbox + Fortsetzen

Nach Aufgabe kombinieren, nicht nach Lager

Was ihr tut API-Stufe zuerst
Kurze Batches, multimodal, Dokument-Sweeps Gemini 3.8 Flash, thinking=low
Tägliche API-Änderungen, Tests, PR-Abschluss Sonnet 5 oder Terra; Sol / Opus bei Bedarf
Modulübergreifende Refactors, Nacht-Agents Fable 5.1 (Cache) oder Astra (Computer use / Fachdokumente)
Browser-Formulare, Desktop, Site-QA Astra + Responses / Agents API
Eine vorhersehbare Rechnung Günstiges Default + monatliche API-Kappe; ein Abo stoppt an der Wand, eine API rechnet an der Wand

Was in keine Vergleichstabelle passt und trotzdem Budgets durchschlägt:

  1. Schon ChatGPT Plus / Claude Pro, dann eine ungedeckelte API für denselben Agenten – Doppelzählung.
  2. Astra Fast + über 272K multipliziert sich; ein großes Fenster ist keine Lizenz, das Repo einzukleben.
  3. Agent-Builder-Workflows müssen vor dem 30. November auf das Agents SDK. Die Leinwand ist keine Langzeitarchitektur.
  4. Mischen ist oft billiger als ein Lager: eine Schale für harte Bugs, Flash für Durchsatz, ein cachefreundliches Flagship über Nacht.
Zuerst das Default-Modell festlegen; Flagships als Ausnahme schreiben
Sonnet / Terra / Flash als Repo-Default; Opus, Sol, Astra, Fable nur modulübergreifend oder über Nacht. Das ist ein Finance-Meeting weniger, als alle auf $10/$50 zu setzen und die Rechnung zurückzuschneiden.

Häufige Fragen

Astra und Fable 5.1 haben denselben Sticker. Einfach eines nehmen?
Gleicher Sticker, andere zweite Kontext-Lesung. Bei langen Sessions und wiederholten Repo-Sweeps zuerst Cache-Reads. Braucht ihr Computer use, Fach-Artefakte oder das fertige Codex-/Agents-API-Harness, dann Astra.

Kann Gemini 3.8 Flash das Produktions-Default sein?
Als Durchsatz-Default ja, besonders bis Ende 2026. Bei schweren Tasks legt es selbst Runden nach – ein einzelner Task ist nicht immer am billigsten. Terminalschleife, Rechte und MCP brauchen weiter eine Schale. Persönliches Code Assist ist enger geworden – nicht mit dem Gratis-Bild von 2025 budgetieren.

Jetzt auf die Agents API umziehen?
Wer Cloud-Sandbox, Session-Resume und kein eigenes Harness will, sollte pilotieren. Keine Extra-Schnittstellengebühr, aber Token, Tools und ein Monitor, der Tasks stoppt, zählen. Lange Arbeit, die in Claude Code schon rund läuft, muss nicht umziehen, nur weil DevDay eine neue API ausgeliefert hat.

Eine billige API braucht trotzdem eine Maschine, die offen bleibt

Token laufen in der Cloud; Repo, Tests, MCP und Sandbox auf dem Rechner vor euch. Laptop zu, Session tot, Prompt-Cache abgelaufen, „weiter“ als voller Input – Astra schlägt über 272K außerdem den ganzen Request auf. Ein Mac mini steht bei etwa 4W im Leerlauf, damit der Agent gegen euer rollendes Fenster arbeitet statt mit dem Deckel neu zu starten.

Unified Memory von Apple Silicon eignet sich besser zum Indexieren großer Repos und parallelen Tests; macOS bringt Unix, Homebrew, Docker und SSH mit, sodass Codex, Claude Code und eine selbst gehostete Agents-Schleife eine WSL-Schicht sparen. Gegen einen gleich teuren Windows-Kasten: weniger Abstürze, stabilerer unbeaufsichtigter Betrieb, Gatekeeper und SIP für eine Maschine, die mit Agent oben bleibt.

Wer Listenpreise und Cache über drei APIs schon schleift, kauft oft besser eine wache Maschine als noch eine Flagship-Stufe—Pläne ansehen und das Geld für Codeänderungen ausgeben, nicht für erneutes Aufwärmen.

Weiterlesen

Zeitlich begrenztes Angebot

Mehr als ein Mac – Ihre Entwicklungsbasis in der Cloud

Dedizierte Rechenleistung · Globale Knoten · Monatsabonnement · Keine Hardware nötig

Zur Startseite
Zeitl. begr. Angebot Pläne ansehen