Kvmzen Блог
← Назад к разделу «Технологии на практике»

Как выбрать AI API после OpenAI DevDay 2026? Сравнение цен, скорости и Agent-возможностей моделей OpenAI, Claude и Gemini

AIDevelopment ·~7 мин чтения

Как выбрать AI API после OpenAI DevDay 2026? Сравнение цен, скорости и Agent-возможностей моделей OpenAI, Claude и Gemini - Kvmzen

На неделе после DevDay в чате не «Astra победила». Три скриншота консолей: Agents API у OpenAI, цена кэша Fable у Anthropic, обратный отсчёт промо Flash у Google. К одному тикету «добавить экспорт в админку» кто-то клеит $10/$50, кто-то $0.75. Финансы спрашивают, не разъедется ли счёт в конце месяца на порядок.

Страница модели, страница агента и страница мест часто — три разных счёта. Как режутся продуктовые оболочки — в сравнении Claude Code, Codex и Gemini 3.8 Flash; собственные часы и токены Astra — в замерах GPT-6 Astra на коде. Ниже только API: цена, скорость, Agent-возможности — и почему эти три вещи нельзя читать по отдельности.

$10/$50
Обычный прайс флагмана (за 1 млн токенов)
3
Консоли, которые нужно держать открытыми
272K
Порог надбавки Astra за длинный контекст

После этой волны: какие счета сравнивает API

В сентябре 2026 на виду наложилось как минимум это: gpt-6-astra в API, Azure и Bedrock; Agents API в публичной бете 10 сентября (хостится Codex harness, без отдельной платы за интерфейс, биллинг по токенам и инструментам); Anthropic опустил чтение кэша Fable 5.1 до $0.25; Gemini 3.8 Flash повесил вводную цену до 2026-12-31. Холст Agent Builder гаснет 30 ноября — переезд на Agents SDK.

Не начинать с «кто умнее». Сначала выровнять форму счёта:

Книга OpenAI Anthropic Google
API модели Astra / Sol / Terra по токенам Fable / Opus / Sonnet по токенам Flash по токенам (места отдельно)
Кэш Чтение $1, запись $12.50; надбавка на весь запрос после 272K Чтение Fable 5.1 $0.25 Кэш есть, прайс всё равно далеко ниже флагмана
Agent-рантайм Agents API: песочница, MCP, уплотнение, субагенты Цикл инструментов Claude Code / Messages Antigravity, Managed Agents
Дополнительно Computer use за вызов инструмента; Fast примерно ×2 Opus Fast (превью, не Fable) Уровень мышления и круги инструментов поднимают токены

Цифры — публичные прайсы сентября 2026. Курс, налог, акции меняются — перед покупкой снова открыть страницу вендора.

Одно ли это: прайс и стоимость законченной задачи

За миллион токенов (вход / выход):

Модель Вход Выход Чтение кэша Что смотреть первым
Gemini 3.8 Flash (до 2026-12-31) $0.75 $3.75 Далеко ниже флагмана с 2027-01-01 $1.50 / $7.50
GPT-5.6 Terra $2 $12 Повседневный ярус Codex / API
Claude Sonnet 5 $2 $10 0,1× входа Обычная точка старта для кода
GPT-5.6 Sol $4 $20 Предыдущий флагман
Claude Opus 5 $5 $25 0,1× входа Anthropic: «для большей части работы сначала это»
GPT-6 Astra $10 $50 $1 после 272K: вход/кэш ~×2, выход ~×1,5; Fast ×2
Claude Fable 5.1 $10 $50 $0.25 запись кэша на 5 мин $12.50; на 1 час $20

Средний ход 80k вход + 8k выход грубо: Flash $0.09, Sonnet $0.24, Terra $0.26, Sol $0.48, Opus $0.60, Astra / Fable $1.20. Агент редко стреляет один раз. Попадания в кэш, ступени мышления и круги инструментов разводят «дёшево за токен» и «дёшево за тикет».

Один стикер флагмана — другой второй проход по репозиторию
У Astra и Fable 5.1 оба $10 / $50. На длинных сессиях Anthropic опустил чтение кэша до $0.25 (около 2,5% базы); у OpenAI чтение кэша по-прежнему $1. Снова и снова вставлять один большой репозиторий — Fable чаще отыгрывает флагманский прайс; у Astra сначала держать порог 272K и выключатель Fast.

Вводная цена Flash — примерно одна тринадцатая стикера флагмана. Это не «бесплатный Claude». Google прямо пишет: на трудных задачах 3.8 сам добавляет шаги рассуждения и круги инструментов. Дешёвый мозг + плотные инструменты всё ещё могут по токенам приблизиться к модели среднего яруса. Как сложить подписку, API и машину в один месяц — в сколько на самом деле стоит AI Coding Agent в месяц.

Где на самом деле живёт настенные часы

Все трое прячут «быстрее» в ступенях, а не в имени модели.

  • Astra: reasoning.effort — low / medium / high / xhigh / max (без none). Чем выше ступень, тем охотнее лишние круги и проверка в браузере. API Fast — примерно 2× часы и 2× прайс. На странице запуска OSWorld 2.0: Astra около 72,6% / 40 минут, Sol около 65,7% / 75 минут.
  • Fable 5.1: официальная таблица медленнее Opus 5 и Sonnet 5; мышление адаптивное, по умолчанию high. Покупаете длинную оценку, не первый токен.
  • Flash: первый байт класса Flash; мышление low / medium / high (minimal даёт ошибку). На повседневке low опускает часы и токены вместе; на трудных задачах круги добавляет сам.

Быстрый первый токен — не закрытый тикет. Astra чаще сначала зелёнит очередь и CI, пустые состояния часто требуют второго круга; Fable чаще экономит переписывание UI и риск-заметок. Как бить один и тот же проект: GPT-6 Astra vs Claude Fable 5.1 на одном проекте.

Agent-возможности: разделить модель, оболочку и хостимый рантайм

Выбирать API в 2026 — минимум три слоя:

  1. Модель: правит ли нужные файлы, не выходит ли за рамки, не взрывает ли репозиторий в контекст.
  2. Оболочка: Codex, Claude Code, Antigravity — разные дефолты прав, песочницы, MCP и субагентов.
  3. Хостимый рантайм: Agents API вешает Codex harness на один HTTP; вы выбираете песочницу или свою машину, OpenAI оркестрирует, уплотняет, восстанавливает. Отдельной платы за интерфейс нет; computer use и похожие инструменты — отдельно.

У OpenAI ещё два трения: вызовы инструментов требуют Responses API (Chat Completions мало); мониторинг рассогласования в проде может жёстко остановить API-задачу, а не только спросить подтверждение. Computer use Astra силён на Agents' Last Exam и OSWorld — формы, CRM, QA в браузере. Кибер дошёл до Critical: оборонный ревью можно, продвинутые exploit-запросы — отказ.

Остающийся край Claude — MCP + экономика кэша + осторожность на длинной дистанции. У Gemini — дешёвый поток + управляемые агенты, но места Code Assist / Enterprise — вторая строка счёта. Воткнуть Flash в мультибэкенд-оболочку вроде Codex — обычный «дешёвый мозг + зрелый цикл».

# Обычное деление одного тикета (не единственное)
Flash / Terra / Sonnet     → разведка, тесты, только чтение репозитория
Sol / Opus                 → смена публичного API, закрытие diff
Astra / Fable 5.1          → межмодульно, ночь, артефакты или кэш
Agents API / Claude Code   → хостинг только если нужна песочница и продолжение

Подбирать по задаче, не по лагерю

Что вы делаете Какой ярус API пробовать первым
Короткие пачки, мультимодальность, обход документов Gemini 3.8 Flash, thinking=low
Повседневные правки API, тесты, закрытие PR Sonnet 5 или Terra; Sol / Opus по необходимости
Межмодульный рефакторинг, ночные агенты Fable 5.1 (кэш) или Astra (computer use / профдокументы)
Формы в браузере, рабочий стол, QA сайта Astra + Responses / Agents API
Предсказуемый счёт Дешёвый дефолт + месячный потолок API; подписка у стены останавливается, API у стены списывает

То, что плохо ложится в таблицу и всё равно пробивает бюджет:

  1. Уже платите ChatGPT Plus / Claude Pro, а потом открываете API без потолка на того же агента — двойной учёт.
  2. Astra Fast + сверх 272K перемножаются; большое окно — не лицензия вставлять репозиторий.
  3. Воркфлоу Agent Builder нужно перенести на Agents SDK до 30 ноября. Холст — не долгосрочная архитектура.
  4. Смешивать часто дешевле, чем выбрать лагерь: одна оболочка на сложные баги, Flash на поток, дружелюбный к кэшу флагман на ночь.
Сначала зафиксировать модель по умолчанию; флагманы писать как исключение
Sonnet / Terra / Flash — дефолт репозитория; Opus, Sol, Astra, Fable только межмодульно или на ночь. Это на одну финансовую встречу меньше, чем посадить всех на $10/$50 и потом резать счёт.

Частые вопросы

У Astra и Fable 5.1 один стикер. Можно взять любого?
Стикер один, второе чтение контекста разное. На длинных сессиях и повторных обходах репозитория сначала смотреть чтение кэша. Нужны computer use, проф-артефакты или готовый harness Codex / Agents API — смотреть Astra.

Можно ли сделать Gemini 3.8 Flash дефолтом продакшена?
Как дефолт потока — да, особенно до конца 2026. На трудных задачах он сам добавляет круги, одна задача не всегда самая дешёвая. Циклу терминала, правам и MCP по-прежнему нужна оболочка. Личный Code Assist сузили — не бюджетировать по бесплатной памяти 2025 года.

Переезжать на Agents API прямо сейчас?
Если нужна облачная песочница, продолжение сессии и не хочется самим кормить harness — пилот стоит того. Отдельной платы за интерфейс нет, но токены, инструменты и монитор, который может остановить задачу, считаются. Длинную работу, которая уже гладко идёт в Claude Code, не обязательно перевозить всю команду только потому, что DevDay выкатил новый API.

Дешёвый API всё равно требует машину, которую не захлопывают

Токены считают в облаке; репозиторий, тесты, MCP и песочница крутятся на ящике перед вами. Закрыли крышку — сессия мертва, prompt cache истёк, «продолжить» идёт полным входом; Astra сверх 272K ещё и надбавляет весь запрос. Mac mini в простое около 4 Вт, чтобы агент работал по вашему скользящему окну, а не перезапускался вместе с крышкой.

Единая память Apple Silicon лучше индексирует большой репозиторий и гоняет тесты параллельно; в macOS сразу Unix, Homebrew, Docker и SSH, так что Codex, Claude Code и свой цикл Agents обходятся без слоя WSL. Против Windows той же цены — меньше падений, стабильнее без присмотра, Gatekeeper и SIP для машины, которая живёт с агентом сверху.

Если вы уже срезаете прайс и кэш по трём API, не глушить машину часто выгоднее, чем ещё один ярус флагмана—смотреть тарифы и тратить деньги на правку кода, а не на повторный прогрев.

Читайте также

Ограниченное предложение

Больше чем Mac — ваша база разработки в облаке

Выделенные вычисления · Глобальные узлы · Ежемесячная подписка · Без покупки железа

На главную
Ограниченное предложение Посмотреть тарифы