Kvmzen Блог
← Назад к разделу «Технологии на практике»

Claude Code vs Codex vs Gemini 3.8 Flash: сравнение AI coding-агентов 2026, качество кода, Context, MCP, Subagents, Terminal, стоимость токенов и эффективность разработки

AIDevelopment ·~11 мин чтения

Разработчик параллельно запускает AI-агентов в многоэкранном терминале

Два-три coding-агента в одном терминале уже не редкость. Имена знакомые: Claude Code, Codex, Gemini 3.8 Flash. Сравнивать их как «кто лучше допишет строку» — верный способ взять не тот инструмент.

Первые два — агент-продукты со своим циклом. Flash сначала модель: без CLI или Antigravity он не работает. Пройдут ли тесты, пробьёт ли контекст счёт, подключатся ли инструменты — это не решается первым абзацем. Дальше разбираем по разделам.

Квоты и тарифы — в полном руководстве по лимитам Claude Code 2026; если ещё качаетесь между подпиской на IDE и CLI-агентом, смотрите более дешёвые альтернативы Cursor 2026.

1M
Масштаб окна Context
$0.75
Акционная цена входа Flash
51.8%
Одно число на длинном бенче

Сначала выровнять: вы сравниваете не один и тот же тип вещи

Что важнее Лучше выбрать Почему
Многофайловый рефакторинг, длинные задачи, меньше переделок Claude Code Зрелые субагенты; Opus 5 заметно впереди на общих агентных бенчмарках
Аудит и песочница по умолчанию, open source Codex CLI Apache-2.0, сеть выключена по умолчанию, субагенты только явно
Большой объём, мультимодальность, минимум токенов на прогон Gemini 3.8 Flash Акционная цена примерно 1/3 от Sonnet 5; силён на коротком SWE

«Первого везде» нет. DeepMind само пишет в карточке модели Gemini 3.8 Flash (сентябрь 2026): на коротком software engineering Flash почти догоняет флагманы, на более длинных общих агентных задачах всё ещё отстаёт от Opus 5.

Качество кода: короткая и длинная дистанция — один навык?

«Качество кода» удобнее разложить на два слоя: за один заход поправить нужные файлы (патч собирается и проходит тесты) и довести задачу через сессии (не сбиться с курса и не трогать чужие модули).

Открытое сравнение из карточки DeepMind (сентябрь 2026):

Бенчмарк Что меряет Gemini 3.8 Flash Claude Opus 5 Claude Sonnet 5 GPT-5.6 Sol GPT-5.6 Terra
DeepSWE v1.1 Длинное software engineering 73.7% 74.0% 53.8% 72.7% 69.6%
Terminal-bench 2.1 Код в терминале 89.4% 89.1% 80.4% 88.8% 87.4%
Terminal-bench 4.0 Более общий агент 19.1% 51.8% 12.4% 37.3% 23.6%
OSWorld-2.0 Управление компьютером 59.0% 75.4% 42.6% 62.6% 50.2%

Как читать:

  • Обычные патчи, терминальные скрипты, средние репозитории: Flash, Opus 5 и GPT-5.6 Sol почти на одной ступени. На Terminal-bench 2.1 Flash даже чуть выше.
  • Через инструменты и сессии, с собственной планировкой: Opus 5 тянет Terminal-bench 4.0 до 51.8%, Sol — 37.3%, у Flash только 19.1%. Это количественная версия фразы «дешёвая модель пишет функции, но плохо играет менеджера проекта».
  • Sonnet 5 по-прежнему рабочая лошадка Claude Code по умолчанию: низкая цена, нативный контекст 1M, но DeepSWE всего 53.8%. Тяжёлый рефакторинг — явное переключение на Opus; от модели по умолчанию флагманскую работу ждать не стоит.

На ощупь Claude Code реже «починил A и сломал B». Codex спокоен в командной строке и на многошаговых скриптах, а песочница по умолчанию позволяет отпускать тесты. Gemini 3.8 Flash быстр, дёшев и силён в мультимодальности — на длинной цепочке чаще теряет цель. Режьте задачи короче или поднимайте thinking effort.

Context: когда окно уже большое, куда уходят деньги

Продукт Контекст модели по умолчанию Макс. выход Цена длинного контекста
Claude Code (Sonnet 5 / Opus 5) 1M (нативно в API) 128k Отдельной надбавки за длинный контекст официально нет
Codex (GPT-5.6) около 1.05M 128k Свыше примерно 272k входа часть ступеней дорожает
Gemini 3.8 Flash 1,048,576 64k В акции та же цена; с 2027 стандартная цена удваивается

Цифра окна больше не продаёт. Жжёт деньги другое: каждый запрос снова тащит историю, вывод инструментов и срезы репозитория.

  • Claude Code: чем длиннее диалог, тем дороже; /clear дешевле /compact. Skills, ответы MCP и логи тестов попадают в главную сессию. Один из смыслов субагентов — оставить поисковый мусор в дочернем окне и вернуть только саммари.
  • Codex: субагентов поднимают явно, главная сессия чище, токены предсказуемее; цена — самим прописать, сколько запускать и зачем.
  • Gemini 3.8 Flash: окно 1M плюс настраиваемый effort (low / medium / high). Выше effort — больше «думающих» токенов и задержка. Срез знаний около марта 2026: новые API библиотек всё равно через поиск или MCP; не считайте, что модель «всё знает».

Большой репозиторий целиком в окно не кладите. Сначала только чтение через Explore / explorer, потом главный агент правит ключевые файлы. Про изоляцию при параллельном кодировании — руководство по Parallel AI Coding.

MCP: протокол общий, ловушки — нет

Все трое говорят на Model Context Protocol. В 2026 вопрос уже не «есть ли MCP», а у кого глубже экосистема, где меньше ям в конфиге и переживут ли ваши серверы следующую смену линейки.

Claude Code Codex CLI Стек вокруг Gemini 3.8 Flash
Подключение claude mcp add (http / stdio; SSE устарел) config.toml settings.json / плагины Antigravity
Экосистема самая глубокая (инициатор протокола) Достаточная, ближе к инженерии Подключается, на корпоративной стороне полнее
Дополнительно Skills, Hooks, Plugins Skills, режим exec, сменный бэкенд модели Skills / Hooks / Subagents уезжают в Antigravity

Claude Code по-прежнему путь наименьшего сопротивления, если сначала нужны GitHub, базы и внутренние API. Сила Codex — конфиг в репозитории, под аудит, и указатель на любой бэкенд, совместимый с Chat Completions / Responses: модель срезали — цепочка не умерла. На стороне Gemini частному разработчику стоит разделить: дешёвая модель ≠ стабильный агентный продукт. После сжатия личных квот Gemini CLI в середине 2026 сообщество увели в Antigravity; поверхность расширений в целом жива, но связка «открытый CLI + субсидируемый эндпоинт» уже разобрана. Если дорожная карта всё ещё ставит на крупную версию Gemini — стоит ли ждать Gemini 4.

MCP съедает контекст
Каждый ответ инструмента попадает в окно. Логи, дампы целых таблиц и большие диффы часто дороже самой модели. Фильтры, пагинация и права только на чтение у MCP дают больше, чем следующий тариф.

Субагенты: два способа позвать помощь

Обе стороны делают «оркестратор + дочерние агенты», философии противоположные.

Claude Code считает субагентов гражданами первого класса: у Explore, Plan и обычных рабочих свой контекст, белый список инструментов и права. Главный агент сам делегирует по полю description; писать «открой исследователя» не обязательно. Фоновые субагенты продолжают работу и при необходимости уходят в отдельный worktree. Экономите поисковый мусор в главном окне; платите токенами — официально команда агентов в режиме плана может стоить в несколько раз дороже обычной сессии. Свои роли — YAML-frontmatter, та же схема распространения, что у Skills.

Codex по умолчанию не поднимает дочерние процессы. В промпте должно быть: «на каждой контрольной точке spawn агента». Explorer скорее только чтение, сочетается с sandbox_mode. Плюс: расход предсказуем, параллельность рисуете вы. Минус: не дописали фразу — и он медленно ищет только в главной сессии.

Gemini 3.8 Flash сам по себе не рантайм. Antigravity / Managed Agents обещают Skills, Hooks и Subagents, но зрелость и глубина документации всё ещё слабее Claude Code. Посадить Flash на свой оркестратор (или на мультибэкенд Codex) чаще контролируемее: дорогую работу — Opus / Sol, массовое сканирование репозитория — Flash.

# Claude Code: неявное разделение в главной сессии
Главный агент (Opus / Sonnet)
  ├─ Explore (Haiku, только чтение) → только саммари
  ├─ Plan → план, без правок прод-файлов
  └─ Реализация / проверка → свой контекст, фон при необходимости

# Codex: стартует, только если вы назвали
Главная сессия (GPT-5.6 Terra / Sol)
  └─ Вы пишете “spawn explorer + reviewer”
        └─ Дочерний агент сдаёт работу, главная сессия решает дальше

Терминал: можно ли доверить ему команды

Продуктивность агента = сколько раз он реально запускает pytest, npm test, git. Риск — там же.

Вопрос Claude Code Codex CLI Стек Gemini 3.8 Flash
Песочница по умолчанию Seatbelt / bubblewrap включена по умолчанию, на Linux с seccomp зависит от хост-агента; модель процессами не управляет
Сеть по умолчанию новые домены нужно одобрять выключена по умолчанию зависит от Antigravity / вашего рантайма
Windows через WSL2 нативная песочница или WSL2 зависит от продукта
Открытое ядро нет (репозиторий релизов + плагины) да, Apache-2.0, Rust модель закрыта; старый Gemini CLI открыт, но личный канал уже сжат

Сеть выключена по умолчанию у Codex — самый жёсткий security-default 2026: без внешней сети агенту трудно утащить .env на чужой хост. Claude Code гибче — домен за доменом, удобно для документации и пакетов в повседневной разработке — но сама компания писала: прокси не терминирует TLS, обход через domain fronting возможен. Предприятию нужен свой проверяемый прокси.

У Gemini 3.8 Flash 89.4% на Terminal-bench 2.1: модель умеет терминал. Будет ли она безобразничать на вашей машине, решает оболочка — Antigravity, свой runner или Flash как дешёвый бэкенд за Codex / Claude. Высокий модельный бенчмарк — это не «песочница уже собрана».

Счёт за токены: три способа его считать

Цены — по официальным страницам. Цифры здесь совпадают с открытыми прайсами сентября 2026 (карточка DeepMind плюс тарифы Anthropic / Google). Курсы и акции меняются; бюджет перепроверьте.

API за миллион токенов

Модель Вход Выход Роль
Gemini 3.8 Flash (до 2026-12-31) $0.75 $3.75 Батч, короткие задачи, мультимодальность
Gemini 3.8 Flash (с 2027-01-01) $1.50 $7.50 То же, акция кончилась
Claude Sonnet 5 $2 $10 Умолчание Claude Code
GPT-5.6 Terra $2 $12 Повседневный Codex
GPT-5.6 Sol $4 $20 Флагман Codex
Claude Opus 5 $5 $25 Тяжёлый рефакторинг, длинный агент
Claude Fable 5 $10 $50 Сверхдлинная дистанция, только явно

Средний агентный ход грубо как 80k входа + 8k выхода: Flash около $0.09, Sonnet 5 около $0.24, Sol около $0.48, Opus 5 около $0.60. Попадание в кэш может ещё на порядок снизить вход. «Дешевизна» Flash быстро тает на высоком effort, ретраях и заполненном окне 1M.

Форма подписок

  • Claude Code: Pro около $20 / мес, Max 5x $100, 20x $200. Веб-Claude и CLI делят квоту. Личного тарифа ниже $20 нет. Подробности — в гайде по квотам.
  • Codex: идёт за ChatGPT — Free / Go (около $8) / Plus $20, плюс 5x и 20x. Единственный массовый вход, где полноценный терминальный агент стартует меньше чем за двадцать долларов.
  • Gemini 3.8 Flash: у частников в основном API по факту плюс Google AI / Gemini Enterprise Agent Platform. Оболочка агента (Antigravity, Code Assist) — отдельные места. Дешёвая модель не значит «дешёвое рабочее место разработчика».
Смешивать чаще дешевле, чем выбирать лагерь
Главную сессию — Claude Code или Codex на архитектуру и жёсткие баги; Flash — на тесты, документацию и большие read-only сканы. Дорогие модели оставьте на суждение, дешёвые — на пропускную способность.

Эффективность: как выбрать и не обжечься

Эффективность — не балл бенчмарка, а надёжные изменения, которые вы мержите за неделю.

  1. Один человек, глубокая правка репозитория: Claude Code + Sonnet 5, на узких местах Opus. Настроенные Skills и MCP снимают больше хождений туда-сюда, чем вторая подписка.
  2. Аудит, безопасность по умолчанию, нативный Windows: Codex CLI. Правила spawn в репозитории — счёт не удвоится, пока вы на совещании.
  3. Пайплайны, ночные пачки, мультимодальность (скриншоты / записи экрана / PDF): Gemini 3.8 Flash. 64k выхода хватает на пояснение к патчу, не на целый большой файл за раз — режьте на части.
  4. Команда: одни и те же MCP и гейты ревью, модели можно смешивать. Закрепить одного поставщика — попасть в чужой пересмотр цен или сжатие личного канала.
  5. Машина: агенту нужно 24 часа читать диск, гонять тесты, держать MCP. Ноутбук с крышкой = мёртвый кэш и повторная оплата контекста. Стабильный маломощный облачный Mac чаще оказывается скрытым узким местом, чем «ещё одна ступень Max».
# Та же задача: сначала дешёвая модель разведывает, затем diff — флагману
# Flash / Terra: скрипт воспроизведения и черновик тестов
# Sonnet / Opus / Sol: ревью diff, правки публичных API, закрытие PR

Частые вопросы

Можно ли поставить Gemini 3.8 Flash вместо Claude Code как есть?
Нет. Это модель. Цикл в терминале, права и MCP всё равно требуют Antigravity, корпоративного Gemini-агента или своего runner. Посадить Flash на мультибэкенд вроде Codex — сейчас самый частый набор «дешёвый мозг, зрелая оболочка».

Остался ли в 2026 бесплатный личный тариф Gemini CLI?
Не считайте бюджет по картинке 2025 года. С середины года личный канал сжат, сообщество уводят в Antigravity и API по факту. Корпоративный Code Assist — отдельная линия. Перед заказом смотрите текущую страницу лицензии, не старый блог.

Контекст у всех 1M — чем больше напихать, тем лучше?
Нет. Окно — потолок, не цель. Лишний вывод инструментов и снятые с полки файлы бьют сразу по качеству, задержке и счёту. Сначала поиск, потом внимательное чтение.

Хватит ли Terminal-bench 2.1, чтобы выбрать?
Нет. На 2.1 три флагмана почти вничью; 4.0 и OSWorld показывают разрыв на длинной дистанции. Короткий скрипт — Flash уместен; рефакторинг на недели — спокойнее Opus / Sol.

Цены изменятся на следующей неделе?
Да. Акция Flash до 31 декабря 2026; $2 / $10 у Sonnet 5 уже долгосрочная цена. Ориентир — страницы Anthropic, OpenAI и Google Cloud на этот день.

Сильному агенту всё равно нужна машина, которую не захлопывают

Claude Code, Codex и Gemini 3.8 Flash соревнуются облачными токенами, а чтение репозитория, тесты и MCP происходят на машине перед вами. Ноутбук захлопнули — сессия оборвалась, песочница очистилась, Prompt Cache истёк, следующий круг считают как полный вход. Mac mini в простое около 4W: терминальный агент работает по вашему скользящему окну, а не перезапускается вместе с крышкой.

Единая память Apple Silicon лучше держит индексацию больших репозиториев и параллельные тесты; в macOS сразу Unix, Homebrew, Docker и SSH, циклы computer-use / терминала у Claude Code и Codex идут ровнее. Рядом с Windows-хостом той же цены меньше падений, проще оставить без присмотра; Gatekeeper и SIP снижают риск постоянно висящего агента.

Если токены и контекст вы уже считаете, машина, которая не отваливается, часто выгоднее следующей ступени подписки — смотреть тарифы и платить за правки кода, а не за повторный прогрев.

Читайте также

Ограниченное предложение

Больше чем Mac — ваша база разработки в облаке

Выделенные вычисления · Глобальные узлы · Ежемесячная подписка · Без покупки железа

На главную
Ограниченное предложение Посмотреть тарифы