Kvmzen Блог
← Назад к разделу «Технологии на практике»

Насколько сильно GPT-6 Astra пишет код? Замер Coding Agent: скорость, токены, стоимость и реальная доля завершённых проектов

Технологии на практике ·~5 мин чтения

Насколько сильно GPT-6 Astra пишет код? Замер Coding Agent: скорость, токены, стоимость и реальная доля завершённых проектов - Kvmzen

Страница запуска называет GPT-6 Astra сильнейшей моделью для кода. Счёт — другая история: прайс примерно в 2,5 раза выше прошлого поколения, effort идёт от low до max. Команду редко останавливает «кто на два пункта выше в таблице». Останавливает один ticket: стенные часы, токены, конец месяца и можно ли мержить первый diff.

Повседневная оболочка обычно Codex. Как режутся продукты — в сравнении Claude Code, Codex и Gemini 3.8 Flash; как складываются деньги — в сколько стоит AI coding agent в месяц. Очный матч с Fable на одном проекте — в GPT-6 Astra vs Claude Fable 5.1: кто реально лучше пишет код. Ниже только четыре оси самой Astra: скорость, токены, стоимость, доля завершения.

$10/$50
Прайс за 1 млн токенов
1.05M
Окно контекста
5 уровней
reasoning.effort

Что на самом деле меряют публичные доли завершения

Цифры по software engineering на странице OpenAI за сентябрь 2026 (срез знаний 2026-04-30) примерно такие:

Оценка GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0 57.9% 37.3% 55.8%
DeepSWE v1.1 74.1% 72.7% 67.4%
Внутренние задачи миграции БД 63.9% 42.7% 57.8%
AA Coding Agent Index 67.0 65.1

Artificial Analysis ставит Astra 62 в Codex — вровень с Fable 5.1 в Claude Code. Цифры могут сходиться, определения — нет. Официальная таблица, чужой harness и «тесты зелёные плюс ревьюер готов мержить» — три разные доли завершения.

«Проход» в рейтинге — не планка merge
Эвалам обычно нужны воспроизводимый путь и зелёные тесты. Пустые состояния, края авторизации и заметки об откате в балл почти не входят. Читать таблицу как «долю завершения реального проекта» — завышать, как часто можно выкатывать с первой попытки.

Как читать стенные часы и уровни effort

У Astra reasoning.effortlow / medium / high / xhigh / max. Выше уровень — больше кругов, больше проверок в браузере, больше «запустить», а не слепой apply-patch. Часы и токены растут вместе.

Ещё две цифры со страницы запуска:

  • После обновления Codex harness Mind2Web заканчивается примерно в 1,9× быстрее, чем у GPT-5.6 Sol.
  • OSWorld 2.0: Astra около 72,6% / 40 минут, Sol около 65,7% / 75 минут (примерно на 47% меньше времени).
  • Режим API Fast: примерно 2× стандартной скорости и примерно 2× цены.

На том же репозитории и том же ticket «асинхронный экспорт CSV» Astra чаще раньше зеленеет очередь, ретраи и CI; пустые состояния и текст загрузки обычно требуют второго круга. Короткие часы — не ревью с одного прохода.

Почему расход токенов и прайс тянут в разные стороны

Прайс вырос с $4 / $20 у Sol до $10 / $50 за миллион входа / выхода — около 2,5×. Чтение кэша $1, запись кэша $12.50. Дороже за токен; на ту же работу токенов часто меньше.

У Artificial Analysis в Codex на max Astra тратит примерно треть токенов Sol на задачу. Стоимость задачи около $7.09: примерно на 40% дешевле Fable 5.1 при том же балле, всего около 15% выше Sol max, индекс выше. На Intelligence Index у Astra max около 27k выходных токенов, у Fable часто около 78k.

Одно правило чтения: не сравнивать только цену за токен. Короткие, плотные по исполнению задачи могут съесть наклейку 2,5×. Длинные сессии, которые снова и снова читают тот же большой репозиторий — и затем ловят надбавку длинного контекста — переворачивают счёт.

Что ещё спрятано в счёте за одну задачу

Строка Публичный масштаб Когда удваивается
Вход / выход $10 / $50 Fast ≈ ×2 на весь запрос
Кэш чтение / запись $1 / $12.50 Вход больше 272K → длинный контекст на весь запрос (вход и кэш ≈ ×2, выход ≈ ×1,5)
Место Внутри тарифа ChatGPT Кредиты, когда окно выбито; у API нет потолка, пока вы его не поставите

В Plus / Pro обычно уже есть квота Astra. Это не безлимитный max. Средний ход агента, который запихивает в окно репозиторий, логи и следы падений, бьётся о надбавку 272K раньше, чем о строку $10. Если машина засыпает, Prompt Cache умирает, и «продолжить» считается как полный вход — самый обидный прогрев. Как четыре книги складываются за месяц — по-прежнему в статье про стоимость.

Где доля завершения падает в живом репозитории

«Долю завершения реального проекта» лучше писать тремя колонками, а не одной таблицей лидеров:

  1. Эвал закрыт: Terminal-Bench сильно прыгает относительно Sol; DeepSWE только +1,4 — короткие патчи и так были близко.
  2. Демо закрыто: очередь, авторизация, ретраи — Astra чаще поднимает руку раньше.
  3. Merge закрыт: пустые состояния, disabled, риски между модулями всё ещё часто просят человеческую строку или ещё один круг.

Обычные точки падения: ревью смотрит в UI; второй круг трогает общие запросы или ключи кэша без «сначала только чтение, потом минимальный diff»; контекст режут ради токенов и теряют ограничение. У третьих сторон есть и кейс mid-миграции на low примерно за полчаса и около одиннадцати долларов. Это «пробежало», не «мержить не глядя».

Как ставить effort и потолки каждый день

  1. По умолчанию medium или high. max — для сквозных рефакторов; low — разведка и скрипты воспроизведения.
  2. Не делать Fast ночным дефолтом. Нормально для срочного демо; длинный рефактор ещё раз умножает цену токена.
  3. Держаться ниже 272K, если можно. /clear между ticket дешевле, чем /compact на стене логов ошибок.
  4. Не давать машине уснуть. Час с закрытой крышкой убивает кэш; следующий ход — полный вход.
  5. Писать три колонки. Одни зелёные тесты позволяют рейтингу раздуть долю завершения.
# три колонки на одном ticket
стенные минуты | вход / выход / кэш-токены | можно сразу в ревью?
Сначала замерьте свой репозиторий, потом выбирайте дефолтный effort
Скопируйте средний живой ticket. Зафиксируйте Codex и приёмку. Через два часа сравнивайте только: тесты зелёные, демо кликается, PR можно нести на ревью. Эти три колонки ближе к «насколько сильно Astra пишет код», чем ещё одна официальная таблица.

Замеряете скорость и токены — не роняйте сначала машину

Стенные часы и кэш-счёт Astra ломаются, когда крышка закрывается: сессия мертва, песочница пуста, Prompt Cache истёк, следующий ход — полный вход, надбавка 272K может сработать ни за что. Mac mini в простое около 4 Вт — достаточно, чтобы Codex доехал на выбранном effort, а не перезагружался вместе с ноутбуком.

Единая память Apple Silicon удобнее для индекса среднего репозитория и параллельных тестов. В macOS сразу есть Unix, Homebrew, Docker и SSH — терминальному агенту не нужен слой WSL. Против Windows той же цены: меньше падений, спокойнее без присмотра, Gatekeeper и SIP лучше как фон для долго живущего агента.

Если часы и токены собираетесь писать всерьёз, сначала один SKU и открытая крышка — смотреть тарифы, и оставить разницу в модели и ползунке effort, а не во сне и повторном прогреве.

Читайте также

Ограниченное предложение

Больше чем Mac — ваша база разработки в облаке

Выделенные вычисления · Глобальные узлы · Ежемесячная подписка · Без покупки железа

На главную
Ограниченное предложение Посмотреть тарифы