Страница запуска называет GPT-6 Astra сильнейшей моделью для кода. Счёт — другая история: прайс примерно в 2,5 раза выше прошлого поколения, effort идёт от low до max. Команду редко останавливает «кто на два пункта выше в таблице». Останавливает один ticket: стенные часы, токены, конец месяца и можно ли мержить первый diff.
Повседневная оболочка обычно Codex. Как режутся продукты — в сравнении Claude Code, Codex и Gemini 3.8 Flash; как складываются деньги — в сколько стоит AI coding agent в месяц. Очный матч с Fable на одном проекте — в GPT-6 Astra vs Claude Fable 5.1: кто реально лучше пишет код. Ниже только четыре оси самой Astra: скорость, токены, стоимость, доля завершения.
Что на самом деле меряют публичные доли завершения
Цифры по software engineering на странице OpenAI за сентябрь 2026 (срез знаний 2026-04-30) примерно такие:
| Оценка | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| Внутренние задачи миграции БД | 63.9% | 42.7% | 57.8% |
| AA Coding Agent Index | 67.0 | 65.1 | — |
Artificial Analysis ставит Astra 62 в Codex — вровень с Fable 5.1 в Claude Code. Цифры могут сходиться, определения — нет. Официальная таблица, чужой harness и «тесты зелёные плюс ревьюер готов мержить» — три разные доли завершения.
Как читать стенные часы и уровни effort
У Astra reasoning.effort — low / medium / high / xhigh / max. Выше уровень — больше кругов, больше проверок в браузере, больше «запустить», а не слепой apply-patch. Часы и токены растут вместе.
Ещё две цифры со страницы запуска:
- После обновления Codex harness Mind2Web заканчивается примерно в 1,9× быстрее, чем у GPT-5.6 Sol.
- OSWorld 2.0: Astra около 72,6% / 40 минут, Sol около 65,7% / 75 минут (примерно на 47% меньше времени).
- Режим API Fast: примерно 2× стандартной скорости и примерно 2× цены.
На том же репозитории и том же ticket «асинхронный экспорт CSV» Astra чаще раньше зеленеет очередь, ретраи и CI; пустые состояния и текст загрузки обычно требуют второго круга. Короткие часы — не ревью с одного прохода.
Почему расход токенов и прайс тянут в разные стороны
Прайс вырос с $4 / $20 у Sol до $10 / $50 за миллион входа / выхода — около 2,5×. Чтение кэша $1, запись кэша $12.50. Дороже за токен; на ту же работу токенов часто меньше.
У Artificial Analysis в Codex на max Astra тратит примерно треть токенов Sol на задачу. Стоимость задачи около $7.09: примерно на 40% дешевле Fable 5.1 при том же балле, всего около 15% выше Sol max, индекс выше. На Intelligence Index у Astra max около 27k выходных токенов, у Fable часто около 78k.
Одно правило чтения: не сравнивать только цену за токен. Короткие, плотные по исполнению задачи могут съесть наклейку 2,5×. Длинные сессии, которые снова и снова читают тот же большой репозиторий — и затем ловят надбавку длинного контекста — переворачивают счёт.
Что ещё спрятано в счёте за одну задачу
| Строка | Публичный масштаб | Когда удваивается |
|---|---|---|
| Вход / выход | $10 / $50 | Fast ≈ ×2 на весь запрос |
| Кэш чтение / запись | $1 / $12.50 | Вход больше 272K → длинный контекст на весь запрос (вход и кэш ≈ ×2, выход ≈ ×1,5) |
| Место | Внутри тарифа ChatGPT | Кредиты, когда окно выбито; у API нет потолка, пока вы его не поставите |
В Plus / Pro обычно уже есть квота Astra. Это не безлимитный max. Средний ход агента, который запихивает в окно репозиторий, логи и следы падений, бьётся о надбавку 272K раньше, чем о строку $10. Если машина засыпает, Prompt Cache умирает, и «продолжить» считается как полный вход — самый обидный прогрев. Как четыре книги складываются за месяц — по-прежнему в статье про стоимость.
Где доля завершения падает в живом репозитории
«Долю завершения реального проекта» лучше писать тремя колонками, а не одной таблицей лидеров:
- Эвал закрыт: Terminal-Bench сильно прыгает относительно Sol; DeepSWE только +1,4 — короткие патчи и так были близко.
- Демо закрыто: очередь, авторизация, ретраи — Astra чаще поднимает руку раньше.
- Merge закрыт: пустые состояния, disabled, риски между модулями всё ещё часто просят человеческую строку или ещё один круг.
Обычные точки падения: ревью смотрит в UI; второй круг трогает общие запросы или ключи кэша без «сначала только чтение, потом минимальный diff»; контекст режут ради токенов и теряют ограничение. У третьих сторон есть и кейс mid-миграции на low примерно за полчаса и около одиннадцати долларов. Это «пробежало», не «мержить не глядя».
Как ставить effort и потолки каждый день
- По умолчанию medium или high. max — для сквозных рефакторов; low — разведка и скрипты воспроизведения.
- Не делать Fast ночным дефолтом. Нормально для срочного демо; длинный рефактор ещё раз умножает цену токена.
- Держаться ниже 272K, если можно.
/clearмежду ticket дешевле, чем/compactна стене логов ошибок. - Не давать машине уснуть. Час с закрытой крышкой убивает кэш; следующий ход — полный вход.
- Писать три колонки. Одни зелёные тесты позволяют рейтингу раздуть долю завершения.
# три колонки на одном ticket
стенные минуты | вход / выход / кэш-токены | можно сразу в ревью?
Замеряете скорость и токены — не роняйте сначала машину
Стенные часы и кэш-счёт Astra ломаются, когда крышка закрывается: сессия мертва, песочница пуста, Prompt Cache истёк, следующий ход — полный вход, надбавка 272K может сработать ни за что. Mac mini в простое около 4 Вт — достаточно, чтобы Codex доехал на выбранном effort, а не перезагружался вместе с ноутбуком.
Единая память Apple Silicon удобнее для индекса среднего репозитория и параллельных тестов. В macOS сразу есть Unix, Homebrew, Docker и SSH — терминальному агенту не нужен слой WSL. Против Windows той же цены: меньше падений, спокойнее без присмотра, Gatekeeper и SIP лучше как фон для долго живущего агента.
Если часы и токены собираетесь писать всерьёз, сначала один SKU и открытая крышка — смотреть тарифы, и оставить разницу в модели и ползунке effort, а не во сне и повторном прогреве.
