Kvmzen ブログ
← 技術の実践に戻る

GPT-6 Astra のコードは本当にどれだけ強いか?Coding Agent 実測:速度、Token、コストと実プロジェクト完了率

技術の実践 ·約 8 分

GPT-6 Astra のコードは本当にどれだけ強いか?Coding Agent 実測:速度、Token、コストと実プロジェクト完了率 - Kvmzen

発表ページは GPT-6 Astra を「いちばんコードが上手いモデル」と書く。請求書は別の話だ。単価は先代の約 2.5 倍、思考レベルは low から max。チームが本当に止まるのは「榜で何点高いか」ではなく、同じ ticket で壁時計が何分、Token がいくつ、月末がいくら、最初の diff をマージしてよいか、だ。

日常の殻は Codex が多い。製品の切り方は Claude Code、Codex、Gemini 3.8 Flash 比較、お金の重ね方は AI Coding Agent の月額は結局いくら。Fable と同一プロジェクトで並べる話は GPT-6 Astra vs Claude Fable 5.1:本当にコードが上手いのは誰。ここでは Astra 自身を四つに分ける。速度、Token、コスト、完了率。

$10/$50
100万 Token あたりの表示価格
1.05M
Context ウィンドウ
5 段階
reasoning.effort

公開の完了率は何を測っているか

2026年9月の OpenAI 発表ページにあるソフトウェア工学の数字(知識カットオフ 2026-04-30)はおおよそこうだ。

評価 GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0 57.9% 37.3% 55.8%
DeepSWE v1.1 74.1% 72.7% 67.4%
社内 DB 移行タスク 63.9% 42.7% 57.8%
AA Coding Agent Index 67.0 65.1

Artificial Analysis は Codex 上の Astra に 62 を付け、Claude Code 上の Fable 5.1 と並ぶ。数字は揃っても定義は揃わない。公式表、第三者 harness、そして「テスト緑+レビューがマージしてよい」は、三種類の完了率だ。

榜の「完了」はマージ基準ではない
評価の合格は、再現できる経路と緑のテストが普通の条件だ。空状態、権限の境界、ロールバック説明は点数に入りにくい。榜点を「実プロジェクト完了率」にすると、一発で出せる割合を過大に見積もる。

壁時計と思考レベルをどう読むか

Astra の reasoning.effortlow / medium / high / xhigh / max。上げるほど周回数、ブラウザ検証、盲目の apply-patch ではなく実行が増え、壁時計も Token も一緒に伸びる。

発表ページの壁時計はもう二つある。

  • Codex harness 更新後、Mind2Web では GPT-5.6 Sol より約 1.9× 早く終わる。
  • OSWorld 2.0:Astra は約 72.6% / 40 分、Sol は約 65.7% / 75 分(時間は約 47% 短い)。
  • API の Fast は標準の約 2 倍速、課金も約 2 倍。

同じリポジトリ、同じ「非同期 CSV エクスポート」ticket では、Astra はキュー・再試行・CI を先に緑にしやすい。空状態と読み込み文言は二周目になりがちだ。壁時計が短くても、レビューが一発で通るとは限らない。

Token 量と単価がねじれる理由

表示価格は Sol の $4 / $20 から $10 / $50(100万入力 / 出力)へ、約 2.5 倍。キャッシュ読み $1、キャッシュ書き $12.50。Token 単価は高い。同じ仕事で「話す量」は減りやすい。

Artificial Analysis の Codex・max では、Astra のタスクあたり Token は Sol の約 三分の一。タスク単価は約 $7.09 で、同点の Fable 5.1 より約 4 割安く、Sol max より約 15% 高いだけ、指数は上。Intelligence Index では Astra max の出力は約 27k、Fable 側は 78k 付近が多い。

読み方は一つ。単価だけ比べない。 短い実行密集タスクなら 2.5× の札を相殺できる。同じ巨大リポを何度も読み、長文脈加算まで踏むと、請求は逆に傾く。

一回のタスク請求にまだ何が残るか

項目 公開表示の規模 いつ倍になるか
入力 / 出力 $10 / $50 Fast はリクエスト全体が約 ×2
キャッシュ読 / 書 $1 / $12.50 入力が 272K 超だとリクエスト全体が長文脈(入力とキャッシュ約 ×2、出力約 ×1.5)
座席 ChatGPT プラン内 窓を使い切ったらクレジット。API は自分で上限を付けない限り無制限

Plus / Pro には Astra 枠が含まれることが多い。無限の max ではない。中規模の Agent ターンでリポ、ログ、失敗軌跡を全部窓に詰めれば、先に当たるのは $10 の行ではなく 272K 加算だ。マシンが眠ると Prompt Cache が切れ、「続けて」が全量入力になる。いちばん損なウォームアップだ。月次の四冊の帳簿は、コスト記事のまま。

実リポジトリで完了率はどこで落ちるか

「実プロジェクト完了率」は総榜より、三列で書いた方がいい。

  1. 評価完了: Terminal-Bench は Sol から大きく跳ねる。DeepSWE は +1.4 点だけで、短いパッチはもともと近い。
  2. デモ完了: キュー、認証、再試行は、Astra の方が先に手を挙げやすい。
  3. マージ完了: 空状態、無効状態、横断モジュールのリスク説明は、まだ人の一言かもう一周が要ることが多い。

落ちやすい三点。レビューが UI を見る。二周目で共有クエリやキャッシュキーを触るのに「先に読み取り、最小 diff」を書いていない。Token 節約で文脈を切って制約を落とす。第三者の公開例では、low で中規模移行が約 30 分・約 11 ドルで終わった、という話もある。それは「動いた」であり、「読まずにマージ」ではない。

日常のレベルと上限の置き方

  1. 既定は medium か high。 max は横断リファクタ用。low は下調べと再現スクリプト。
  2. Fast を夜間の既定にしない。 デモ急ぎならよい。長いリファクタは単価をもう一度掛ける。
  3. できるなら 272K 未満。 ticket を変えるときは /clear。失敗ログを /compact で押し込むより安い。
  4. マシンを起こしておく。 蓋を一時間閉じるとキャッシュが消え、次は全量入力。
  5. 受け入れは三列。 緑だけ見ると、完了率は榜に引っ張られる。
# 同じ ticket を三列で残す
壁時計(分) | 入力 / 出力 / キャッシュ Token | そのままレビューに出せるか
既定レベルは、自分のリポを測ってから
中くらいの本物の ticket をコピーし、Codex と受け入れ条件を固定する。二時間後に見るのは、テストが緑か、デモが通るか、PR をレビューに出せるか、だけ。この三列の方が、公式表を暗記するより「Astra のコードはどれだけ強いか」に近い。

速度と Token を測るなら、先にマシンを落とさない

Astra の壁時計とキャッシュ請求がいちばん崩れるのは、途中で蓋を閉じたときだ。セッション切断、サンドボックス消去、Prompt Cache 失効、次は全量入力、272K 加算まで巻き添えになる。Mac mini の待機は約 4W。Codex を選んだ思考レベルで走らせ切る方が、ノートのスリープ再開より向いている。

Apple Silicon の統一メモリは、中規模リポの索引と並列テストに向く。macOS は Unix、Homebrew、Docker、SSH が最初からあり、ターミナル Agent に WSL が一枚要らない。同価格帯の Windows 機より落ちにくく、無人運転も安定し、Gatekeeper と SIP は長時間 Agent を置く前提として扱いやすい。

壁時計と Token を本気で残すなら、先に同じスペックで蓋を閉じないこと——プランを見る。差はモデルとレベルに残し、スリープと再ウォームに残さない。

関連記事

期間限定オファー

1 台の Mac を超えた、クラウド上のあなたの開発基地

専有算力 · グローバルノード · 月額サブスクリプション · ハードウェア不要

ホームに戻る
期間限定オファー プランを見る