Kvmzen ブログ
← 技術の実践に戻る

GPT-6 Astra vs Claude Fable 5.1:本当にコードが上手いのは誰?ベンチを見ず、同じプロジェクトで比べる

AIDevelopment ·約 8 分

GPT-6 Astra vs Claude Fable 5.1:本当にコードが上手いのは誰?ベンチを見ず、同じプロジェクトで比べる - Kvmzen

9月上旬、GPT-6 Astra と Claude Fable 5.1 が前後して登場した。双方の発表ページにも、第三者の別表にもきれいな数字がある。読めば読むほど決めにくい。チームを本当に止めるのは「あるボードで2点高い」ことではなく、同じ brief から一度でマージしてよいコードを出せるかどうかだ。

殻も違う。Astra は Codex、Fable 5.1 は Claude Code に載ることが多い。モデル・ツールループ・デフォルトサンドボックスが絡む。製品の切り分けは Claude Code、Codex、Gemini 3.8 Flash 比較、お金の重ね方は AI Coding Agent の月額は結局いくら を参照。ここでは一つだけ:同じプロジェクトを両側で走らせる。

$10/$50
両社の表示価格(100万 Token あたり)
~1M
Context ウィンドウ規模
1
同じ受け入れチェックリスト

同じ brief、公平なルールの書き方

双方に同じリポジトリスナップショット、同じスペックのクラウド Mac、同じ受け入れリストを渡した。

既存の Next.js + Postgres 管理画面に「非同期 CSV エクスポート」を追加:認証、キュー、失敗リトライ、メール通知、タスク状態を見られる最小管理ページ。テストは緑、PR は人が読める、デモ経路はクリックできること。

制約は意図的に固定した。

  • 相手の diff を見ない。 2台・2つのクリーンな作業領域。
  • 受け入れ項目を書き換えない。 質問は可。「メール」を勝手に「ログのみ」へ変えるのは不可。
  • 各自のデフォルト殻を許可。 Astra → Codex、Fable 5.1 → Claude Code。裸の API チャットではなく「モデル+日常フロー」を比べる。
  • 第2ラウンドで要件を変える。 エクスポート項目をテナントのホワイトリストで絞り、ピーククエリを壊さない。

ベンチ表は後でよい。brief が着地するとき、どこで詰まるかを先に見る。

足場からデモまで:第1ラウンドの違い

どちらも1〜2時間で「開けるもの」は出せる。道筋が違う。

観点 GPT-6 Astra(Codex) Claude Fable 5.1(Claude Code)
キューとリトライ worker・デッドレター・冪等キーを早く揃える 完走するが、契約確認で止まることが多い
認証の配線 既存 middleware を再利用しがち 権限境界の注釈が細く、ガードが増えることも
管理画面 機能優先、「エンジニア向けコンソール」感 空状態・エラー・進捗コピーが厚い
テスト 端末で統合テストを先に緑にする 重要経路の単体→1本の E2E

第1ラウンドの体感:Astra はパイプラインを通したくて急ぐ同僚Fable はユーザーが見る状態を先に書く同僚。受け入れが「CI 全緑+デモ脚本」なら Astra が手を挙げやすい。空状態と文言を審査が詰めるなら、Fable の方が手戻りが少ないことが多い。

要件が変わったあと:共有コードに手を出すか

分水嶺は第2ラウンド。ホワイトリストが入ると「エクスポートサービスだけ」は成立しない。共有クエリ、キャッシュキー、時には課金の読み取りビューまで動く。

長タスクはパッチ行数競争ではない
「1ファイルを直す」と「直したあと近所を壊さない」は別技能。第2ラウンドは無関係モジュールへのドライブバイと、ホットパスに残る一時 hack を見る。

よくある分岐:

  • Astra: 実行欲が強く、端末コマンドが密で、一度に多くのファイルを開く。「先に読み取り探路、その後最小 diff」と明示すると収束が速い。
  • Fable 5.1: モジュール横断に慎重で、PR 説明にリスク面を書くことが多い。安全/機微パスでは拒否や迂回があり、業務許可を一文足すと進む。

「常に安全」な一方はない。リポジトリが「動いて速く」か「触れたら二人レビュー」かによる。

UI の感触とコードレビュー:差はどこか

同じレビューに両 PR を入れると、コメントの分布は安定する。

  • 見た目と操作: Fable 5.1 の方が余白・無効態・読み込みフィードバックを一度で通しやすい。Astra は機能は正しいが、「固まって見える」を直す第2パスが要ることが多い。
  • 読みやすさ: Fable の命名と区切り注釈は人向け。Astra は密度が高く、思考が長く、捨てられる中間実験が diff に混ざることがある。
  • ツールとサンドボックス: Codex のデフォルト断網・監査しやすい姿勢はテスト実行を任せやすい。Claude Code の Subagent / Skills が成熟していると、探路ゴミがメインセッションに入りにくい。枠の使い方は Claude Code 2026 使用枠と制限 を参照。
# 同じ受け入れで双方が提出する成果物
1. 緑の CI(失敗リトライ用例を含む)
2. クリック可能な管理画面パスの説明
3. PR 説明:リスク面 + ロールバック
4. 第2ラウンドのホワイトリスト回帰証明

表示価格が同じでも、お金と殻が隠すもの

API 表示はおよそ $10 / $50(100万入力/出力)、窓は百万規模。長い Agent が本当に気にするのはキャッシュ読みタスクあたり Tokenだ。

次元 GPT-6 Astra Claude Fable 5.1
キャッシュ読み(公開表示の規模感) 高い 低い(約4×差がよく出る)
長コンテキスト追加料金 ある入力帯を超えると加算されうる 全窓を標準単価にしやすい
タスクあたり Token 思考が密で「話が多い」コストが出ることも キャッシュ向きの長セッションに強い
日常の殻 Codex(サンドボックスしやすい) Claude Code(Subagent / Skills)

短い実行密集タスクでは Astra の「1回コスト」がよく見えることがある。巨大リポジトリで同じ文脈を何度も読むなら Fable のキャッシュ単価が勝ちやすい。表示が並んでも、月末が並ぶとは限らない

選定で見るべきこと

「誰がコード上手いか」を総榜ではなく、自分のリポジトリへの四つの問いに分解する。

  1. 最優先は CI を通すことか、UI を一度で通すことか。 前者は Astra、後者は Fable 5.1 を多めに試す。
  2. 第2ラウンドで共有モジュールを大きく触るか。 強い制約とリスク説明が要るなら Fable。最小 diff を見張れるなら Astra が速い。
  3. 同じ大リポを何度も読むか。 $10/$50 だけでなくキャッシュ単価と長コンテキスト加算を見る。
  4. チームはどの殻にロックされているか。 サンドボックス、Skills、権限の習慣はモデル差し替えより体感を左右しやすい。
最小の対照実験
中くらいの本物チケットを2台に配り、同じ受け入れ、diff の覗き禁止。2時間後に見るのはテスト緑・デモの滑らかさ・PR がレビューに出せるかだけ。それからデフォルトモデルを決める——先に陣営を決めて証拠を探すより安い。

ベンチは外札としてまだ役立つ。同じプロジェクト、同じ受け入れが、「自分のリポジトリで誰が本当にコードが上手いか」を教える。

対照実験では、マシンを先に落とさない

「同じ brief、両側」で最悪なのは途中で蓋を閉じること。セッション断、サンドボックス消失、Prompt Cache 失効で次ターンが全量入力課金になり、対照が不公平になる。Mac mini の待機はおよそ 4W。Codex と Claude Code をあなたの窓に合わせて動かし、ノートの休眠で再起動させない。

Apple Silicon の統一メモリは中規模リポの索引と並列テストに向き、macOS は Unix、Homebrew、Docker、SSH を標準で持つので両ターミナル Agent が WSL 層を減らせる。同価格帯の Windows 機よりクラッシュが少なく無人運転が安定し、Gatekeeper と SIP も長時間の Agent 向きだ。

本気のヘッドツーヘッドなら、まず両側のマシン仕様を揃え蓋を開けたまま——プランを確認する。差はモデルに残し、休眠と再ウォームアップに残さない。

期間限定オファー

1 台の Mac を超えた、クラウド上のあなたの開発基地

専有算力 · グローバルノード · 月額サブスクリプション · ハードウェア不要

ホームに戻る
期間限定オファー プランを見る