9月上旬、GPT-6 Astra と Claude Fable 5.1 が前後して登場した。双方の発表ページにも、第三者の別表にもきれいな数字がある。読めば読むほど決めにくい。チームを本当に止めるのは「あるボードで2点高い」ことではなく、同じ brief から一度でマージしてよいコードを出せるかどうかだ。
殻も違う。Astra は Codex、Fable 5.1 は Claude Code に載ることが多い。モデル・ツールループ・デフォルトサンドボックスが絡む。製品の切り分けは Claude Code、Codex、Gemini 3.8 Flash 比較、お金の重ね方は AI Coding Agent の月額は結局いくら を参照。ここでは一つだけ:同じプロジェクトを両側で走らせる。
同じ brief、公平なルールの書き方
双方に同じリポジトリスナップショット、同じスペックのクラウド Mac、同じ受け入れリストを渡した。
既存の Next.js + Postgres 管理画面に「非同期 CSV エクスポート」を追加:認証、キュー、失敗リトライ、メール通知、タスク状態を見られる最小管理ページ。テストは緑、PR は人が読める、デモ経路はクリックできること。
制約は意図的に固定した。
- 相手の diff を見ない。 2台・2つのクリーンな作業領域。
- 受け入れ項目を書き換えない。 質問は可。「メール」を勝手に「ログのみ」へ変えるのは不可。
- 各自のデフォルト殻を許可。 Astra → Codex、Fable 5.1 → Claude Code。裸の API チャットではなく「モデル+日常フロー」を比べる。
- 第2ラウンドで要件を変える。 エクスポート項目をテナントのホワイトリストで絞り、ピーククエリを壊さない。
ベンチ表は後でよい。brief が着地するとき、どこで詰まるかを先に見る。
足場からデモまで:第1ラウンドの違い
どちらも1〜2時間で「開けるもの」は出せる。道筋が違う。
| 観点 | GPT-6 Astra(Codex) | Claude Fable 5.1(Claude Code) |
|---|---|---|
| キューとリトライ | worker・デッドレター・冪等キーを早く揃える | 完走するが、契約確認で止まることが多い |
| 認証の配線 | 既存 middleware を再利用しがち | 権限境界の注釈が細く、ガードが増えることも |
| 管理画面 | 機能優先、「エンジニア向けコンソール」感 | 空状態・エラー・進捗コピーが厚い |
| テスト | 端末で統合テストを先に緑にする | 重要経路の単体→1本の E2E |
第1ラウンドの体感:Astra はパイプラインを通したくて急ぐ同僚、Fable はユーザーが見る状態を先に書く同僚。受け入れが「CI 全緑+デモ脚本」なら Astra が手を挙げやすい。空状態と文言を審査が詰めるなら、Fable の方が手戻りが少ないことが多い。
要件が変わったあと:共有コードに手を出すか
分水嶺は第2ラウンド。ホワイトリストが入ると「エクスポートサービスだけ」は成立しない。共有クエリ、キャッシュキー、時には課金の読み取りビューまで動く。
よくある分岐:
- Astra: 実行欲が強く、端末コマンドが密で、一度に多くのファイルを開く。「先に読み取り探路、その後最小 diff」と明示すると収束が速い。
- Fable 5.1: モジュール横断に慎重で、PR 説明にリスク面を書くことが多い。安全/機微パスでは拒否や迂回があり、業務許可を一文足すと進む。
「常に安全」な一方はない。リポジトリが「動いて速く」か「触れたら二人レビュー」かによる。
UI の感触とコードレビュー:差はどこか
同じレビューに両 PR を入れると、コメントの分布は安定する。
- 見た目と操作: Fable 5.1 の方が余白・無効態・読み込みフィードバックを一度で通しやすい。Astra は機能は正しいが、「固まって見える」を直す第2パスが要ることが多い。
- 読みやすさ: Fable の命名と区切り注釈は人向け。Astra は密度が高く、思考が長く、捨てられる中間実験が diff に混ざることがある。
- ツールとサンドボックス: Codex のデフォルト断網・監査しやすい姿勢はテスト実行を任せやすい。Claude Code の Subagent / Skills が成熟していると、探路ゴミがメインセッションに入りにくい。枠の使い方は Claude Code 2026 使用枠と制限 を参照。
# 同じ受け入れで双方が提出する成果物
1. 緑の CI(失敗リトライ用例を含む)
2. クリック可能な管理画面パスの説明
3. PR 説明:リスク面 + ロールバック
4. 第2ラウンドのホワイトリスト回帰証明
表示価格が同じでも、お金と殻が隠すもの
API 表示はおよそ $10 / $50(100万入力/出力)、窓は百万規模。長い Agent が本当に気にするのはキャッシュ読みとタスクあたり Tokenだ。
| 次元 | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| キャッシュ読み(公開表示の規模感) | 高い | 低い(約4×差がよく出る) |
| 長コンテキスト追加料金 | ある入力帯を超えると加算されうる | 全窓を標準単価にしやすい |
| タスクあたり Token | 思考が密で「話が多い」コストが出ることも | キャッシュ向きの長セッションに強い |
| 日常の殻 | Codex(サンドボックスしやすい) | Claude Code(Subagent / Skills) |
短い実行密集タスクでは Astra の「1回コスト」がよく見えることがある。巨大リポジトリで同じ文脈を何度も読むなら Fable のキャッシュ単価が勝ちやすい。表示が並んでも、月末が並ぶとは限らない。
選定で見るべきこと
「誰がコード上手いか」を総榜ではなく、自分のリポジトリへの四つの問いに分解する。
- 最優先は CI を通すことか、UI を一度で通すことか。 前者は Astra、後者は Fable 5.1 を多めに試す。
- 第2ラウンドで共有モジュールを大きく触るか。 強い制約とリスク説明が要るなら Fable。最小 diff を見張れるなら Astra が速い。
- 同じ大リポを何度も読むか。 $10/$50 だけでなくキャッシュ単価と長コンテキスト加算を見る。
- チームはどの殻にロックされているか。 サンドボックス、Skills、権限の習慣はモデル差し替えより体感を左右しやすい。
ベンチは外札としてまだ役立つ。同じプロジェクト、同じ受け入れが、「自分のリポジトリで誰が本当にコードが上手いか」を教える。
対照実験では、マシンを先に落とさない
「同じ brief、両側」で最悪なのは途中で蓋を閉じること。セッション断、サンドボックス消失、Prompt Cache 失効で次ターンが全量入力課金になり、対照が不公平になる。Mac mini の待機はおよそ 4W。Codex と Claude Code をあなたの窓に合わせて動かし、ノートの休眠で再起動させない。
Apple Silicon の統一メモリは中規模リポの索引と並列テストに向き、macOS は Unix、Homebrew、Docker、SSH を標準で持つので両ターミナル Agent が WSL 層を減らせる。同価格帯の Windows 機よりクラッシュが少なく無人運転が安定し、Gatekeeper と SIP も長時間の Agent 向きだ。
本気のヘッドツーヘッドなら、まず両側のマシン仕様を揃え蓋を開けたまま——プランを確認する。差はモデルに残し、休眠と再ウォームアップに残さない。
