Kvmzen ブログ
← 技術の実践に戻る

Claude Code vs Codex vs Gemini 3.8 Flash:2026年 AI Coding Agent 比較、コード品質、Context、MCP、Subagents、Terminal、Token コストと開発効率

AIDevelopment ·約 22 分

複数モニターのターミナルで AI Coding Agent を並行実行する開発者

同じターミナルに Coding Agent を2つ3つ開いている現場は、もう珍しくありません。名前は見慣れている。Claude Code、Codex、Gemini 3.8 Flash。これを「誰が1行うまく補完するか」で比べると、選び方を間違えやすい。

前の二つは自分でループを回せる Agent 製品です。Flash はまずモデルで、CLI か Antigravity に載せないと仕事になりません。テストが通るか、請求がコンテキストで膨らまないか、ツールが本当に繋がるか——冒頭の一段では決まりません。節を追って拆きます。

利用枠とプランの詳細は Claude Code 2026 利用枠と制限の完全ガイド と照合してください。IDE サブスクと CLI Agent のあいだで迷っている場合は、2026年、Cursor より安い代替ツール をご覧ください。

1M
Context 窓の規模
$0.75
Flash プロモの入力単価
51.8%
長いタスクのベンチ上の一点

まず揃える:比べているものは同じ種類ではない

いちばん重視する点 向いている選択 理由
複数ファイルのリファクタ、長タスク、手戻りを減らしたい Claude Code Subagent が成熟。Opus 5 が汎用 Agent ベンチで明確に先行
デフォルトで監査可能、デフォルトでサンドボックス、オープンソースが必要 Codex CLI Apache-2.0。デフォルトでオフライン。Subagent は明示的に起動
大量処理、マルチモーダル、1回あたりの Token を最低に抑えたい Gemini 3.8 Flash プロモ価格は Sonnet 5 のおよそ 1/3。SWE の短タスクに強い

「すべてで一位」はありません。DeepMind 自身も Gemini 3.8 Flash のモデルカード(2026年9月)で認めています。Flash はソフトウェア工学の短距離では旗艦に迫りますが、より長い汎用 Agent タスクでは依然として Opus 5 に遅れます。

コード品質:短距離と長距離は同じ技か

「コード品質」は二層に分けると分かりやすいです。一層は一度のリクエストでファイルを正しく直す能力(パッチがビルドとテストを通るか)、もう一層はセッションをまたいでタスクをやり遂げる能力(途中で逸れないか、無関係なモジュールを壊さないか)です。

DeepMind モデルカードの公開対照(2026年9月):

ベンチ 測っているもの Gemini 3.8 Flash Claude Opus 5 Claude Sonnet 5 GPT-5.6 Sol GPT-5.6 Terra
DeepSWE v1.1 長距離のソフトウェア工学 73.7% 74.0% 53.8% 72.7% 69.6%
Terminal-bench 2.1 ターミナルでコードを書く 89.4% 89.1% 80.4% 88.8% 87.4%
Terminal-bench 4.0 より一般的な Agent 19.1% 51.8% 12.4% 37.3% 23.6%
OSWorld-2.0 パソコンの操作 59.0% 75.4% 42.6% 62.6% 50.2%

読み方:

  • 日常のパッチ、ターミナルスクリプト、中規模リポジトリ:Flash、Opus 5、GPT-5.6 Sol はほぼ同じ段に並びます。Flash は Terminal-bench 2.1 でわずかに上回ることさえあります。
  • ツール横断、セッション横断、自分で計画する長タスク:Opus 5 は Terminal-bench 4.0 を 51.8% まで引き上げ、Sol は 37.3%、Flash は 19.1% にとどまります。これが「安いモデルは関数は書けるが、プロジェクトマネージャーにはなりにくい」の定量版です。
  • Sonnet 5 はいまも Claude Code のデフォルトのワークホースです。単価は低く、1M コンテキストはネイティブですが、DeepSWE は 53.8% です。難しいリファクタは明示的に Opus へ切り替えてください。デフォルトモデルに旗艦級の仕事を期待しないでください。

体感としては、Claude Code は「A ファイルを直して B を壊す」が少なめです。Codex はコマンドラインと多段スクリプトが安定しており、デフォルトのサンドボックスがあるのでテストを走らせやすいです。Gemini 3.8 Flash は速く、安く、マルチモーダルが強い一方、長いチェーンでは目標を落としやすいです。タスクを短く切るか、thinking effort を上げる必要があります。

Context:窓が十分大きくなったあと、金はどこに消えるか

製品 デフォルトモデルの Context 最大出力 長コンテキスト課金
Claude Code(Sonnet 5 / Opus 5) 1M(API ネイティブ) 128k 公式は長コンテキストの追加料金を別途取っていない
Codex(GPT-5.6) 1.05M 128k 入力が約 272k を超えると、一部の料金帯で加算
Gemini 3.8 Flash 1,048,576 64k プロモ期間は同一単価。2027年以降は標準価格が倍

窓の数字はもう売りではありません。本当にコストが膨らむのは、毎回のリクエストで履歴、ツール出力、リポジトリのスライスをまた送り直すことです。

  • Claude Code:会話が長いほど高くなります。/clear/compact より安く済みます。Skills、MCP の結果、テストログはすべてメインセッションに入ります。Subagent の価値のひとつは、検索のゴミを子窓に残し、要約だけを返すことです。
  • Codex:Subagent を明示的に spawn するので、メインセッションはよりきれいで、Token も予測しやすいです。代償は、「いくつ開いて、それぞれ何をするか」を自分で書き切る必要があることです。
  • Gemini 3.8 Flash:1M 窓 + 調整可能な effort(low / medium / high)。effort が高いほど思考 Token が増え、遅延も上がります。知識カットオフはおよそ 2026年3月 です。新しいライブラリ API は依然として検索か MCP に頼る必要があり、モデルが「何でも知っている」とは仮定できません。

大きなリポジトリを窓に丸ごと入れないでください。Explore / explorer で読み取り専用の一巡をしてから、メイン Agent に重要なファイルを直させてください。並列コーディング時の隔離は、サイト内の Parallel AI Coding ガイド をご覧ください。

MCP:プロトコルは揃った。落とし穴はどこか

3社とも Model Context Protocol をサポートしています。2026年の問題はもはや「MCP をサポートするか」ではなく、誰のエコシステムが深いか、設定変更で落とし穴に落ちにくいか、次に製品ラインを乗り換えてもサーバーが使い続けられるかです。

Claude Code Codex CLI Gemini 3.8 Flash が載るスタック
接続方法 claude mcp add(http / stdio。SSE は非推奨) config.toml settings.json / Antigravity プラグイン
エコシステム 最も深い(プロトコルの提唱側) 十分、エンジニアリング寄り 接続できる。企業側はより整っている
追加の拡張 Skills、Hooks、Plugins Skills、exec モード、モデルバックエンドの差し替え可 Skills / Hooks / Subagents は Antigravity へ移行

Claude Code はいまも「まず GitHub、データベース、社内 API を繋ぐ」ときの抵抗が最も小さい経路です。Codex の強みは、設定をリポジトリに入れられて監査でき、Chat Completions / Responses 互換の任意のバックエンドを指せることです。モデルが切られても、パイプライン全体が死ぬことはありません。Gemini 側では、個人開発者は次を切り分ける必要があります。モデルが安い ≠ Agent 製品が安定している。2026年半ばに Gemini CLI が個人プランを引き締めたあと、コミュニティは Antigravity に誘導されました。拡張面はおおむね残っていますが、「オープンソース CLI + 補助されたエンドポイント」という組み合わせはすでに分かれています。ロードマップがいまだに Gemini の大型バージョンに賭けているなら、Gemini 4 は待つべきか と照合してください。

MCP は Context を食う
毎回のツール返信は窓に入ります。ログ、テーブル全体の dump、大きな Diff は、モデル本体より高くつきます。MCP にフィルタ、ページネーション、読み取り専用権限を付ける方が、もう一段階のサブスクを買うより効きます。

Subagents:助けを呼ぶ二つのやり方

どちらも「オーケストレータ + 子 Agent」を採りますが、哲学は逆です。

Claude Code は Subagent を第一級市民として扱います。Explore、Plan、汎用ワーカーはそれぞれ独自のコンテキスト、ツールのホワイトリスト、権限を持ちます。メイン Agent は description を見て自動で委譲します。「探索者を開け」と書かなくても起きます。バックグラウンドの Subagent は動き続け、必要なら独立した worktree に入ります。節約できるのはメイン窓の検索ゴミです。増えるのは Token です。公式の規模感では、プランモードの Agent チームは通常セッションの数倍になり得ます。カスタムロールは YAML frontmatter で、Skills と同じ配布の考え方です。

Codex はデフォルトでは子プロセスを自動で開きません。プロンプトに「各チェックポイントで Agent を spawn する」と書き切る必要があります。Explorer は読み取り専用寄りで、sandbox_mode と組み合わせられます。利点は費用が予測でき、並列の範囲を自分で区切れることです。欠点は一文書き忘れると、メインセッションの中でゆっくり探すだけになることです。

Gemini 3.8 Flash 自体はランタイムではありません。Antigravity / Managed Agents は Skills、Hooks、Subagents を載せたと称していますが、成熟度とドキュメントの深さはまだ Claude Code に及びません。Flash を自前のオーケストレータ(または Codex のマルチバックエンド)に繋ぐ方が、しばしば制御しやすいです。高い仕事は Opus / Sol に、リポジトリの一括スキャンは Flash に任せます。

# Claude Code:メインセッションが暗黙に振り分ける
メイン Agent(Opus / Sonnet)
  ├─ Explore(Haiku、読み取り専用)→ 要約だけ返す
  ├─ Plan → 方針。本番ファイルは直接直さない
  └─ 実装 / 検証 → 独立コンテキスト。必要ならバックグラウンド

# Codex:指名して初めて動く
メインセッション(GPT-5.6 Terra / Sol)
  └─ 「spawn explorer + reviewer」と書く
        └─ 子 Agent が終えて返す。メインセッションが判断を続ける

Terminal:コマンドを任せてよいか

Agent の生産性 = pytestnpm testgit を走らせられる回数です。リスクもここにあります。

論点 Claude Code Codex CLI Gemini 3.8 Flash スタック
デフォルトのサンドボックス Seatbelt / bubblewrap デフォルトで有効。Linux は seccomp 付き ホスト側の Agent 次第。モデル自体はプロセスを管理しない
デフォルトのネットワーク 新しいドメインは承認が必要 デフォルトでオフ Antigravity / 自分のランタイム次第
Windows WSL2 経由 ネイティブサンドボックスまたは WSL2 具体的な製品による
オープンソースのコア いいえ(配布リポジトリ + プラグイン) はい、Apache-2.0、Rust モデルはクローズド。旧 Gemini CLI はオープンソースだが個人チャネルはすでに縮小

Codex のデフォルトオフラインは、2026年でいちばん硬いセキュリティデフォルトです。Agent が外部ネットワークを読めなければ、.env を見知らぬホストに貼ることは難しくなります。Claude Code はより柔軟です——ドメイン単位で許可するので、ドキュメントを調べたりパッケージを引いたりする日常開発に向きます——ただし公式自身が書いています。プロキシは TLS 終端をしないため、ドメインフロンティングによる迂回の余地があります。企業は検査可能なプロキシを自前で置くべきです。

Gemini 3.8 Flash は Terminal-bench 2.1 で 89.4% です。これはモデルがターミナルを使えることを示します。あなたのマシンで暴走するかどうかは、外側が Antigravity か、自前の runner か、それとも Codex / Claude の安いバックエンドとして使うかで決まります。「モデルのベンチが高い」を「サンドボックスまで用意済み」と読まないでください。

Token 請求:三つの計算の見方

価格は各公式ページを正とします。本稿の数字は 2026年9月 の公開表示(DeepMind モデルカード + Anthropic / Google の料金説明)に揃えています。為替とプロモーションは変わります。予算はもう一度確認してください。

API 単価(100万 Token あたり)

モデル 入力 出力 役割
Gemini 3.8 Flash(2026-12-31 まで) $0.75 $3.75 一括処理、短タスク、マルチモーダル
Gemini 3.8 Flash(2027-01-01 以降) $1.50 $7.50 同上。プロモ終了後
Claude Sonnet 5 $2 $10 Claude Code のデフォルト
GPT-5.6 Terra $2 $12 Codex の日常向け
GPT-5.6 Sol $4 $20 Codex の旗艦
Claude Opus 5 $5 $25 難しいリファクタ、長い Agent
Claude Fable 5 $10 $50 超長距離。明示的に選ぶ必要あり

中程度の Agent ターンを 80k 入力 + 8k 出力で粗く見積もると、Flash は約 $0.09、Sonnet 5 は約 $0.24、Sol は約 $0.48、Opus 5 は約 $0.60 です。キャッシュヒット後の入力はさらに一桁下がることがあります。Flash の「安さ」は、高い effort、繰り返しの再試行、1M 窓を埋めたときに急速に消えます。

サブスクの形

  • Claude Code:Pro は約 $20 / 月、Max 5x は $100、20x は $200。ウェブの Claude と CLI は枠を共有します。$20 未満の個人プランはありません。詳細は利用枠ガイドをご覧ください。
  • Codex:ChatGPT に従います。Free / Go(約 $8)/ Plus $20、および 5x、20x があります。「20ドル未満で完成したターミナル Agent が使える」唯一の大衆向け入口です。
  • Gemini 3.8 Flash:個人側は主に API 従量 + Google AI / Gemini Enterprise Agent Platform です。Agent の殻(Antigravity、Code Assist)は席が別計算です。モデルが安いことは、「開発席全体」が安いことではありません。
混ぜて使う方が、陣営に立つより安いことが多い
メインセッションは Claude Code または Codex でアーキテクチャと難しい Bug を担当させます。Flash はテスト生成、ドキュメント、大規模な読み取り専用スキャンに使います。高いモデルは「判断」に残し、安いモデルは「スループット」に使います。

開発効率:踏み抜きせずに選ぶには

効率はベンチの点数ではなく、毎週マージできる信頼できる変更です。

  1. 一人で、リポジトリを深く直す:Claude Code + Sonnet 5。難所は Opus に切り替えます。Skills と MCP を揃える方が、もう一つのサブスクを買うより往復を減らせます。
  2. 監査が要る、デフォルトの安全が要る、Windows ネイティブが要る:Codex CLI。spawn のルールをリポジトリに書けば、会議中に費用がこっそり倍になることはありません。
  3. パイプライン、夜間バッチ、マルチモーダル(スクリーンショット / 録画 / PDF):Gemini 3.8 Flash。64k 出力はパッチ説明を書くには足りますが、大きなファイルを一度に吐き切るには足りません。段階に分けて出させてください。
  4. チーム:同じ MCP とレビューゲートを使い、モデルの混用を許します。一社に固定すると、相手の値上げや個人チャネルの引き締めに受動的になります。
  5. マシン:Agent は24時間ディスクを読み、テストを走らせ、MCP を開きます。ノートのフタを閉じることは、キャッシュ無効とコンテキストの再課金を意味します。安定して低消費電力のクラウド Mac は、「もう一段階 Max を買う」より、隠れたボトルネックになることが多いです。
# 同じタスクでも、まず安いモデルで探り、diff を旗艦に渡す
# Flash / Terra:再現スクリプトとテスト草稿を生成
# Sonnet / Opus / Sol:diff をレビューし、公開 API を直し、PR を閉じる

よくある質問

Gemini 3.8 Flash をそのまま Claude Code 代わりに使えますか?
使えません。モデルです。ターミナルループ、権限、MCP には、Antigravity、Gemini の企業向け Agent、あるいは自前の runner がまだ必要です。Flash を Codex のようなマルチバックエンド CLI に繋ぐのが、いまいちばん多い「安い頭脳、成熟した殻」の組み合わせです。

2026年にも無料の Gemini CLI 個人プランはありますか?
2025年の印象で予算を組まないでください。年央から個人チャネルは縮小し、コミュニティは Antigravity と従量 API に誘導されました。企業向け Code Assist は別の線です。発注前に現行のライセンスページを見てください。古いブログを見ないでください。

Context はどれも 1M なら、詰めれば詰めるほどよいですか?
いいえ。窓は上限であり、目標ではありません。余分なツール出力と使われなくなったファイルは、品質・遅延・請求を同時に悪化させます。先に検索し、それから精読してください。

Terminal-bench 2.1 だけ見て採点できますか?
できません。2.1 では3社の旗艦はほぼ互角です。4.0 と OSWorld で初めて長距離の差が出ます。短いスクリプトなら Flash は妥当です。週をまたぐリファクタなら Opus / Sol の方が安定します。

価格は来週変わりますか?
変わります。Flash のプロモは 2026年12月31日までと書いてあります。Sonnet 5 の $2 / $10 はすでに長期価格に変わりました。Anthropic、OpenAI、Google Cloud のその日のページを正としてください。

Agent が強くても、フタを閉じないマシンが要る

Claude Code、Codex、Gemini 3.8 Flash が競うのはクラウド側の Token です。しかしリポジトリの読み書き、テスト実行、MCP の常駐は、目の前のこのマシンで起きます。ノートのフタを閉じた瞬間にセッションが切れ、サンドボックスが消え、Prompt Cache が期限切れになり、次のラウンドは全量入力で課金されます。Mac mini の待機電力はおよそ 4W。ターミナル Agent をあなたのローリングウィンドウで働かせるのに向き、フタ閉じに合わせて再起動させる必要はありません。

Apple Silicon のユニファイドメモリは、大きなリポジトリのインデックスと並列テストに向きます。macOS は Unix、Homebrew、Docker、SSH が最初から揃っており、Claude Code と Codex の computer-use / ターミナルループもより滑らかです。同価格帯の Windows ホストと比べ、クラッシュが少なく無人運転が安定します。Gatekeeper と SIP も、Agent を長く常駐させるリスクを下げます。

Token とコンテキストをすでに細かく見ているなら、まずマシンが落ちないことを保証する方が、もう一段階サブスクを上げるより得になることが多いです——今すぐプランを見る。お金はコード変更に使い、ウォーミングアップの繰り返しには使わないでください。

関連記事

期間限定オファー

1 台の Mac を超えた、クラウド上のあなたの開発基地

専有算力 · グローバルノード · 月額サブスクリプション · ハードウェア不要

ホームに戻る
期間限定オファー プランを見る