終端裡同時開著兩三個 Coding Agent,已經不稀奇。名字都眼熟:Claude Code、Codex、Gemini 3.8 Flash。可要是還按「誰補全更準」來比,很容易選錯東西。
前兩個是能自己跑迴圈的 Agent 產品;Flash 先是模型,還得疊在 CLI 或 Antigravity 上才算能做事。測試過不過、帳單會不會被上下文打穿、工具接不接得上——這些開篇一句話拍不了板,得一節一節拆。
額度與套餐細節可對照 Claude Code 2026 使用額度與限制完整指南;若還在 IDE 訂閱和 CLI Agent 之間搖擺,見 2026 年更便宜的 Cursor 替代方案。
先對齊:你在比的不是同一類東西
| 你最在意 | 更該選 | 原因 |
|---|---|---|
| 多檔案重構、長任務、少返工 | Claude Code | Subagent 成熟,Opus 5 在通用 Agent 基準上明顯領先 |
| 預設可稽核、預設可沙箱、要開源 | Codex CLI | Apache-2.0,預設斷網,顯式拉起 Subagent |
| 大批量、多模態、把單次 Token 壓到最低 | Gemini 3.8 Flash | 促銷價約為 Sonnet 5 的 1/3,SWE 短任務很能打 |
沒有「全面第一」。DeepMind 在 Gemini 3.8 Flash 模型卡(2026 年 9 月)裡自己也承認:Flash 在軟體工程短程上逼近旗艦,但在更長的通用 Agent 任務上仍落後 Opus 5。
程式碼品質:短程和長程是不是一回事
把「程式碼品質」拆成兩層更清楚:一層是單次改對檔案的能力(補丁能不能編過、測過),一層是跨會話把任務做完的能力(會不會中途跑偏、亂改無關模組)。
DeepMind 模型卡裡的公開對照(2026 年 9 月):
| 基準 | 測的是什麼 | Gemini 3.8 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 長程軟體工程 | 73.7% | 74.0% | 53.8% | 72.7% | 69.6% |
| Terminal-bench 2.1 | 終端裡寫程式 | 89.4% | 89.1% | 80.4% | 88.8% | 87.4% |
| Terminal-bench 4.0 | 更一般的 Agent | 19.1% | 51.8% | 12.4% | 37.3% | 23.6% |
| OSWorld-2.0 | 操控電腦 | 59.0% | 75.4% | 42.6% | 62.6% | 50.2% |
讀法:
- 日常補丁、終端腳本、中等倉庫:Flash、Opus 5、GPT-5.6 Sol 幾乎站在同一台階。Flash 甚至在 Terminal-bench 2.1 上略高。
- 跨工具、跨會話、要自己規劃的長任務:Opus 5 把 Terminal-bench 4.0 拉到 51.8%,Sol 37.3%,Flash 只有 19.1%。這就是「便宜模型很會寫函式,但不太會當專案經理」的量化版本。
- Sonnet 5 仍是 Claude Code 的預設工作馬:單價低、1M 上下文原生,但 DeepSWE 只有 53.8%。難重構請顯式切 Opus,不要指望預設模型扛旗艦活。
體感上,Claude Code 更少「改了 A 檔案卻弄壞 B」;Codex 在命令列與多步腳本上很穩,且預設沙箱讓你敢讓它跑測試;Gemini 3.8 Flash 快、便宜、多模態強,但長鏈路更容易丟目標,需要你把任務切短,或提高 thinking effort。
Context:視窗夠大之後,錢花在哪
| 產品 | 預設模型 Context | 最大輸出 | 長上下文計價 |
|---|---|---|---|
| Claude Code(Sonnet 5 / Opus 5) | 1M(API 原生) | 128k | 官方未另收長上下文附加費 |
| Codex(GPT-5.6) | 約 1.05M | 128k | 超過約 272k 輸入,部分檔位會加價 |
| Gemini 3.8 Flash | 1,048,576 | 64k | 促銷期按同一單價;2027 年起標準價翻倍 |
視窗數字已經不是賣點。真正燒錢的是:每次請求都把歷史、工具輸出、倉庫切片再發一遍。
- Claude Code:對話越長越貴;
/clear比/compact便宜。Skills、MCP 結果、測試日誌都會進主會話。Subagent 的價值之一,就是把檢索垃圾留在子視窗,只把摘要交回。 - Codex:顯式 spawn Subagent,主會話更乾淨,Token 更可預期;代價是你要自己寫清「開幾個、各做什麼」。
- Gemini 3.8 Flash:1M 視窗 + 可調 effort(
low/medium/high)。effort 越高,思考 Token 越多、延遲越高。知識截止約 2026 年 3 月,新套件 API 仍要靠檢索或 MCP,不能假設模型「什麼都知道」。
大倉庫不要整倉塞進視窗。用 Explore / explorer 只讀掃一遍,再讓主 Agent 改關鍵檔案。並行編碼時的隔離,見站內 Parallel AI Coding 完整指南。
MCP:協定統一了,坑還在哪
三家都支援 Model Context Protocol。2026 年的問題不再是「支不支援 MCP」,而是:誰的生態更深、誰改設定更不容易踩坑、誰下次換產品線時你的伺服器還能接著用。
| Claude Code | Codex CLI | Gemini 3.8 Flash 所在棧 | |
|---|---|---|---|
| 接入方式 | claude mcp add(http / stdio;SSE 已棄用) |
config.toml |
settings.json / Antigravity 外掛 |
| 生態 | 最深(協定發起方) | 夠用,偏工程向 | 能接,企業側更完整 |
| 額外擴充 | Skills、Hooks、Plugins | Skills、exec 模式、可換模型後端 | Skills / Hooks / Subagents 遷到 Antigravity |
Claude Code 仍然是「先接 GitHub、資料庫、內部 API」時阻力最小的一條。Codex 的優勢是設定可進倉庫、可稽核,並且能指向任何相容 Chat Completions / Responses 的後端——模型被砍也不至於整條鏈路報廢。Gemini 一側,個人開發者要分清:模型便宜 ≠ Agent 產品穩定。2026 年中 Gemini CLI 對個人套餐收緊後,社群被導向 Antigravity;擴充面大體還在,但「開源 CLI + 補貼端點」這個組合已經拆開。若你的路線圖還押 Gemini 大版本,可對照 Gemini 4 值得等嗎。
Subagents:兩種拉起方式差在哪
兩邊都採用「編排器 + 子 Agent」,哲學相反。
Claude Code 把 Subagent 當成一等公民:Explore、Plan、通用工人各有自己的上下文、工具白名單和權限。主 Agent 對照 description 自動委派,你不寫「去開一個探索者」也會發生。背景 Subagent 可繼續跑,必要時進獨立 worktree。省下來的是主視窗裡的檢索垃圾;多出來的是 Token——官方量級上,計畫模式的 Agent 團隊可以到普通會話的數倍。自訂角色用 YAML frontmatter,和 Skills 同一套發佈思路。
Codex 預設不自動開子行程。你要在提示裡寫清「每個檢查點 spawn 一個 Agent」。Explorer 偏只讀,可搭配 sandbox_mode。好處是費用可預期、並行範圍由你劃;壞處是少寫一句,它就只會在主會話裡慢慢搜。
Gemini 3.8 Flash 本身不是執行階段。Antigravity / Managed Agents 宣稱帶過 Skills、Hooks、Subagents,但成熟度和文件深度仍不如 Claude Code。把 Flash 接到自建編排器(或 Codex 的多後端)往往更可控:貴活給 Opus / Sol,批量掃倉庫給 Flash。
# Claude Code:主會話隱式分流
主 Agent(Opus / Sonnet)
├─ Explore(Haiku,只讀)→ 只回摘要
├─ Plan → 方案,不直接改生產檔案
└─ 實作 / 驗證 → 獨立上下文,必要時背景
# Codex:你點名才開工
主會話(GPT-5.6 Terra / Sol)
└─ 你寫 “spawn explorer + reviewer”
└─ 子 Agent 做完交回,主會話繼續拍板
Terminal:命令能不能放心交給 Agent
Agent 的生產力 = 它能跑 pytest、npm test、git 的次數。風險也在這裡。
| 問題 | Claude Code | Codex CLI | Gemini 3.8 Flash 棧 |
|---|---|---|---|
| 預設沙箱 | Seatbelt / bubblewrap | 預設開啟,Linux 帶 seccomp | 視宿主 Agent;模型本身不管行程 |
| 預設網路 | 新網域要批准 | 預設關閉 | 取決於 Antigravity / 你的執行階段 |
| Windows | 走 WSL2 | 原生沙箱或 WSL2 | 看具體產品 |
| 開源核心 | 否(發行倉庫 + 外掛) | 是,Apache-2.0,Rust | 模型閉源;舊 Gemini CLI 開源但個人通道已收縮 |
Codex 的預設斷網是 2026 年最硬的安全預設值:Agent 讀不到外網,就很難把 .env 貼到陌生主機。Claude Code 更靈活——按網域放行,適合要查文件、拉套件的日常開發——但官方自己寫過:代理不做 TLS 終結,存在網域前置繞過可能。企業應自建可檢查的代理。
Gemini 3.8 Flash 在 Terminal-bench 2.1 上 89.4%,說明模型會用終端;會不會在你的機器上亂來,取決於外面包的是 Antigravity、自建 runner,還是乾脆把它當 Codex / Claude 的便宜後端。不要把「模型基準高」理解成「已經幫你做好沙箱」。
Token 帳單:三種算法怎麼比
價格以各官方頁為準,本文數字對齊 2026 年 9 月 的公開標價(DeepMind 模型卡 + Anthropic / Google 定價說明)。匯率和促銷會變,預算請再核一遍。
API 單價(每百萬 Token)
| 模型 | 輸入 | 輸出 | 角色 |
|---|---|---|---|
| Gemini 3.8 Flash(至 2026-12-31) | $0.75 | $3.75 | 批量、短任務、多模態 |
| Gemini 3.8 Flash(2027-01-01 起) | $1.50 | $7.50 | 同上,促銷結束 |
| Claude Sonnet 5 | $2 | $10 | Claude Code 預設 |
| GPT-5.6 Terra | $2 | $12 | Codex 日常檔 |
| GPT-5.6 Sol | $4 | $20 | Codex 旗艦 |
| Claude Opus 5 | $5 | $25 | 難重構、長 Agent |
| Claude Fable 5 | $10 | $50 | 超長程,需顯式選擇 |
一次中等 Agent 回合按 80k 輸入 + 8k 輸出粗算:Flash 約 $0.09,Sonnet 5 約 $0.24,Sol 約 $0.48,Opus 5 約 $0.60。快取命中後輸入可再降一個數量級。Flash 的「便宜」在高 effort、反覆重試、把 1M 視窗填滿時會迅速消失。
訂閱形態
- Claude Code:Pro 約 $20 / 月,Max 5x $100、20x $200。網頁 Claude 與 CLI 共用額度。沒有低於 $20 的個人檔。細節見額度指南。
- Codex:跟 ChatGPT 走,有 Free / Go(約 $8)/ Plus $20,以及 5x、20x。唯一一條「二十美元以下就能用完整終端 Agent」的大眾入口。
- Gemini 3.8 Flash:個人側主要是 API 按量 + Google AI / Gemini Enterprise Agent Platform。Agent 殼(Antigravity、Code Assist)另算席位。模型便宜,不代表「整個開發位」便宜。
開發效率:怎麼選才不踩坑
效率不是基準分數,是你每週合入的可靠變更。
- 一個人、要深度改倉庫:Claude Code + Sonnet 5,難關切 Opus。把 Skills 和 MCP 配齊,比再買一個訂閱更能減少來回。
- 要稽核、要預設安全、Windows 原生:Codex CLI。把 spawn 規則寫進倉庫,費用不會在你開會時偷偷翻倍。
- 流水線、夜批、多模態(截圖 / 螢幕錄影 / PDF):Gemini 3.8 Flash。64k 輸出夠寫補丁說明,不夠一次吐完整大檔——讓它分段。
- 團隊:用同一套 MCP 和評審門禁,允許模型混用。鎖死一家,會在對方調價或收緊個人通道時被動。
- 機器:Agent 要 24 小時讀碟、跑測試、掛 MCP。筆電合蓋等於快取作廢、上下文重付。穩定、低功耗的雲端 Mac 比「再買一檔 Max」更常成為隱藏瓶頸。
# 同一任務,先用便宜模型探路,再把 diff 交給旗艦
# Flash / Terra:產生重現腳本與測試草稿
# Sonnet / Opus / Sol:審查 diff、改公共 API、收口 PR
常見問題
Gemini 3.8 Flash 能直接當 Claude Code 用嗎?
不能。它是模型。要終端迴圈、權限和 MCP,還得有 Antigravity、Gemini 企業 Agent,或你自己的 runner。把 Flash 接到 Codex 這類多後端 CLI,是目前最常見的「要便宜腦、要成熟殼」組合。
2026 年還有免費的 Gemini CLI 個人檔嗎?
不要按 2025 年的印象做預算。年中起個人通道收縮,社群被導向 Antigravity 與按量 API。企業 Code Assist 仍是另一條線。下單前看目前授權頁,不要看舊部落格。
Context 都是 1M,是不是塞得越多越好?
不是。視窗是上限,不是目標。多餘的工具輸出和下架檔案會同時打品質、延遲和帳單。先檢索,再精讀。
只看 Terminal-bench 2.1 能不能定標?
不能。2.1 上三家旗艦幾乎打平;4.0 和 OSWorld 才露出長程差距。短腳本選 Flash 合理,跨週重構選 Opus / Sol 更穩。
價格會不會下週就變?
會。Flash 促銷寫到 2026 年 12 月 31 日;Sonnet 5 的 $2 / $10 已改為長期價。以 Anthropic、OpenAI、Google Cloud 當天頁面為準。
Agent 再強,也要一台不合蓋的機器
Claude Code、Codex 和 Gemini 3.8 Flash 比的是雲端 Token,但讀寫倉庫、跑測試、掛 MCP 都發生在你面前這台機器上。筆電一合蓋,會話斷、沙箱清、Prompt Cache 過期,下一輪按全量輸入計費。Mac mini 待機大約 4W,適合讓終端 Agent 按你的滾動視窗工作,而不是跟著合蓋重啟。
Apple Silicon 統一記憶體更適合索引大倉庫和並行測試;macOS 自帶 Unix、Homebrew、Docker 與 SSH,Claude Code 與 Codex 的 computer-use / 終端迴圈都更順。和同價位 Windows 主機比,當機少、無人值守更穩,Gatekeeper 與 SIP 也降低長期掛 Agent 的風險。
若你已經在為 Token 和上下文精打細算,先保證機器不掉線,往往比再升一檔訂閱更划算——立即了解套餐方案,把錢花在改程式上,而不是反覆熱身。