發布頁把 GPT-6 Astra 寫成「最會寫程式的模型」。帳單頁是另一套數字:單價比上一代貴 2.5 倍,思考檔從 low 排到 max。真正卡住團隊的,往往不是「榜上高幾分」,而是同一條 ticket:牆鐘多久、吐多少 Token、月底多少錢,以及能不能一次交出讓人敢合併的 diff。
產品殼常見落在 Codex。殼怎麼拆,見 Claude Code、Codex 與 Gemini 3.8 Flash 對比;錢怎麼疊,見 AI Coding Agent 每月到底要花多少錢。和 Fable 頭對頭做同一專案,見 GPT-6 Astra vs Claude Fable 5.1:誰真的更會寫程式。下面只拆 Astra 自己的四件事:速度、Token、成本、完成率。
公開完成率到底量的是什麼
2026 年 9 月,OpenAI 發布頁給出的軟體工程數字(知識截止 2026-04-30)大致是:
| 評測 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| 內部資料庫遷移任務 | 63.9% | 42.7% | 57.8% |
| AA Coding Agent Index | 67.0 | 65.1 | — |
獨立評測 Artificial Analysis 在 Codex 裡給 Astra 打 62,與 Claude Code 裡的 Fable 5.1 持平。數字能對上,口徑卻不一樣:官方表、第三方 harness、你倉庫裡的「測綠 + 評審敢合併」,三套完成率。
牆鐘速度和思考檔位怎麼讀
Astra 的 reasoning.effort 是 low / medium / high / xhigh / max。檔位越高,越愛多跑幾輪、用瀏覽器覆核、用執行代替盲目 apply-patch——牆鐘和 Token 一起漲。
發布頁另外兩組牆鐘數字:
- Codex harness 更新後,Mind2Web 上相對 GPT-5.6 Sol 大約 1.9× 更快做完。
- OSWorld 2.0:Astra 約 72.6% / 40 分鐘,Sol 約 65.7% / 75 分鐘(少大約 47% 時間)。
- API Fast 模式:標準價的約 2 倍速度,也按約 2 倍計費。
同一倉庫、同一條「非同步 CSV 匯出」ticket 上,Astra 更常先把佇列、重試和 CI 打綠;空白態、載入回饋往往要第二輪。牆鐘好看,不等於評審一次過。
Token 用量和單價為什麼會擰著
標價從 Sol 的 $4 / $20 提到 $10 / $50(每百萬輸入 / 輸出),大約 2.5 倍。快取讀 $1,快取寫 $12.50。貴在單價,省在「同樣任務少說話」。
Artificial Analysis 在 Codex、max 檔上的量級:Astra 每次任務大約只用 Sol 的 三分之一 Token;單任務成本大約 $7.09,比同檔 Fable 5.1 便宜約四成,卻只比 Sol max 貴約 15%,分數更高。Intelligence Index 上,Astra max 大約 27k 輸出 Token,Fable 一側常見到 78k。
讀法就一條:不要只比單價。 短任務、執行密,Token 效率能把 2.5× 標價吃回去;會話反覆讀同一大倉、再觸發長上下文加價,帳單會反過來。
單次任務帳單裡還藏著什麼
| 計費項 | 公開標價量級 | 什麼時候會翻倍 |
|---|---|---|
| 輸入 / 輸出 | $10 / $50 | Fast 模式整單約 ×2 |
| 快取讀 / 寫 | $1 / $12.50 | 輸入超過 272K,整單按長上下文(輸入與快取約 ×2,輸出約 ×1.5) |
| 訂閱席位 | 含在 ChatGPT 檔裡 | 打滿視窗再買積分;API 無帽除非自己設 |
Plus / Pro 訂閱裡通常已包含 Astra 額度,不等於無限 max。一次中等 Agent 回合若把倉庫、日誌、失敗軌跡全塞進視窗,先撞的是 272K 加價,不是 $10 那一行。機器一睡,Prompt Cache 過期,下一句「繼續」按全量輸入——這是最冤的重熱身。月帳單怎麼疊四本帳,仍看成本文。
真實倉庫裡,完成率會掉在哪
把「真實專案完成率」寫成三列,比追一張總榜清楚:
- 評測完成:Terminal-Bench 相對 Sol 跳了一大截;DeepSWE 只高 1.4 分——短程補丁兩邊本來就接近。
- 示範完成:佇列、鑑權、失敗重試,Astra 常更早舉手。
- 合併完成:空狀態、停用態、跨模組風險說明,仍常要人補一句或再開一輪。
掉點最常見的三處:評審盯介面;第二輪要動共享查詢或快取鍵,卻沒寫死「先唯讀、再最小 diff」;為了省 Token 截斷上下文,反而漏約束。第三方也有 low 檔在約半小時、約十一美元量級做完中等遷移的公開案例——那是「能跑通」,不是「不用看就合併」。
日常該怎麼設檔、設帽
- 預設 medium 或 high。 max 留給跨模組重構;low 適合探路和產生重現腳本。
- Fast 不要當過夜預設。 趕示範可以,長重構會把單價再乘一次。
- 能壓在 272K 以下就壓。
/clear換 ticket,比/compact硬壓一整段失敗日誌更便宜。 - 機器保持醒著。 合蓋一小時,快取作廢,下一輪按全量輸入。
- 驗收寫三列。 只看測綠,完成率會被榜單帶高。
# 同一條 ticket 記三列
牆鐘分鐘 | 輸入 / 輸出 / 快取 Token | 能不能直接進評審
測速度和 Token,機器別先掉鏈子
Astra 的牆鐘和快取帳單,最怕中途合蓋:會話斷、沙箱清、Prompt Cache 過期,下一輪按全量輸入,272K 加價也會被無辜觸發。Mac mini 待機大約 4W,適合讓 Codex 按你的思考檔跑完,而不是跟著筆電休眠重啟。
Apple Silicon 統一記憶體方便索引中等倉庫和並行跑測試;macOS 自帶 Unix、Homebrew、Docker 與 SSH,終端 Agent 少一層 WSL。和同價位 Windows 主機比,崩潰少、無人值守更穩,Gatekeeper 與 SIP 也更適合長時間掛 Agent。
若你準備認真記牆鐘和 Token,先保證機器同規格、不合蓋——立即了解套餐方案,把差異留在模型和檔位上,而不是留在休眠和重熱身上。
