DevDay 之后的一周,群里最常见的不是「Astra 赢了」,而是三张控制台截图叠在一起:OpenAI 的 Agents API、Anthropic 的 Fable 缓存价、Google 的 Flash 促销倒计时。同一条「给后台加导出」的工单,有人贴 $10/$50,有人贴 $0.75,财务问的是月底会不会差一个数量级。
模型页、Agent 页、席位页往往不是一张发票。产品壳怎么拆,见 Claude Code、Codex 与 Gemini 3.8 Flash 对比;Astra 自己的墙钟和 Token,见 GPT-6 Astra 写代码实测。下面只谈 API:价格、速度、Agent 能力,以及这三样为什么不能单独看。
这波更新之后,API 在比几张账单
2026 年 9 月这轮,公开面上至少叠了三件事:gpt-6-astra 进 API 与 Azure / Bedrock;9 月 10 日 Agents API 公测(托管 Codex harness,不另收接口费,按 Token 和工具计);Anthropic 把 Fable 5.1 的缓存读打到 $0.25;Gemini 3.8 Flash 把介绍价挂到 2026-12-31。Agent Builder 那条可视化画布则写了 11 月 30 日 下线,要迁 Agents SDK。
先别比「谁更聪明」。先对齐发票形状:
| 账本 | OpenAI | Anthropic | |
|---|---|---|---|
| 模型 API | Astra / Sol / Terra 按 Token | Fable / Opus / Sonnet 按 Token | Flash 按 Token(席位另算) |
| 缓存 | 读 $1,写 $12.50;超 272K 整单加价 | Fable 5.1 读 $0.25 | 支持缓存,单价仍远低于旗舰 |
| Agent 运行时 | Agents API:沙箱、MCP、压缩、子 Agent | Claude Code / Messages 工具循环 | Antigravity、Managed Agents |
| 额外计费 | Computer use 按工具调用;Fast 约 ×2 | Opus Fast(预览,不含 Fable) | 思考档与工具轮次会抬 Token |
数字对齐 2026 年 9 月 公开标价。汇率、税、促销会变,下单前再核官方页。
单价和单次任务成本是不是一回事
每百万 Token(输入 / 输出):
| 模型 | 输入 | 输出 | 缓存读 | 读标价时先看什么 |
|---|---|---|---|---|
| Gemini 3.8 Flash(至 2026-12-31) | $0.75 | $3.75 | 远低于旗舰 | 2027-01-01 起 $1.50 / $7.50 |
| GPT-5.6 Terra | $2 | $12 | — | Codex / API 日常档 |
| Claude Sonnet 5 | $2 | $10 | 0.1× 输入 | 多数编码的默认起点 |
| GPT-5.6 Sol | $4 | $20 | — | 上一档旗舰 |
| Claude Opus 5 | $5 | $25 | 0.1× 输入 | Anthropic 写「多数工作先用它」 |
| GPT-6 Astra | $10 | $50 | $1 | 超 272K:输入与缓存约 ×2,输出约 ×1.5;Fast ×2 |
| Claude Fable 5.1 | $10 | $50 | $0.25 | 5 分钟缓存写 $12.50;1 小时写 $20 |
一次中等回合按 80k 输入 + 8k 输出 粗算:Flash 约 $0.09,Sonnet 约 $0.24,Terra 约 $0.26,Sol 约 $0.48,Opus 约 $0.60,Astra / Fable 约 $1.20。Agent 很少只打一枪。缓存命中、思考档、工具轮次,会把「单价便宜」和「任务便宜」拧开。
Flash 的介绍价大约是旗舰的十三分之一,但不等于「免费 Claude」。Google 写明:难任务上 3.8 会主动多走推理步和工具轮次。便宜脑 + 密工具,单任务 Token 仍可能接近中档模型。月账单怎么把订阅、API 和机器叠在一起,见 AI Coding Agent 每月到底要花多少钱。
墙钟速度藏在哪几档开关里
三家都把「更快」藏在档位里,不是藏在模型名里。
- Astra:
reasoning.effort为 low / medium / high / xhigh / max(没有none)。档位越高,越爱多跑几轮、用浏览器复核。API Fast 大约 2 倍墙钟、2 倍标价。发布页上 OSWorld 2.0:Astra 约 72.6% / 40 分钟,Sol 约 65.7% / 75 分钟。 - Fable 5.1:官方表写比 Opus 5、Sonnet 5 更慢,思考自适应且默认
high。你买的是长程判断,不是首 Token。 - Flash:Flash 级首包;思考档 low / medium / high(
minimal会报错)。日常把 effort 打到 low,墙钟和 Token 一起降;难任务它自己会加轮次。
首 Token 快,不等于工单结束快。Astra 更常先把队列和 CI 打绿,空白态往往要第二轮;Fable 更常在界面和风险说明上少返工。同一项目怎么打,见 GPT-6 Astra vs Claude Fable 5.1:谁真的更会写代码。
Agent 能力:模型、壳、托管运行时怎么拆
2026 年选 API,至少要拆三层:
- 模型:会不会改对、会不会越权、会不会把仓库读爆。
- 壳:Codex、Claude Code、Antigravity——权限、沙箱、MCP、子 Agent 的默认值不一样。
- 托管运行时:Agents API 把 Codex harness 接到一次 HTTP;你选沙箱或自建机,OpenAI 管编排、压缩和恢复。不另收接口费,Computer use 等工具另计。
OpenAI 这一侧还多两处摩擦:工具调用要走 Responses API(Chat Completions 不够);生产里的错位监控可能直接停掉一次 API 任务,而不只是弹确认。Astra 的 computer use 在 Agents' Last Exam、OSWorld 上数字好看,适合填表、CRM、浏览器 QA;安全档到了 Critical,防御向审查能做,高级利用类请求会被拒。
Claude 一侧的长板仍是 MCP + 缓存经济学 + 长程谨慎。Gemini 一侧是 便宜吞吐 + 托管 Agent,但 Code Assist / Enterprise 席位和模型发票是两行。把 Flash 接到 Codex 这类多后端壳,是常见的「便宜脑 + 成熟循环」。
# 同一条工单的常见配法(不是唯一解)
Flash / Terra / Sonnet → 探路、测例、只读扫仓
Sol / Opus → 改公共 API、收口 diff
Astra / Fable 5.1 → 跨模块、过夜、要产物或要缓存
Agents API / Claude Code → 需要沙箱和会话续跑时再上托管
按任务怎么配,而不是站队
| 你在做的事 | 更常先试的 API 档 |
|---|---|
| 批量短任务、多模态、文档扫仓 | Gemini 3.8 Flash,thinking=low |
| 日常改接口、补测、收 PR | Sonnet 5 或 Terra;偶发上 Sol / Opus |
| 跨模块重构、过夜 Agent | Fable 5.1(吃缓存)或 Astra(computer use / 专业文档) |
| 浏览器填表、桌面操作、站点 QA | Astra + Responses / Agents API |
| 要可预期账单 | 默认便宜模型 + API 月帽;订阅撞墙是停,API 撞墙是付款 |
几条不容易写进对照表、却容易把预算打穿的:
- 已经在付 ChatGPT Plus / Claude Pro,再为同一条 Agent 开一份无帽 API,是重复记账。
- Astra Fast + 超 272K 会叠乘,不是「窗口大所以尽管贴仓库」。
- Agent Builder 工作流要在 11 月 30 日前迁到 Agents SDK,别把可视化画布当长期架构。
- 混用往往比站队便宜:主会话用一家壳做难 Bug,用 Flash 做吞吐,用缓存友好的旗舰过夜。
常见问题
Astra 和 Fable 5.1 标价一样,是不是随便选一个?
标价一样,第二次读上下文不一样。长会话、反复扫仓,先看缓存读;要 computer use、专业文档产物、Codex / Agents API 现成 harness,再看 Astra。
Gemini 3.8 Flash 能不能当生产默认?
可以当吞吐默认,尤其到 2026 年底前。难任务它会自己加轮次,单任务不一定最便宜。终端循环、权限、MCP 还要壳;个人 Code Assist 通道已收紧,不要按 2025 年的免费印象做预算。
Agents API 要不要现在就迁?
要云端沙箱、会话续跑、不想自己养 harness,值得试点。它不另收接口费,但 Token、工具、错位监控停任务都算成本。已经在 Claude Code 里跑顺的长程任务,不必为了「DevDay 有新 API」整队搬家。
API 再便宜,也要一台不合盖的机器
Token 在云端算,仓库、测试、MCP、沙箱在你面前这台机器上跑。笔记本一合盖,会话断、Prompt Cache 过期,下一句「继续」按全量输入——Astra 超 272K 还会整单加价。Mac mini 待机大约 4W,适合让 Agent 按你的滚动窗口工作,而不是跟着合盖重启。
Apple Silicon 统一内存更适合索引大仓库和并行测试;macOS 自带 Unix、Homebrew、Docker 与 SSH,Codex、Claude Code 和自建 Agents 循环少一层 WSL。和同价位 Windows 主机比,崩溃少、无人值守更稳,Gatekeeper 与 SIP 也降低长期挂 Agent 的风险。
若你已经在为三家 API 的单价和缓存精打细算,先保证机器不掉线,往往比再升一档旗舰更划算——立即了解套餐方案,把钱花在改代码上,而不是反复热身。
