发布页把 GPT-6 Astra 写成「最会写代码的模型」。账单页是另一套数字:单价比上一代贵 2.5 倍,思考档从 low 排到 max。真正卡住团队的,往往不是「榜上高几分」,而是同一条 ticket:墙钟多久、吐多少 Token、月底多少钱,以及能不能一次交出让人敢合并的 diff。
产品壳常见落在 Codex。壳怎么拆,见 Claude Code、Codex 与 Gemini 3.8 Flash 对比;钱怎么叠,见 AI Coding Agent 每月到底要花多少钱。和 Fable 头对头做同一项目,见 GPT-6 Astra vs Claude Fable 5.1:谁真的更会写代码。下面只拆 Astra 自己的四件事:速度、Token、成本、完成率。
公开完成率到底量的是什么
2026 年 9 月,OpenAI 发布页给出的软件工程数字(知识截止 2026-04-30)大致是:
| 评测 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| 内部数据库迁移任务 | 63.9% | 42.7% | 57.8% |
| AA Coding Agent Index | 67.0 | 65.1 | — |
独立评测 Artificial Analysis 在 Codex 里给 Astra 打 62,与 Claude Code 里的 Fable 5.1 持平。数字能对上,口径却不一样:官方表、第三方 harness、你仓库里的「测绿 + 评审敢合并」,三套完成率。
墙钟速度和思考档位怎么读
Astra 的 reasoning.effort 是 low / medium / high / xhigh / max。档位越高,越爱多跑几轮、用浏览器复核、用执行代替盲目 apply-patch——墙钟和 Token 一起涨。
发布页另外两组墙钟数字:
- Codex harness 更新后,Mind2Web 上相对 GPT-5.6 Sol 大约 1.9× 更快做完。
- OSWorld 2.0:Astra 约 72.6% / 40 分钟,Sol 约 65.7% / 75 分钟(少大约 47% 时间)。
- API Fast 模式:标准价的约 2 倍速度,也按约 2 倍计费。
同一仓库、同一条「异步 CSV 导出」ticket 上,Astra 更常先把队列、重试和 CI 打绿;空白态、加载反馈往往要第二轮。墙钟好看,不等于评审一次过。
Token 用量和单价为什么会拧着
标价从 Sol 的 $4 / $20 提到 $10 / $50(每百万输入 / 输出),大约 2.5 倍。缓存读 $1,缓存写 $12.50。贵在单价,省在「同样任务少说话」。
Artificial Analysis 在 Codex、max 档上的量级:Astra 每次任务大约只用 Sol 的 三分之一 Token;单任务成本大约 $7.09,比同档 Fable 5.1 便宜约四成,却只比 Sol max 贵约 15%,分数更高。Intelligence Index 上,Astra max 大约 27k 输出 Token,Fable 一侧常见到 78k。
读法就一条:不要只比单价。 短任务、执行密,Token 效率能把 2.5× 标价吃回去;会话反复读同一大仓、再触发长上下文加价,账单会反过来。
单次任务账单里还藏着什么
| 计费项 | 公开标价量级 | 什么时候会翻倍 |
|---|---|---|
| 输入 / 输出 | $10 / $50 | Fast 模式整单约 ×2 |
| 缓存读 / 写 | $1 / $12.50 | 输入超过 272K,整单按长上下文(输入与缓存约 ×2,输出约 ×1.5) |
| 订阅席位 | 含在 ChatGPT 档里 | 打满窗口再买积分;API 无帽除非自己设 |
Plus / Pro 订阅里通常已包含 Astra 额度,不等于无限 max。一次中等 Agent 回合若把仓库、日志、失败轨迹全塞进窗口,先撞的是 272K 加价,不是 $10 那一行。机器一睡,Prompt Cache 过期,下一句「继续」按全量输入——这是最冤的重热身。月账单怎么叠四本账,仍看成本文。
真实仓库里,完成率会掉在哪
把「真实项目完成率」写成三列,比追一张总榜清楚:
- 评测完成:Terminal-Bench 相对 Sol 跳了一大截;DeepSWE 只高 1.4 分——短程补丁两边本来就接近。
- 演示完成:队列、鉴权、失败重试,Astra 常更早举手。
- 合并完成:空状态、禁用态、跨模块风险说明,仍常要人补一句或再开一轮。
掉点最常见的三处:评审盯界面;第二轮要动共享查询或缓存键,却没写死「先只读、再最小 diff」;为了省 Token 截断上下文,反而漏约束。第三方也有 low 档在约半小时、约十一美元量级做完中等迁移的公开案例——那是「能跑通」,不是「不用看就合并」。
日常该怎么设档、设帽
- 默认 medium 或 high。 max 留给跨模块重构;low 适合探路和生成复现脚本。
- Fast 不要当过夜默认。 赶演示可以,长重构会把单价再乘一次。
- 能压在 272K 以下就压。
/clear换 ticket,比/compact硬压一整段失败日志更便宜。 - 机器保持醒着。 合盖一小时,缓存作废,下一轮按全量输入。
- 验收写三列。 只看测绿,完成率会被榜单带高。
# 同一条 ticket 记三列
墙钟分钟 | 输入 / 输出 / 缓存 Token | 能不能直接进评审
测速度和 Token,机器别先掉链子
Astra 的墙钟和缓存账单,最怕中途合盖:会话断、沙箱清、Prompt Cache 过期,下一轮按全量输入,272K 加价也会被无辜触发。Mac mini 待机大约 4W,适合让 Codex 按你的思考档跑完,而不是跟着笔记本休眠重启。
Apple Silicon 统一内存方便索引中等仓库和并行跑测试;macOS 自带 Unix、Homebrew、Docker 与 SSH,终端 Agent 少一层 WSL。和同价位 Windows 主机比,崩溃少、无人值守更稳,Gatekeeper 与 SIP 也更适合长时间挂 Agent。
若你准备认真记墙钟和 Token,先保证机器同规格、不合盖——立即了解套餐方案,把差异留在模型和档位上,而不是留在休眠和重热身上。
