OpenAI 新发布的 GPT-6 Astra,API 单价是前代的 2.5 倍。但 Artificial Analysis 在 9 月 3 日的 Coding Agent Index 评测发现:Astra max 在 Codex 编码 agent 基准中,约只用了前代 Sol max 三分之一的 tokens,任务成本约与前代持平,评分还高了 2 分。
这不是账单承诺,是特定测试 harness 的观察。AA 9 月 3 日 v4.1.1 的综合任务集,同档成本增加 75%。补测了两类真实产品模块,Astra 都全过,但追加压力复验暴露了全绿补丁仍缺业务响应验证和请求控制的防线缺口。
核心观点:按任务路由,别默认顶配,高级型号不替你定义上线验收。
01|拆解单价倍增与 token 计费的关系
GPT-6 Astra 的 API 标准价:输入每百万 token 10 美元,输出 50 美元。对比前代 GPT-5.6 Sol 的 4 美元和 20 美元,单价确实是 2.5 倍。这是调用 API 的费用,不是 ChatGPT 或 Codex 订阅价。

token 是模型处理文本的基本单位。每次调用,输入和输出按 token 计费,缓存命中的输入 token 计费更低。提示越长、返回内容越多,消耗的 token 就越多。
AA 在 9 月 3 日评测中发现:Astra max 在 Codex 约只用了前代 Sol max 三分之一的 tokens。但这不等于所有场景都省 token。编码 agent 基准有特定的工具链和评分逻辑,会影响 token 消耗模式。约持平是 AA 实际统计的结果,不是公式推导的必然。
02|聚焦编码 agent 基准时成本约持平
AA 的 Coding Agent Index 是特定 harness。在这个基准中,Astra 在 Codex 评分 67,Claude Fable 5.1 在 Claude Code 评分 70。

关键是:在这套特定评测中,Astra 约只用了前代三分之一 token,任务成本约与 Sol max 相同且评分高 2 分。AA 站内数据显示,Astra 每任务成本不到同分 Fable 5.1 的一半。
为什么能省 token?可能的原因包括更精准的推理、更少的工具调用轮次、更短的中间输出。但这种效率有边界——端到端的完整编码任务需要模型理解需求、拆解步骤、生成代码、调试修复、验证结果。如果换成你自己的工具链、数据库查询、配置文件修改,省 token 的前提可能就不成立。
03|别拿编码收益外推全任务
同一天,AA 还更新了旧版 Intelligence v4.1.1 的数据。在这个综合评测中,Astra max 相比 Sol max,输出 token 少了约 10%,但每任务成本增加 75%。单价 2.5 倍,只省 10% token,成本就上去了。
9 月 4 日 AA 已经更新到 v4.2,在新版综合指数中,Astra 比 Sol 高了 4 分。v4.2 移除了饱和的 GPQA,加入了 AA-Briefcase 和 GDP.pdf 两个新基准。GDP.pdf 是跨 100 份 PDF、4592 页专业材料、1275 项专家原子标准的严格文档任务。

在 GDP.pdf 中,Astra 的全项通过率是 33.2%,Sol 是 28.2%。AA 还观察到,Astra 在 AA-Briefcase 中分析质量提升了,但呈现质量有所回落。模型能想得更深,但最终输出的结构性可能需要人工整理。
04|把业界判断放进真实产品验证
拿 ShipSite 和 ShipSolo 的固定源码做了实测。选了两个实际模块,在已有调用逻辑和约束条件下,观察模型交付的修复能否通过验收。全程在隔离环境验证,不涉及线上会员或部署操作。
ShipSite 截图模块:Astra High 首稿通过 15/15 行为验收,原仓库 TypeScript 另外通过。Flash Low 首稿也通过相同两项,未显示旗舰独占优势。
ShipSolo 后台统计模块:120 项 LRU、5 分钟 TTL、真实公历、owner/admin 原接口兼容。Astra High 首稿行为 36/36 且独立 TypeScript 通过,Flash Low 首稿同样通过。

事后追加了防御压力复验:HTTP 200 响应但 JSON 损坏时,三份模型代码都拒绝了 4 个调用者,下次上游响应正常后能重新回源。但 HTTP 200 合法 JSON 但只有 error 字段没有 results 时,三份候选都返回并缓存了错误对象,随后上游恢复正常,下一次同 key 调用仍然得到坏对象,没有重新回源。
05|建议按任务路由,不要全部顶配
GPT-6 Astra 的定位是最难的推理、编码、computer use、研究、文档创建。如果你的任务属于这类端到端工作,可能体现 token 效率优势。但本轮补测没有证明旗舰独占正确率——测试的两个模块,Astra 首稿全过,Flash Low 在 ShipSolo 也全过。这说明在这个难度区间,不同配置都能完成任务。
实际选型建议:
- 受控任务、明确验收、大量调用:先用便宜的配置
- 模糊需求、长链条、高失败代价:优先验证强模型,但仍需验收
- 中间地带:先用便宜的试,失败了再升级
把常做的活拿来验收,按完成任务的代价选配置。预算用于能测出收益的地方。
写在最后
GPT-6 Astra 单价涨了 2.5 倍,但在特定编码基准中,由于 token 效率提升,实际任务成本约持平。不过综合通用任务成本增加 75%,对实际工作的影响取决于你的任务组合。核心原则不变:按任务路由,别默认顶配,高级型号不替你定义上线验收。