最后更新:
Claude Opus 5.5 和 GPT-6 Astra 对比
这是 Anthropic 和 OpenAI 目前最强的两个通用模型。Astra 是 OpenAI 的旗舰;Opus 5.5 在 Anthropic 的 Fable 之下,但价格低得多。
一句话 做编程 agent 选 Opus 5.5:Anthropic 的数据里,它在 Terminal-Bench 4.0 上领先 Astra(66.4% 对 57.9%),每 token 便宜 2.5 倍。在双方都有成绩的 4 项测试里,Astra 领先 1 项,包括 AutomationBench。
参数对比
| Opus 5.5 | GPT-6 Astra | |
|---|---|---|
| 厂商 | Anthropic | OpenAI |
| 发布日期 | 2026年9月22日 | 2026年9月4日 |
| 输入 / 输出(每百万) | $4.00 / $20.00 | $10.00 / $50.00 |
| 缓存输入(每百万) | $0.20 | $1.00 |
| 上下文窗口 | 1M | 1.05M |
| 编程 agent | Claude Code | Codex |
跑分对比
数据来自 Anthropic 的 Opus 5.5 发布页,其中并列了 GPT-6 Astra。OpenAI 有自己的对比,结果可能不同。
| 测试 | Opus 5.5 | GPT-6 Astra |
|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 57.9% |
| FrontierCode 1.1 | 54.4% | 53.3% |
| CursorBench 4.0 | 57.8% | — |
| AutomationBench | 40.0% | 41.4% |
| Humanity's Last Exam | 67.7% | 57.2% |
| OSWorld 2.1 | 81.8% | — |
OpenAI 对更便宜的 GPT-6.1 Sol 的说法:AutomationBench 比 Opus 5.5 高 2.2 分。
来源: Anthropic 官方:Claude Opus 5.5 发布页
每次编程任务的成本
| 代码库规模 | Opus 5.5 | GPT-6 Astra |
|---|---|---|
| 小(1 万行以内) | $0.223 | $0.576 |
| 中(1 万-10 万行) | $0.498 | $1.290 |
| 大 / monorepo(10 万行以上) | $1.188 | $3.090 |
每月 173 次任务、中等代码库:Opus 5.5 约 $86,GPT-6 Astra 约 $223。
该选哪个
- 终端操作多的 agent 编程:Opus 5.5。
- 跨应用的业务流程自动化:Astra 的 AutomationBench 更高,但 GPT-6.1 Sol 便宜得多,OpenAI 称它在这项上也超过了 Opus 5.5。
- 预算紧:两个都不选,用 $2 / $10 的 Claude Sonnet 5.5 或 GPT-6.1 Sol。
常见问题
Opus 5.5 比 GPT-6 强吗?
按 Anthropic 的数据,在双方都有成绩的 4 项测试里,Opus 5.5 赢了 3 项,包括 Terminal-Bench 4.0。Astra 在 AutomationBench 上领先(41.4% 对 40.0%)。厂商会挑对自己有利的测试,最好用你自己的任务试。
Opus 5.5 和 GPT-6 Astra 哪个便宜?
Opus 5.5,每百万 token $4.00 / $20.00,Astra 是 $10.00 / $50.00。
Opus 5.5 和 GPT-6.1 Sol 怎么比?
GPT-6.1 Sol 价格只有 Opus 5.5 的一半($2 / $10)。OpenAI 称它在 AutomationBench 上超过 Opus 5.5;编程 agent 场景建议用你自己的任务对比。
独立站点,与 Anthropic、OpenAI 均无关联。跑分由厂商公布,本站没有自己做测试。