非官方指南,与 Meta 无关联。

最后更新:

Claude Opus 5.5 和 GPT-6 Astra 对比

这是 Anthropic 和 OpenAI 目前最强的两个通用模型。Astra 是 OpenAI 的旗舰;Opus 5.5 在 Anthropic 的 Fable 之下,但价格低得多。

一句话 做编程 agent 选 Opus 5.5:Anthropic 的数据里,它在 Terminal-Bench 4.0 上领先 Astra(66.4% 对 57.9%),每 token 便宜 2.5 倍。在双方都有成绩的 4 项测试里,Astra 领先 1 项,包括 AutomationBench。

参数对比

Opus 5.5GPT-6 Astra
厂商AnthropicOpenAI
发布日期2026年9月22日2026年9月4日
输入 / 输出(每百万)$4.00 / $20.00$10.00 / $50.00
缓存输入(每百万)$0.20$1.00
上下文窗口1M1.05M
编程 agentClaude CodeCodex

跑分对比

数据来自 Anthropic 的 Opus 5.5 发布页,其中并列了 GPT-6 Astra。OpenAI 有自己的对比,结果可能不同。

测试Opus 5.5GPT-6 Astra
Terminal-Bench 4.066.4%57.9%
FrontierCode 1.154.4%53.3%
CursorBench 4.057.8%—
AutomationBench40.0%41.4%
Humanity's Last Exam67.7%57.2%
OSWorld 2.181.8%—

OpenAI 对更便宜的 GPT-6.1 Sol 的说法:AutomationBench 比 Opus 5.5 高 2.2 分。

来源: Anthropic 官方:Claude Opus 5.5 发布页

每次编程任务的成本

代码库规模Opus 5.5GPT-6 Astra
小(1 万行以内)$0.223$0.576
中(1 万-10 万行)$0.498$1.290
大 / monorepo(10 万行以上)$1.188$3.090

每月 173 次任务、中等代码库:Opus 5.5 约 $86,GPT-6 Astra 约 $223。

在计算器里对比所有模型

该选哪个

常见问题

Opus 5.5 比 GPT-6 强吗?

按 Anthropic 的数据,在双方都有成绩的 4 项测试里,Opus 5.5 赢了 3 项,包括 Terminal-Bench 4.0。Astra 在 AutomationBench 上领先(41.4% 对 40.0%)。厂商会挑对自己有利的测试,最好用你自己的任务试。

Opus 5.5 和 GPT-6 Astra 哪个便宜?

Opus 5.5,每百万 token $4.00 / $20.00,Astra 是 $10.00 / $50.00。

Opus 5.5 和 GPT-6.1 Sol 怎么比?

GPT-6.1 Sol 价格只有 Opus 5.5 的一半($2 / $10)。OpenAI 称它在 AutomationBench 上超过 Opus 5.5;编程 agent 场景建议用你自己的任务对比。

独立站点,与 Anthropic、OpenAI 均无关联。跑分由厂商公布,本站没有自己做测试。