最后更新:
Gemini 4 Argon 和 Claude Opus 5.5 对比
Google 的新一代旗舰对上 Anthropic 已全面开放的最强模型。按标准价算,两者每 token 价格完全一样。
一句话 按 Google 的数据,在双方都有成绩的 18 项测试里 Argon 赢了 14 项,包括 DeepSWE(77.9% 对 74.2%);但 Opus 5.5 在 Terminal-Bench 4.0 上领先(66.4% 对 57.4%),而且现在就能用。终端编程 agent 现在选 Opus 5.5;法律、金融和长上下文任务,等 Argon 开放后再试。
参数对比
| Gemini 4 Argon | Opus 5.5 | |
|---|---|---|
| 开发方 | Google DeepMind | Anthropic |
| 发布日期 | 2026年9月30日(仅 Fairwind 计划) | 2026年9月22日 |
| 输入 / 输出(每百万) | 首发 $2 / $10,标准 $4 / $20 | $4 / $20 |
| 缓存输入(每百万) | 首发 $0.10,标准 $0.20 | $0.20 |
| 最大输出 | 100 万 token | 128K token |
| 上下文窗口 | — | 1M |
跑分
数据来自 Google 的 Gemini 4 Argon 跑分表,所有模型都按最高思考档测试。Anthropic 自己公布的对比可能不同。
| 测试 | Gemini 4 Argon | Opus 5.5 |
|---|---|---|
| Vals Index | 68.9% | 67.0% |
| AutomationBench | 51.3% | 42.5% |
| Vals Finance Agent v2 | 65.4% | 58.6% |
| Harvey's Legal Agent Benchmark | 19.6% | 3.8% |
| DeepSWE v1.1 | 77.9% | 74.2% |
| FrontierSWE v2 | 55.0% | 62.3% |
| Vibe Code Bench | 91.9% | 90.3% |
| Terminal-Bench 4.0 | 57.4% | 66.4% |
| PostTrainBench | 45.3% | 49.3% |
| Terminal-Bench Science 0.1 | 57.6% | 63.3% |
| LABBench 2 | 88.8% | 73.1% |
| RiemannBench | 76.0% | 69.6% |
| GraphWalks BFS (up to 128K) | 99.7% | 90.6% |
| GraphWalks BFS (256K-1M) | 84.2% | 66.8% |
| Agent's Last Exam | 39.5% | 38.2% |
| OSWorld-2.0 | 69.2% | — |
| Chartography | 71.6% | 66.3% |
| LVBench | 91.7% | 83.7% |
| CWE-bench v1 | 68.0% | 67.0% |
Argon 领先 14 项,Opus 5.5 领先 4 项,并列 0 项。
来源: Google DeepMind 官方:Gemini 模型页
每次编程任务的成本
| 代码库规模 | Argon(首发价) | Argon(标准价) | Opus 5.5 |
|---|---|---|---|
| 小(1 万行以内) | $0.112 | $0.223 | $0.223 |
| 中(1 万-10 万行) | $0.249 | $0.498 | $0.498 |
| 大 / monorepo(10 万行以上) | $0.594 | $1.188 | $1.188 |
每月 173 次任务、中等代码库:Argon 首发价约 $43(标准价约 $86),Opus 5.5 约 $86,两边按同样的 token 量计算。
Gemini 4 Argon 详细介绍 在计算器里对比所有模型
怎么选
- 现在要做终端编程 agent:Opus 5.5,Terminal-Bench 4.0 领先,而且已经能在 Claude Code 里用。
- 法律、金融和业务流程自动化:Argon 在 Harvey 法律测试和 AutomationBench 上高出很多(51.3% 对 42.5%)。
- 超长输入:Argon,256K 到 1M 的 GraphWalks 是 84.2% 对 66.8%。
- 看预算:能用上之后,Argon 首发价只有 Opus 5.5 的一半。
常见问题
Gemini 4 Argon 比 Opus 5.5 强吗?
按 Google 的数据,在双方都有成绩的 18 项测试里 Argon 赢了 14 项,Opus 5.5 领先的是 FrontierSWE v2, Terminal-Bench 4.0, PostTrainBench, Terminal-Bench Science 0.1。厂商会挑对自己有利的测试,最好在自己的任务上试。
Gemini 4 Argon 和 Opus 5.5 哪个便宜?
首发价的 Argon 更便宜($2 / $10)。按标准价($4 / $20)两者一样。
现在能用 Gemini 4 Argon 代替 Opus 5.5 吗?
除非你在 Google 的 Fairwind 安全计划里,否则还不行。下一批是付费 Gemini API 用户和 Google AI Ultra 订阅用户,没有日期。
独立站点,与 Google、Anthropic、Meta 均无关联。跑分为 Google 公布,本站没有自己做测试。