非官方指南,与 Meta 无关联。

最后更新:

Gemini 4 Argon 和 Claude Opus 5.5 对比

Google 的新一代旗舰对上 Anthropic 已全面开放的最强模型。按标准价算,两者每 token 价格完全一样。

一句话 按 Google 的数据,在双方都有成绩的 18 项测试里 Argon 赢了 14 项,包括 DeepSWE(77.9% 对 74.2%);但 Opus 5.5 在 Terminal-Bench 4.0 上领先(66.4% 对 57.4%),而且现在就能用。终端编程 agent 现在选 Opus 5.5;法律、金融和长上下文任务,等 Argon 开放后再试。

参数对比

Gemini 4 ArgonOpus 5.5
开发方Google DeepMindAnthropic
发布日期2026年9月30日(仅 Fairwind 计划)2026年9月22日
输入 / 输出(每百万)首发 $2 / $10,标准 $4 / $20$4 / $20
缓存输入(每百万)首发 $0.10,标准 $0.20$0.20
最大输出100 万 token128K token
上下文窗口—1M

跑分

数据来自 Google 的 Gemini 4 Argon 跑分表,所有模型都按最高思考档测试。Anthropic 自己公布的对比可能不同。

测试Gemini 4 ArgonOpus 5.5
Vals Index68.9%67.0%
AutomationBench51.3%42.5%
Vals Finance Agent v265.4%58.6%
Harvey's Legal Agent Benchmark19.6%3.8%
DeepSWE v1.177.9%74.2%
FrontierSWE v255.0%62.3%
Vibe Code Bench91.9%90.3%
Terminal-Bench 4.057.4%66.4%
PostTrainBench45.3%49.3%
Terminal-Bench Science 0.157.6%63.3%
LABBench 288.8%73.1%
RiemannBench76.0%69.6%
GraphWalks BFS (up to 128K)99.7%90.6%
GraphWalks BFS (256K-1M)84.2%66.8%
Agent's Last Exam39.5%38.2%
OSWorld-2.069.2%—
Chartography71.6%66.3%
LVBench91.7%83.7%
CWE-bench v168.0%67.0%

Argon 领先 14 项,Opus 5.5 领先 4 项,并列 0 项。

来源: Google DeepMind 官方:Gemini 模型页

每次编程任务的成本

代码库规模Argon(首发价)Argon(标准价)Opus 5.5
小(1 万行以内)$0.112$0.223$0.223
中(1 万-10 万行)$0.249$0.498$0.498
大 / monorepo(10 万行以上)$0.594$1.188$1.188

每月 173 次任务、中等代码库:Argon 首发价约 $43(标准价约 $86),Opus 5.5 约 $86,两边按同样的 token 量计算。

Gemini 4 Argon 详细介绍 在计算器里对比所有模型

怎么选

常见问题

Gemini 4 Argon 比 Opus 5.5 强吗?

按 Google 的数据,在双方都有成绩的 18 项测试里 Argon 赢了 14 项,Opus 5.5 领先的是 FrontierSWE v2, Terminal-Bench 4.0, PostTrainBench, Terminal-Bench Science 0.1。厂商会挑对自己有利的测试,最好在自己的任务上试。

Gemini 4 Argon 和 Opus 5.5 哪个便宜?

首发价的 Argon 更便宜($2 / $10)。按标准价($4 / $20)两者一样。

现在能用 Gemini 4 Argon 代替 Opus 5.5 吗?

除非你在 Google 的 Fairwind 安全计划里,否则还不行。下一批是付费 Gemini API 用户和 Google AI Ultra 订阅用户,没有日期。

独立站点,与 Google、Anthropic、Meta 均无关联。跑分为 Google 公布,本站没有自己做测试。