WayToClawEarn
高影响TechCrunch / MarkTechPost / Google Blog

Google Gemini 4 Argon 发布:1M 输出 Token、DeepSWE 新 SOTA,AI 编程与安全防御怎么选?

9月30日 Google DeepMind 发布 Gemini 4 Argon,单次响应最大输出 1M Token(竞品仅 128K),DeepSWE v1.1 以 77.9% 创新纪录,定价 $2/$10 仅为 Opus 5.5 的一半。该模型专为长周期软件工程、企业知识工作和网络安全防御训练,可通过 Fairwind 计划限量使用。本文对比 Argon 与 GPT-6 Astra、Claude Opus 5.5 的基准差异和选型建议。

Edisen Lu · WayToClawEarn来源 TechCrunch / MarkTechPost / Google Blog发布 2026年10月2日

基于公开来源复核 · AI 辅助整理,编辑把关。 内容方法 · 原始来源

公开来源汇编

综合公开帖文/文档整理。一手主张请优先核对原始来源。

我们如何审核内容 · 一手来源 · TechCrunch / MarkTechPost / Google Blog

核心结论

Google DeepMind 于 9月30日 发布 Gemini 4 Argon,这是 Gemini 4 代首个模型。三个关键突破:单次响应最大输出 1M Token(竞品仅 128K),DeepSWE v1.1 长周期软件工程基准以 77.9% 创新纪录,定价 $2/$10 仅为 Claude Opus 5.5 的一半。但访问受限——目前仅通过 Fairwind 计划向网络安全合作伙伴开放。

1M 输出 Token:为什么这是大事

当前主流模型单次响应上限对比:

模型最大输出 Token
Gemini 4 Argon1,000,000
Claude Opus 5.5128,000
Claude Fable 5.1128,000
GPT-6 Astra128,000

这意味着开发者可以在一次响应中完成大规模代码重构或生成长报告,不需要拆分到多轮对话。代价是:满 1M 输出 Token 在入门定价下花费 $10,正式定价后 $20。

Google 未披露 Argon 的输入上下文窗口大小。

基准测试:领先与落后

Google 将 Argon 与 GPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1 进行了 18 项基准对比。Argon 在 12 项上 outright 领先,1 项并列第一。

Argon 领先的基准:

基准ArgonOpus 5.5GPT-6 Astra说明
DeepSWE v1.177.9%74.2%74.1%长周期软件工程(新 SOTA)
Vals Index68.9%67.0%63.1%经济影响(金融/编程/法律/税务)
AutomationBench51.3%42.5%—Zapier 端到端业务执行
Harvey Legal Agent19.6%—5.4%法律 Agent
LVBench91.7%——长视频理解(新 SOTA)
CWE-bench v168%(并列)67%—漏洞修复

Argon 落后的基准:

基准Argon领先者差距
FrontierSWE v255.0%GPT-6 Astra 65.5%-10.5pp
Terminal-Bench 4.057.4%Opus 5.5 66.4%-9.0pp
OSWorld-2.069.2%GPT-6 Astra 72.6%-3.4pp

Artificial Analysis 报告称,使用折扣价计算,Argon 在 Intelligence Index 上与 GPT-6 Astra 持平,但每个任务成本仅为后者的 60%。

定价对比

模型输入 / 输出(每 1M Token)缓存输入
Gemini 4 Argon(入门)$2 / $10$0.10
Gemini 4 Argon(正式)$4 / $20—
Claude Opus 5.5$4 / $20$0.20
Claude Fable 5.1$10 / $50$0.25
GPT-6 Astra$10 / $50$1.00

入门定价下 Argon 的输出价格仅为 GPT-6 Astra 的 1/5。

网络安全防御:发现、验证、修复

Argon 被训练用于自主发现、验证和修复关键软件漏洞。可信防御者和 Google 内部团队获得的版本不包含网络安全护栏。

在 CWE-bench v1(漏洞修复测试)上,Argon 以 68% 并列第一。

实际案例:Wiz 已通过其 Scan for Good 计划使用 Argon,发现了全球医院使用的医疗软件中的一个关键漏洞——此前其他前沿模型均未发现。

Google 在全面发布前正在四个领域加强安全护栏:

  1. 网络安全和 CBRN 风险的滥用防御(含激活监控)
  2. 间接提示注入抗性(Argon 在 Gray Swan IPI 基准上领先)
  3. 思维链和行为的偏差监控(可中止执行)
  4. 高风险训练和评估的密封隔离沙箱

Google 内部实战成果

Google 已有数千名员工在使用 Argon,分享了 4 项内部成果:

  1. 内存优化:Agent 对数据中心应用内存优化,释放超 300 TiB,预计可达 500 TiB 至 1 PiB
  2. SIMD 代码替换:在 libgav1 Rust 移植中替换 32K 行 SIMD 代码,解码器速度提升 2.7 倍
  3. C/C++ 转 Rust:在 Fuchsia Zircon 内核中迁移超 80 万行代码
  4. 量子算法:在几分钟内超越已发表的量子算法基线 40%

访问限制与可用性

Argon 目前仅通过 Fairwind 计划向网络安全合作伙伴开放,没有公开发布日期。Google 正在参与美国政府的预发布模型访问自愿流程,收集早期测试者反馈并迭代安全护栏后再扩大发布。

这意味着普通开发者和企业短期内无法直接使用 Argon——与 OpenAI DevDay 同日发布并已向 Pro/Business 用户开放的 GPT-6.1 Sol 形成鲜明对比。

开发者选型建议

场景推荐模型理由
长周期软件工程(大规模重构)Gemini 4 Argon(如可获取)1M 输出 + DeepSWE SOTA
日常 Agentic CodingGPT-6.1 Sol92% Astra 能力、1/5 价格、已可用
终端/命令行任务Claude Opus 5.5Terminal-Bench 4.0 领先
计算机操作(GUI 自动化)GPT-6 AstraOSWorld-2.0 领先
网络安全防御Gemini 4 Argon专为漏洞发现/修复训练
法律/合规 AgentGemini 4 ArgonHarvey Legal Agent 大幅领先
成本敏感型长工作流GPT-6.1 Sol / Argon(入门价)两者都是竞品的 1/5~1/2 价格

信息来源

googlegemini-4-argondeepmindcodingcybersecurityllmbenchmark

查看原文 →

仅供学习参考:案例基于公开来源整理,并可能经 AI 辅助起草、由编辑复核。不构成投资或收益建议,亦不保证结果。