跳到主要内容
返回时间线
Gemini来源发表:

谷歌发布 Gemini 4 Argon:输出上限提至 100 万 token,DeepSWE v1.1 达 77.9%,并称在 libgav1 上让 Rust 解码器提速 2.7 倍

核心概要

谷歌宣布推出前沿模型 Gemini 4 Argon,通过 Fairwind 计划先向受信任的网络安全防御者开放,主打长周期深度推理,将输出 token 上限从 64K 提升到 100 万,并报告在 DeepSWE v1.1 取得 77.9%、LVBench 取得 91.7%、CWE-bench v1 取得 68%、AutomationBench 取得 51.3%,同时给出内部应用案例:量子子程序优化较已发表基线提升 40%、数据中心释放超 300 TiB 内存、libgav1 的 Rust 移植中替换 32K 行 SIMD 代码后解码器比原 Rust 移植快 2.7 倍且视频输出一致。

AI-generated editorial illustration: Gemini 4 Argon: our next era of frontier intelligence

深度剖析

Gemini 4 Argon 被定位为可支撑长周期、多步复杂工作流的前沿模型,输出 token 上限从 64K 扩展到 100 万,使模型能在单条轨迹中生成数十万 token 进行深度推理。 相较此前 64K 的输出上限,这一扩展针对的是需要一次性完成的长链条任务,而非单轮短问答。 该说法来自谷歌官方发布说明,属于厂商自述的能力定位,文中未给出与输出长度相关的独立第三方评测数据。

在公开与行业评测上,Argon 报告了多项领先成绩:DeepSWE v1.1 为 77.9%,LVBench 为 91.7%,CWE-bench v1 为 68%,AutomationBench 为 51.3%,并称在 Vals Index、Vals Finance Agent v2 与 Harvey 法律智能体基准上同样领先。 这些数字覆盖真实长周期软件工程、长视频理解、漏洞修复与端到端业务执行等不同维度,把能力主张从单一编码扩展到企业知识工作与多模态。 均为文中列出的基准分数,来源为发布方自述;文中未提供各基准的样本规模、评测协议或置信区间。

在谷歌内部应用中,Argon 被用于量子算法子程序优化,在一个例子里数分钟内超过已发表基线 40%;Argon 智能体分析全机群性能遥测后自主识别并应用内存优化,已释放超过 300 TiB 内存,预计总节省 500 TiB 至 1 PiB。 这些是模型在真实生产与研究流程中产生的可量化结果,而非仅停留在基准分数层面。 数据来自谷歌内部案例描述,未说明基线来源、测量方法与统计不确定性。

在代码迁移方面,Argon 智能体正把 C/C++ 代码库迁移到 Rust,规模从 re2、libgav1 等核心库的数万行,到 Fuchsia OS Zircon 内核的 80 万行以上;其中 libgav1 案例里,智能体替换了 32K 行 SIMD 代码,产出可被编译器自动向量化的安全 Rust,最终解码器比原 Rust 移植快 2.7 倍且视频输出一致。 该案例把智能体能力落到具体开源项目与可验证的性能指标上,并强调大规模改写仍需自动化与人工审计、仿真测试和评审后才进入生产。 性能倍数与代码行数由发布方给出,未提供独立复现或基准测试细节。

启示与展望

该发布面向的是受信任的网络安全防御者、谷歌内部团队以及后续的付费 API 客户和 Google AI Ultra 订阅者,属于分阶段开放而非全面可用。文中描述的能力适用于长周期软件工程、法律与金融等企业知识工作、多模态长视频理解以及防御性网络安全等场景;对希望评估前沿模型在真实工程与安全任务中表现的读者,这份材料提供了可对照的指标与案例清单。

文中所有基准分数与内部案例均来自发布方自述,未给出样本规模、评测协议、基线细节或独立复现,因此这些数字应视为厂商报告而非独立验证结论。量子优化 40% 提升、内存节省 300 TiB 至 1 PiB、libgav1 提速 2.7 倍等结果的具体测量条件在文中未展开。此外,模型尚未广泛开放,实际可用性、价格之外的长期成本以及安全护栏在更大范围部署后的表现,都仍需后续观察。

来源