谷歌发布旗舰AI模型Gemini 4 Argon,在多项基准测试中超越OpenAI和Anthropic的顶级产品,标志着这家搜索巨头在历经数月落后后重新杀回竞争前沿。但这款备受期待的模型目前仅向特定网络安全合作伙伴开放,普通开发者和企业用户尚需等待。

9月30日,谷歌正式推出最新AI旗舰模型Gemini 4 Argon,该模型在18项基准测试中的13项位居榜首或并列第一,尤以知识型工作和长上下文推理见长。

鉴于近几周来人工智能安全问题在科技界引发了广泛讨论,谷歌表示,其新模型最初将仅供专注于网络安全防御的特定公司和组织使用。待防御者有机会修补系统漏洞并修复模型发现的缺陷后,该模型才会更广泛地发布。

谷歌补充说,Gemini 4 Argon 包含新的安全防护措施,以防止误用和意外行为。这些措施包括监控功能,可以在模型越界执行超出用户预期的任务时将其捕获,并可在模型越界时终止其活动。

Gemini 的高级总监兼产品负责人 Tulsee Doshi 说:

我们看到这些防护措施是有效的。

Gemini 4 Argon在知识工作领域的基准测试中展现出压倒性优势,但编程能力的表现则更为复杂。

在谷歌公布的对比数据中,Argon在Vals Index上得分68.9%,领先Opus 5.5的67.0%;在Vals Finance Agent v2上得分65.4%,领先Fable 5.1约6.5个百分点;在Harvey's Legal Agent Benchmark上得分19.6%,约为Fable 5.1得分的三倍。

编程方面,Argon在DeepSWE v1.1上以77.9%的成绩位居榜首,领先Astra和Opus约3至4个百分点,谷歌将其定义为该测试的新最优水平。

然而在FrontierSWE v2上,Argon的55.0%落后于Astra的65.5%,差距达10.5个百分点;在Terminal-bench 4.0上,Argon的57.4%也落后于Opus 5.5的66.4%近9个百分点。

值得注意的是,上述基准测试并非在完全统一的实验条件下进行。以DeepSWE为例,谷歌使用自有的mini-swe agent框架计算Argon得分,竞争对手的数据则来自公开排行榜和各模型方的自有报告。方法论的差异意味着,直接的数字比较需要审慎解读。

Gemini 4 Argon在技术规格上的一项重要突破是将输出token上限从此前的64,000大幅提升至100万。谷歌将这一设计与深度推理能力直接挂钩,认为更大的生成空间使模型能够在单次运行中完成更复杂的任务链。

谷歌披露的内部部署案例印证了这一潜力。在数据中心内存优化方面,Argon智能体通过分析集群性能遥测数据并实施优化方案,已释放超过300 TiB内存,潜在节省规模估计达500 TiB至1 PiB。

在代码迁移领域,Argon已参与将C/C++代码迁移至Rust的工程项目,涉及re2等核心库,以及Fuchsia操作系统Zircon内核超过80万行代码。

在视频解码库libgav1的迁移中,Argon智能体替换了3.2万行SIMD代码,最终实现的解码器运行速度比此前的Rust移植版本快2.7倍。

谷歌还报告称,Argon在量子计算领域协助优化了一个子程序的时空资源,改进幅度达40%。

安全防御是Argon首批应用场景的重心。

谷歌表示,该模型经过专项训练,能够自主发现、验证并修补软件漏洞,Fairwind Program的受信参与方和谷歌内部团队将获得不附加网络安全护栏的原始模型访问权限。

谷歌旗下子公司Wiz已将Argon用于其"Scan for Good"漏洞扫描项目。谷歌称,该模型发现了一个存在于全球多家医院所用医疗软件中的严重漏洞,而此前多款前沿模型均未能识别该风险。

在内部安全评估中,Argon在源代码漏洞发现测试中得分85.8%,高于Gemini 3.8 Flash Cyber的71.0%;在Wiz黑盒渗透测试评估中得分70.9%,高于后者的58.2%。

在公开的CWE-bench v1漏洞修复测试中,Argon以68.0%与GPT-6 Astra并列,Opus 5.5以67.0%紧随其后。

谷歌公布了Argon的API定价:推广期每百万输入token收费2美元,每百万输出token收费10美元,缓存输入享受95%折扣,折算后约为每百万token 0.10美元。

推广期结束后,价格将上调至每百万输入token 4美元、每百万输出token 20美元,涨幅均为一倍,但谷歌未披露推广期的具体截止时间。

与主要竞争对手相比,Argon推广期价格具有显著优势:

  • GPT-6 Astra和Claude Fable 5.1的标准API价格分别为每百万输入token 10美元、每百万输出token 50美元,均为Argon推广期的五倍。
  • Claude Opus 5.5的定价为每百万输入4美元、每百万输出20美元,与Argon推广期后的价格持平。

不过,对于寻求性价比的用户而言,定价格局并非非此即彼。

OpenAI的GPT-6.1 Sol与Argon推广期定价相同,均为输入2美元、输出10美元;谷歌自家的Gemini 3.8 Flash现行定价为输入0.75美元、输出3.75美元,价格更低。

谷歌的基准测试对比未纳入GPT-6.1 Sol,因此推广期相同价位下两款模型的实际质量差异,尚待市场检验。

Argon的发布同时意味着谷歌放弃了此前规划中的Gemini 3.5 Pro。

谷歌在今年5月的I/O开发者大会上曾宣布计划于6月推出Gemini 3.5 Pro,但该计划始终未能落地,此后以一系列Flash模型替代。

根据AI评测机构Vals AI的分析,这一转变反映出Gemini 3.5 Pro在性能上已不足以赶超竞争对手,谷歌因此决定直接跳级发布Gemini 4,重新争夺AI前沿地位。

今年7月,皮查伊在投资者电话会议上承认了谷歌的落后局面,但表示"我们仍在许多维度上保持前沿水平",并将Gemini 4视为追赶关键。

去年11月,谷歌曾凭借一款新模型短暂登顶AI排行榜,一度令OpenAI内部拉响"红色警报"紧急备战;如今Argon能否守住这次反攻的成果,仍有待全面开放后的市场验证。

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。