
就在今天凌晨,Google官宣了Gemini家族的新一代旗舰模型Gemini 4 Argon。
这是Gemini 4系列首个公开亮相的模型,也是Gemini家族第一次没有继续沿用之前的规格名称。Argon,即元素周期表第18号元素“氩”,稳定的惰性气体,或许象征这款模型对工作场景的定位偏好。
比名字更值得注意的是它的定位。
Google在官方博客第一句话里就写得很清楚,Gemini 4 Argon面向三个方向:real-world software engineering(真实世界的软件工程)、enterprise knowledge work(企业工作,包括法律、金融)、cybersecurity defense(网络安全防御)等复杂工作流,并特别强调complex、long-horizon,也就是“复杂的、长程任务”。

Google DeepMind高级副总裁兼Google首席AI架构师Koray Kavukcuoglu在这篇博客开宗明义,“这款模型从根本上改变了Google内部的工作和构建方式”。这话对应的是Google披露的一组内部实践:目前Gemini 4 Argon已经进入Google内部数千名员工的工作流,用它处理专业Coding、深度研究和写作等任务;更进一步,它已经被用于量子算法优化、数据中心内存优化和几十万行规模的代码迁移。
换句话说,这次Google首先把Gemini 4的旗舰能力对准了一个更具体的方向:“严肃工作”,也就是那些容错率更低、任务链更长、需要模型持续推理和执行的工作。
名字背后的分层策略
Argon 这个命名值得单独拿出来看。
Gemini过去更常见的产品体系,是主版本号(例如1、1.5、2、2.5、3、3.8)加上规格或用途名(例如Ultra、Pro、Flash,以及后来的Live、TTS、Cyber等)。
进入3.8代以后,这种用途细分进一步增加:快速模型3.8 Flash、实时对话模型3.8 Live、实时长思考模型3.8 Live Extended Thinking、语音模型Flash TTS / Flash-Lite TTS、以及网络安全模型3.8 Flash Cyber分别承担不同任务。
Gemini 4 Argon在名字上打破了这种惯例,至少留下了一个值得观察的问题:Gemini 4会不会开始淡化过去单纯按模型“档位”划分产品的方式,而把更多模型直接围绕具体工作负载进行定位?现在还不知道答案。
输出Token的15倍跳跃
Gemini 4 Argon最直接的能力升级,体现在输出token。Google给出的数字是:最大输出token从上一代的64K提升到1M,增加超过15倍,由此称这是目前的“行业领先”。
这个变化和我们过去讲的“百万Token上下文”不一样:过去,输入token的扩张(例如Gemini曾把输入上限做到 1M、2M)主要解决的是“模型一次能够读进去多少东西”;而这次增加的是输出空间,输出token的扩张则影响模型能“一次思考多远、一次生成多长”,意味着增加了解决困难问题时的推理深度。
对企业来说,这个能力对应的是“长程任务”,也就是模型到底能不能把一件复杂工作持续做下去。
过去的模型在长程任务中,一个现实限制就Token预算,任务足够长以后,Agent可能不得不压缩历史信息、拆分任务、重新规划、甚至重新启动一轮执行,在这些交接过程中,就容易出现上下文丢失和状态漂移;而Gemini 4 Argon“最大输出token达到100万”,意味着任务可以在一次调用里完成大部分,减少上下文丢失和状态漂移的风险,也降低编排复杂度。
Benchmark解读:coding 之外的多线领先
Google在博客里给出了多组benchmark成绩,覆盖coding、企业知识工作、多模态、网络安全。

我们逐个来看看:
Gemini 4 Argon这次最稳定、也最值得关注的一项优势,出现在「长上下文」。
Google使用GraphWalks测试模型在超长上下文里持续追踪复杂关系的能力。

在128K以内的GraphWalks测试中,Argon达到99.7%,GPT-6 Astra为98.7%,Claude Fable 5.1为91.4%,Claude Opus 5.5为90.6%。前两个模型差距其实不大。
但当上下文继续拉到256K到1M Token后,差距开始明显扩大。Argon拿到了84.2%,下降幅度相对更小;而GPT-6 Astra下降到71.8%,Claude Fable 5.1为65.0%,Claude Opus 5.5为66.8%。这是整张表里最值得关注的数据之一。
过去讨论“100万Token上下文”,经常只看模型能不能把这么多内容塞进去。但真正的问题是:塞进去以后,它还能不能准确使用?这项指标意味着,Gemini 4在非常长的上下文里,它仍然能维持相对更高的信息追踪能力。这恰好和前面1M输出Token、长周期Agent任务形成呼应。
再来看企业知识工作方面。Vals Index是一个综合性经济影响指标,覆盖金融、编码、法律、税务等领域,按各行业对美国GDP的贡献做加权。Gemini 4 Argon在这项综合指标上拿到68.9%排名第一,高于Claude Opus 5.5的67.0%、Claude Fable 5.1的65.8%、GPT-6 Astra的63.1%,这是Google强调Argon“面向企业知识工作”的核心证据。

进一步来看,Gemini 4 Argon在Vals Finance Agent v2与Harvey's Legal Agent Benchmark分别拿到了65.4%和19.6%,前者评估多步金融研究能力,后者是法律AI公司Harvey提出的法律研究和起草基准,对比其他竞品拉开了一些明显差距。这一组数据基本对应了Google此次最想强调的方向:金融、法律和企业知识工作,是Argon最突出的优势区。


Coding方面。DeepSWE是评估模型在真实世界“长程软件工程任务”里表现的基准,Gemini 4 Argon的DeepSWE v1.1达到77.9%,高于Claude Opus 5.5的74.2%,GPT-6 Astra的74.1%,Claude Fable 5.1的67.4%。

不过,我们需要辩证性来看这个数字。DeepSWE v1.1共有113个任务,覆盖91个代码仓库。独立评测机构Epoch AI此前对这套benchmark进行审计后认为,其中至23个任务存在可能影响评分的问题,并将这套benchmark标记为“Flawed(有瑕疵的)”。因此,77.9%可以作为Argon长周期软件工程能力的一个指标,但不适合单独拿来证明它已经是“最强Coding模型”。
因为换一个工程benchmark,排序马上就变了。在FrontierSWE v2方面。Argon只有55.0%,GPT-6 Astra达到65.5%,Claude Fable 5.1为56.3%,Claude Opus 5.5为62.3%。这一项Argon和GPT-6 Astra甚至有10.5个百分点的差距。
在多模态方面,LVBench是评估长视频理解能力的基准。Gemini 4 Argon拿到91.7%,刷新了当前的“SOTA”。这对应的并不只是“模型能不能看懂视频”,而是未来企业Agent需要同时理解会议录像、图表、PDF、网页和其他资料以后继续完成任务的能力,Google举的具体场景是专业图表分析、长视频细节识别、基于系列文档的执行。

在安全方面,CWE-bench是评估模型修复安全漏洞能力的基准。CWE-bench v1上,Gemini 4 Argon拿到68%,与其他模型并列第一。这个成绩接续了Google 上一代 Gemini 3.8 Flash Cyber在CWE-bench v0上的领先。

综合看,Argon的优势非常集中:知识工作、长上下文、多模态理解,以及部分科学和数学任务表现突出;但到了部分真实软件工程、终端操作和Computer Use测试里,GPT-6 Astra和Claude Opus 5.5仍然领先。
Google内部的规模化落地:三个案例值得看
相比benchmark,这次更新更有信息量的部分其实是Google披露的三组内部实践。其中有的已经部署,有的仍处于测试、审计和进入生产环境之前的验证阶段。
第一件:量子算法优化。Gemini 4 Argon正在帮助Google量子计算研究团队优化关键应用中瓶颈子程序的时空资源,也就是量子比特数量与量子门操作数量的综合开销。
Google举的一个案例是,Argon在几分钟内将一个公开基线方案提高了40%。这类案例离普通用户很远,但它说明Google开始尝试让模型参与高度专业化的算法优化,而不仅仅是生成代码或者搜索资料。
第二件:数据中心内存效率优化。一组Argon agents分析Google全球数据中心集群的性能分析遥测数据,自主寻找并应用内存优化方案。Google称,这些优化完成部署以后已经释放超过300 TiB内存,预计最终总节省规模可能达到500 TiB到1 PiB。
这是一个纯粹意义上的“AI agent 在生产环境规模化运行”的案例:任务的识别、方案的生成、代码的应用、结果的验证,都可以让agent参与。300 TiB量级的效果对应的是Google全球数据中心的运维成本节省。
第三件:C/C++到Rust的代码迁移。Argon agents正在参与Google内部的C/C++代码库向Rust的迁移,规模从核心库(例如 re2、libgav1)的几万行代码,一直到Fuchsia Zircon内核的超过80万行代码。Google特意强调,“因为这些系统本身非常关键,大规模重写仍然需要经过严格的自动化和人工审计、模拟测试以及代码审核,才能进入生产环境。”言下之意是,Argon在这条链路里的角色不是“最终决策者”,而是“起草者”。
以上三个案例里,libgav1 案例尤其值得看。libgav1是Google的开源视频解码软件。Argon agents拿到一个既有的Rust移植版本,替换了其中3.2万行SIMD代码。它的做法不是机械地把C++翻译成Rust,而是“多轮基于性能分析结果的实验,观察编译器输出,再生成能够让编译器自动进行向量化优化的安全Rust代码”。最终结果是:新版本保持相同的视频输出,同时比原来的Rust版本运行速度提高2.7倍,性能接近于经过优化的C++版本。
Cyber defense:一个战略方向
Gemini 4 Argon的另一个特殊之处,在于它的第一批用户。
Google并没有首先向所有开发者和消费者开放,而是先通过Fairwind Program向一批“可信的网络安全防御者”提供访问。Fairwind Program是Google此前推出的、面向政府和企业提供主动网络防御的项目。
更值得注意的是权限设计。Google明确表示,对于经过认证的可信防御者以及Google自己的内部团队,将提供“不带网络安全能力限制”的Argon,使这些防御人员能够调用它完整的前沿网络安全防御能力。
也就是说,同一个模型采取的是分层能力开放:普通访问受到网络安全护栏限制,而经过审核的防御机构可以获取更高权限。这类“可信访问”机制正在成为前沿网络安全模型的重要发布方式。它本质上试图解决一个矛盾现状:模型越擅长寻找和利用软件漏洞,对防御者越有价值,对攻击者也越危险。
Google给出的合作案例是Wiz。这家云安全公司通过它的“Scan for Good”项目保护关键公共基础设施,早期使用Argon就发现了一个“关键漏洞”,暴露了全球医院使用的医疗软件里的敏感个人信息,这个风险此前的frontier模型都没有识别出来。
在Wiz的内部黑盒渗透测试基准上(这个基准测试模型在没有源代码的情况下分析活跃Web系统的能力),Argon在攻击面发现、漏洞识别、生成proof-of-concept证据方面都超过了上一代Gemini 3.8 Flash Cyber(见下图)。在Google自己的内部综合漏洞benchmark上,Argon已经能够处理跨20种编程语言的复杂代码库。

把这条路线连起来看会更清楚:Gemini 3.8 Flash Cyber、Fairwind Program、再到Gemini 4 Argon,Google并不是临时给旗舰模型增加了一个Cyber benchmark,而是在持续建立一条面向高能力网络防御模型的产品路线。这可能是Argon所有垂直方向里,目前战略连续性最明显的一条。
在Argon面向更广泛用户开放之前,Google明确表示会继续加强四个方面的安全护栏。这是官方博客里除了产品能力之外篇幅最重的部分。
防止滥用。针对可能被恶意行为者用于网络攻击或CBRN(化学、生物、放射、核)攻击的场景,Argon被设计为拒绝有害请求,同时保留合法的、双重用途的科学研究能力。Google还表示,正在改进对模型内部激活状态的监控,用来识别潜在滥用。这套机制已经通过内部和外部红队的手动与自动攻击测试。
防止提示词注入。间接提示词注入,指的是通过恶意指令或上下文劫持模型行为。Google声明Argon是至今在提示词注入上最有抵抗力的模型。
在Gray Swan的间接提示词注入(IPI)测试中,Gemini 4 Argon在攻击者最多尝试15次的情况下,攻击成功率为0.7%,低于Claude Opus 5.5的1.0%、Gemini 3.8 Flash的5.5%和GPT-6 Astra的8.5%。这项指标越低越好,衡量的是Agent在读取网页、邮件、文档等外部内容时,被其中隐藏的恶意指令劫持的概率。
监控目标偏离。Google表示,为了避免Argon为了完成任务而“越界”,正在部署一套同时监控其推理过程和实际行动的机制,在必要情况下直接停止执行。类似机制也被Google用于模型训练过程中:系统会向专门的事件响应团队发出警报,同时Google称会谨慎避免把监控发现直接反馈回训练,以免训练过程反过来塑造模型的推理,让其学会规避监控。
在这里,Google还公开呼吁整个行业在模型能力快速提高的阶段保留足够的“推理透明度”,让模型的推理信息仍然可以被用于识别和诊断目标偏离。
加固系统。第四道不是模型本身,而是模型工作的环境。Google表示,随着前沿模型能力提高,高风险训练和评估本身也需要更安全的沙箱环境。在相关任务开始之前,Google会进一步隔离和封闭这些环境,并表示会把Agent安全方面的实践与合作伙伴分享。
定价与分发路径
Argon的首发定价也相当值得看。
介绍期内,每百万输入token 2 美元、每百万输出token 10 美元,缓存输入token按输入价的5%计价(即95%折)。介绍期结束后,价格调整为每百万输入4美元、输出20美元。
这个首发价格在前沿模型里属于偏低的位置。对比可见,目前Claude Opus 5.5标准API价格是4美元输入、20美元输出;Claude Sonnet 5.5则是2美元输入、10美元输出。也就是说,Argon的介绍价实际上与Sonnet 5.5处在同一档,约为Opus 5.5的一半;而介绍期结束以后,其4/20美元的价格会直接进入Opus 5.5所在的价格区间。
OpenAI这边也已经形成明显的价格分层:GPT-6 Astra标准价为10美元输入、50美元输出,GPT-6 Sol则为2美元输入、10美元输出。因此Argon首发价格大致与GPT-6 Sol处于同档,明显低于Astra,但并不是一种“突破整个行业价格体系”的定价。
分发方式同样很特殊。目前Argon首先向Fairwind Program中的可信网络安全防御者和一批可信测试者开放;接下来是付费API客户和Google AI Ultra订阅者;再往后是开发者、企业客户、以及消费者。Google明确说,“正在参与美国政府针对模型预发布访问的自愿机制,在收集早期测试者反馈、继续调整安全护栏之后,再扩大开放范围”。
Argon的分阶段策略更接近Anthropic一贯的做法,也接近OpenAI近期对GPT-5 系列的处理方式,可见这是frontier AI行业在2026年下半年出现的共同趋势:顶级能力发布放缓、优先给高信任度合作伙伴、再逐步扩散。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。