
我们还没等来Gemini 3.5 Pro,却等来了它的三位同事。
就在北京时间7月22日凌晨,Google一次性甩出3款全新Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、以及一个只给政府和“可信合作伙伴”用的Gemini 3.5 Flash Cyber。
三款Gemini,各自领到了一份相当具体的工作:3.6 Flash负责复杂任务,3.5 Flash-Lite负责高并发流水线,3.5 Flash Cyber负责寻找和修复代码漏洞。
一个当主力,一个跑量,一个负责安全。大模型已经开始像一支工程团队那样分工。
顺便说下,这波发布,原本的主角本该是Gemini 3.5 Pro。早在今年5月的Google I/O上,Google曾经提了句Gemini 3.5 Pro“6月底见”,结果7月过去了大半,3.5 Pro还是没发,引发业界猜测3.5 Pro跳票了。而这次三箭齐发,某种程度上也算是暂时交差。
但Google也没含糊,官方放话说:“Gemini 3.5 Pro目前正在与合作伙伴开展测试,我们计划在准备就绪后尽快广泛开放。”同时,还不忘再卖个关子,“我们最雄心勃勃的下一次预训练已经启动,Gemini 4正在路上。”
Emmm也就是说,虽然3.5 Pro难产,但是4.0已在紧锣密鼓地干。
好了,话不多说,先来看新三款模型怎么个事儿。
/01/
3.6 Flash:更便宜,也更聪明
三款模型中,Gemini 3.6 Flash被Google称为“workhorse model”,意思是承担日常复杂工作的主力模型。
它直接在3.5 Flash基础上升级,主要强化了代码、知识工作、多模态理解和计算机操作能力。但Google反复强调的指标,并非参数量,而是「Token效率」。
我们看到在综合评估的Artificial Analysis Index数据里,3.5 Flash平均消耗28K Token,3.6 Flash平均消耗23K Token,降幅约17%。在DeepSWE v1.1测试中(测试模型编码和长任务能力),3.5 Flash完成一个任务平均消耗276K Token,3.6 Flash完成同样的任务平均只消耗97K Token,降幅约65%。
截图自 DeepSWE
Token少了意味着什么?同样的活儿,让你少花钱。Google称,3.6 Flash在执行多步骤工作流时,会减少推理步骤和工具调用次数,同时降低不必要的代码修改与重复执行。
价格方面,3.6 Flash的输入价格为每百万Token 1.5美元,输出价格为每百万Token 7.5美元。此前3.5 Flash是9美元,直接砍了16.7%。再叠加“输出Token本身少17%”的效果,做同样一个Agent任务的实际成本,大概会下降三成左右。Google试图把衡量标准从“每百万Token多少钱”,进一步推向“完成一项任务总共多少钱”。
截图自 Artificial Analysis Index官网
别看价格便宜了,能力却蹭蹭涨了,像极了当代打工人的现状。Google给出了一组对比图。
截图自 Google Blog
上图的四组柱状图可见,3.6 Flash在软件工程、机器学习工程、知识工作和计算机操作四类Agent任务上,都高于上一代3.5 Flash,也高于3.1 Pro。
在长期软件工程测试DeepSWE v1.1中,3.6 Flash得分49%,高于3.5 Flash的37%;在机器学习工程测试MLE-Bench中,两者分别为63.9%和49.7%;知识工作测试GDPval-AA v2中,3.6 Flash获得1421分,3.5 Flash为1349分。
这次更新中有个细节,我觉得挺关键的。Google还强化了3.6 Flash的Computer Use能力(电脑操作能力),在测试计算机操作能力的OSWorld-Verified中,从上一代的78.4%提升至83.0%。Computer Use通过Gemini API和Gemini Enterprise,以内置客户端工具的形式提供。
啥叫Computer Use?简单说就是,AI可以打开你的浏览器、操作你的电脑、点击按钮、填写表单、跨应用做事。这个能力先被Anthropic的Claude 3.5 Sonnet率先端上电脑界面(Claude Computer Use),之后OpenAI、Google陆续跟上。
光看benchmark数字可能不够直观,Google直接放出一个对比视频,让3.5 Flash和3.6 Flash分别跑同一个任务,任务是,在维基百科上找到耶鲁大学莫尔斯学院的院徽,下载下来,再用Python代码把图片改格式、调尺寸。
这个任务其实是三件事:信息检索(去维基百科翻)、文件下载(把图片扒下来)、代码执行(写Python改格式)。结果在OSWorld-Verified测试中,3.5 Flash消耗了3833个Token,执行了18步,最终完成度评分85分;3.6 Flash只消耗了1695个Token,执行了14步,最终完成度100分。
截图自 Google Blog
也就是说,如果你原来跑一个AI Agent每月要花1万块,现在用3.6 Flash可能5000块就够了,而且还更快、更稳定。
这次Gemini 3.6 Flash的整个更新逻辑,几乎完全围绕这一件事展开的。
更有说服力的,是Google这次亮出的几个真实的客户案例,秀出了它在文档解析、图表数据分析、报告撰写等多任务的表现。
具体见下图。左上图,在金融平台AIS上,3.6 Flash做分析财报和会议记录,效率碾压3.5 Flash。右上图,在AGY平台上,3.6 Flash通过多智能体协作跑代码迁移,延迟更低、质量更高。左下图,利用Canvas功能,一句话让 3.6 Flash 做一个“3D 纹理提取器”,直接用在3D建模。右下图,3.6 Flash 靠视觉理解,直接搭出一个可交互的主题设计工作台。
截图来自Google Blog,制图来自科技行者
值得一提的是,3.5 Flash的知识截止时间是2025年1月,3.6 Flash直接更新到2026年3月。也就是说,直到四个月前的大部分事儿它都知道,也都能聊。
以上属实是Agent的典型场景,看来3.6 Flash想表达的是,“我们的3.6 Flash不仅省钱,还很实用”。
/02/
3.5 Flash-Lite:一个小杀器,居然打过了它的大哥
如果说3.6 Flash是主角,那3.5 Flash-Lite就是这次发布里最有意思的“小杀器”。
Google给它的定位是,3.5系列里最快、最便宜的一款。它瞄准的就是另一类需求:量大、频繁、对延迟敏感。
在Terminal-Bench 2.1中,3.5 Flash-Lite的编码和代理任务能力达到54%,而3.1 Flash-Lite是31%。在GDM-MRCR v2中,3.5 Flash-Lite的长上下文能力是72.2%,3.1 Flash-Lite是60.1%。在GDPval-AA v2中,3.5 Flash-Lite的真实世界任务执行能力达到1140分,而3.1 Flash-Lite是642分。
而在许多代理和编码评估中,3.5 Flash-Lite的性能甚至强于3 Flash,包括 SWE-Bench Pro测试是54.2%比49.6%,OSWorld-Verified测试是74.0%比65.1%。
按照Artificial Analysis测试,3.5 Flash-Lite每秒可以输出350个Token,是Gemini 3.5系列中速度最快的模型。它的价格也更低,每百万输入Token 0.3美元,每百万输出Token 2.5美元。
Google列出的典型场景有很多,包括Agent搜索、文档处理、大规模数据提取、票据翻译和摘要等。其中在电商场景,我看Google截图显示,3.5 Flash-Lite从一个海量的电商数据集里,批量提取产品特征,并合成分析。
3.5 Flash-Lite还允许开发者设置不同的“思考等级”。简单任务,可以选择较低的思考强度,以优先控制延迟和成本;遇到多步骤子任务时,再提高推理强度。
Google还展示了一个有意思的用法,让3.5 Flash-Lite和3.6 Flash协作:3.6 Flash作为“总控智能体(Master Agent)”,负责规划;3.5 Flash-Lite负责“批量出活”。展示的场景是,用户说“帮我做几个网页设计”,然后3.5 Flash-Lite并行生成了25个可探索的设计概念。
等等,这一幕怎么有点熟悉,这也许是当代AI大模型新潮流——人类指挥,大模型理解目标、拆分任务,小模型干活。
03/
3.5 Flash Cyber专门修漏洞
第三款模型Gemini 3.5 Flash Cyber更加特殊。它基于3.5 Flash进行安全领域微调,主要用于发现、验证和修复代码漏洞,并与Google的代码安全Agent CodeMender(Google的代码安全智能体)配合使用。
但是这个模型不对所有人开放,只提供给“政府和可信合作伙伴”,作为CodeMender的限量试点。
Google还提到,3.6 Flash引入了增强的Frontier Safety安全防护,覆盖化学、生物、放射、核武(CBRN)、网络攻击滥用四个方向。这些防护让模型对越狱攻击(jailbreaks),更具抗性。
04/
一个信号
聊完新模型,还想聊一件事,今天业内对Google为什么不发新Pro,反而集中发三个Flash讨论比较多。
我看到Google在这篇官方博客的开头写道:“开发者和客户在构建生产级AI Agent时,需要更高的Token效率、更低的延迟、更可靠的性能。”
这么理解吧,当大模型的更新速度比你家楼下奶茶店出新品还快时,大家开始算账了。
硅谷创投圈有个术语,叫Unit Economics单位经济模型,原本指一家公司做一单生意能不能赚钱,通常用在SaaS、电商、外卖这些烧钱换增长的行业。
现在这个词,轮到AI应用了。
AI的每一次调用都要算出经济账:Agent跑一次要花多少钱?Token省下的钱能不能覆盖开发成本?性价比高不高?
做AI应用,已经不再是“选哪个模型最强”这么简单了。就像点奶茶,你不会每次都点最贵的那款,得看今天想解什么渴、预算多少、能等多久。
话说回来,那款“最贵的”Pro,我们还是挺期待的。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。