Google Gemini深夜“三箭齐发”:输出Token直降17%
我们还没等来Gemini 3.5 Pro却等来了它的三位同事。就在北京时间7月22日凌晨Google一次性甩出3款全新Gemini模型Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、以及一个只给政府和“可信合作伙伴”用的Gemini 3.5 Flash Cyber。三款Gemini各自领到了一份相当具体的工作3.6 Flash负责复杂任务3.5 Flash-Lite负责高并发流水线3.5 Flash Cyber负责寻找和修复代码漏洞。一个当主力一个跑量一个负责安全。大模型已经开始像一支工程团队那样分工。顺便说下这波发布原本的主角本该是Gemini 3.5 Pro。早在今年5月的Google I/O上Google曾经提了句Gemini 3.5 Pro“6月底见”结果7月过去了大半3.5 Pro还是没发引发业界猜测3.5 Pro跳票了。而这次三箭齐发某种程度上也算是暂时交差。但Google也没含糊官方放话说“Gemini 3.5 Pro目前正在与合作伙伴开展测试我们计划在准备就绪后尽快广泛开放。”同时还不忘再卖个关子“我们最雄心勃勃的下一次预训练已经启动Gemini 4正在路上。”Emmm也就是说虽然3.5 Pro难产但是4.0已在紧锣密鼓地干。好了话不多说先来看新三款模型怎么个事儿。/01/3.6 Flash更便宜也更聪明三款模型中Gemini 3.6 Flash被Google称为“workhorse model”意思是承担日常复杂工作的主力模型。它直接在3.5 Flash基础上升级主要强化了代码、知识工作、多模态理解和计算机操作能力。但Google反复强调的指标并非参数量而是「Token效率」。我们看到在综合评估的Artificial Analysis Index数据里3.5 Flash平均消耗28K Token3.6 Flash平均消耗23K Token降幅约17%。在DeepSWE v1.1测试中(测试模型编码和长任务能力)3.5 Flash完成一个任务平均消耗276K Token3.6 Flash完成同样的任务平均只消耗97K Token降幅约65%。截图自 DeepSWEToken少了意味着什么同样的活儿让你少花钱。Google称3.6 Flash在执行多步骤工作流时会减少推理步骤和工具调用次数同时降低不必要的代码修改与重复执行。价格方面3.6 Flash的输入价格为每百万Token 1.5美元输出价格为每百万Token 7.5美元。此前3.5 Flash是9美元直接砍了16.7%。再叠加“输出Token本身少17%”的效果做同样一个Agent任务的实际成本大概会下降三成左右。Google试图把衡量标准从“每百万Token多少钱”进一步推向“完成一项任务总共多少钱”。截图自 Artificial Analysis Index官网别看价格便宜了能力却蹭蹭涨了像极了当代打工人的现状。Google给出了一组对比图。截图自 Google Blog上图的四组柱状图可见3.6 Flash在软件工程、机器学习工程、知识工作和计算机操作四类Agent任务上都高于上一代3.5 Flash也高于3.1 Pro。在长期软件工程测试DeepSWE v1.1中3.6 Flash得分49%高于3.5 Flash的37%在机器学习工程测试MLE-Bench中两者分别为63.9%和49.7%知识工作测试GDPval-AA v2中3.6 Flash获得1421分3.5 Flash为1349分。这次更新中有个细节我觉得挺关键的。Google还强化了3.6 Flash的Computer Use能力(电脑操作能力)在测试计算机操作能力的OSWorld-Verified中从上一代的78.4%提升至83.0%。Computer Use通过Gemini API和Gemini Enterprise以内置客户端工具的形式提供。啥叫Computer Use简单说就是AI可以打开你的浏览器、操作你的电脑、点击按钮、填写表单、跨应用做事。这个能力先被Anthropic的Claude 3.5 Sonnet率先端上电脑界面(Claude Computer Use)之后OpenAI、Google陆续跟上。光看benchmark数字可能不够直观Google直接放出一个对比视频让3.5 Flash和3.6 Flash分别跑同一个任务任务是在维基百科上找到耶鲁大学莫尔斯学院的院徽下载下来再用Python代码把图片改格式、调尺寸。这个任务其实是三件事信息检索(去维基百科翻)、文件下载(把图片扒下来)、代码执行(写Python改格式)。结果在OSWorld-Verified测试中3.5 Flash消耗了3833个Token执行了18步最终完成度评分85分3.6 Flash只消耗了1695个Token执行了14步最终完成度100分。截图自 Google Blog也就是说如果你原来跑一个AI Agent每月要花1万块现在用3.6 Flash可能5000块就够了而且还更快、更稳定。这次Gemini 3.6 Flash的整个更新逻辑几乎完全围绕这一件事展开的。更有说服力的是Google这次亮出的几个真实的客户案例秀出了它在文档解析、图表数据分析、报告撰写等多任务的表现。具体见下图。左上图在金融平台AIS上3.6 Flash做分析财报和会议记录效率碾压3.5 Flash。右上图在AGY平台上3.6 Flash通过多智能体协作跑代码迁移延迟更低、质量更高。左下图利用Canvas功能一句话让 3.6 Flash 做一个“3D 纹理提取器”直接用在3D建模。右下图3.6 Flash 靠视觉理解直接搭出一个可交互的主题设计工作台。截图来自Google Blog制图来自科技行者值得一提的是3.5 Flash的知识截止时间是2025年1月3.6 Flash直接更新到2026年3月。也就是说直到四个月前的大部分事儿它都知道也都能聊。以上属实是Agent的典型场景看来3.6 Flash想表达的是“我们的3.6 Flash不仅省钱还很实用”。/02/3.5 Flash-Lite一个小杀器居然打过了它的大哥如果说3.6 Flash是主角那3.5 Flash-Lite就是这次发布里最有意思的“小杀器”。Google给它的定位是3.5系列里最快、最便宜的一款。它瞄准的就是另一类需求量大、频繁、对延迟敏感。在Terminal-Bench 2.1中3.5 Flash-Lite的编码和代理任务能力达到54%而3.1 Flash-Lite是31%。在GDM-MRCR v2中3.5 Flash-Lite的长上下文能力是72.2%3.1 Flash-Lite是60.1%。在GDPval-AA v2中3.5 Flash-Lite的真实世界任务执行能力达到1140分而3.1 Flash-Lite是642分。而在许多代理和编码评估中3.5 Flash-Lite的性能甚至强于3 Flash包括 SWE-Bench Pro测试是54.2%比49.6%OSWorld-Verified测试是74.0%比65.1%。按照Artificial Analysis测试3.5 Flash-Lite每秒可以输出350个Token是Gemini 3.5系列中速度最快的模型。它的价格也更低每百万输入Token 0.3美元每百万输出Token 2.5美元。Google列出的典型场景有很多包括Agent搜索、文档处理、大规模数据提取、票据翻译和摘要等。其中在电商场景我看Google截图显示3.5 Flash-Lite从一个海量的电商数据集里批量提取产品特征并合成分析。3.5 Flash-Lite还允许开发者设置不同的“思考等级”。简单任务可以选择较低的思考强度以优先控制延迟和成本遇到多步骤子任务时再提高推理强度。Google还展示了一个有意思的用法让3.5 Flash-Lite和3.6 Flash协作3.6 Flash作为“总控智能体(Master Agent)”负责规划3.5 Flash-Lite负责“批量出活”。展示的场景是用户说“帮我做几个网页设计”然后3.5 Flash-Lite并行生成了25个可探索的设计概念。等等这一幕怎么有点熟悉这也许是当代AI大模型新潮流——人类指挥大模型理解目标、拆分任务小模型干活。03/3.5 Flash Cyber专门修漏洞第三款模型Gemini 3.5 Flash Cyber更加特殊。它基于3.5 Flash进行安全领域微调主要用于发现、验证和修复代码漏洞并与Google的代码安全Agent CodeMender(Google的代码安全智能体)配合使用。但是这个模型不对所有人开放只提供给“政府和可信合作伙伴”作为CodeMender的限量试点。Google还提到3.6 Flash引入了增强的Frontier Safety安全防护覆盖化学、生物、放射、核武(CBRN)、网络攻击滥用四个方向。这些防护让模型对越狱攻击(jailbreaks)更具抗性。04/一个信号聊完新模型还想聊一件事今天业内对Google为什么不发新Pro反而集中发三个Flash讨论比较多。我看到Google在这篇官方博客的开头写道“开发者和客户在构建生产级AI Agent时需要更高的Token效率、更低的延迟、更可靠的性能。”这么理解吧当大模型的更新速度比你家楼下奶茶店出新品还快时大家开始算账了。硅谷创投圈有个术语叫Unit Economics单位经济模型原本指一家公司做一单生意能不能赚钱通常用在SaaS、电商、外卖这些烧钱换增长的行业。现在这个词轮到AI应用了。AI的每一次调用都要算出经济账Agent跑一次要花多少钱Token省下的钱能不能覆盖开发成本性价比高不高做AI应用已经不再是“选哪个模型最强”这么简单了。就像点奶茶你不会每次都点最贵的那款得看今天想解什么渴、预算多少、能等多久。话说回来那款“最贵的”Pro我们还是挺期待的。

相关新闻

AI Agent平台架构设计与工程实践指南

AI Agent平台架构设计与工程实践指南

1. AI Agent平台的生存困境与破局之道过去两年里,我亲眼见证了上百个AI Agent平台的兴衰。这些平台大多在Demo阶段表现惊艳,却在规模化落地时折戟沉沙。究其原因,90%的失败案例都存在三个致命伤:首先,过度依赖单一模型…

2026/7/23 17:02:41阅读更多 →
基于YOLOv11的中医舌苔智能诊断系统开发实战

基于YOLOv11的中医舌苔智能诊断系统开发实战

1. 项目概述:中医舌苔智能诊断系统开发实战 这个基于深度学习的舌苔检测系统项目,本质上是在探索传统中医诊断学与现代计算机视觉技术的融合创新。作为一名长期从事医疗AI落地的开发者,我见证了这个领域从简单的图像分类到如今复杂病理特征识…

2026/7/23 17:02:41阅读更多 →
9大AI论文写作工具实测:学术合规与效率提升指南

9大AI论文写作工具实测:学术合规与效率提升指南

1. 项目背景与测评初衷去年指导本科生论文时,发现学生们最头疼的不是研究方向,而是根本不会用AI工具辅助写作。市面上号称能写论文的AI平台不下50种,但真正适合学术场景的少之又少。有些生成的内容像高中生作文,有些则直接输出学术…

2026/7/23 17:02:41阅读更多 →
滞回运放电路仿真和分析

滞回运放电路仿真和分析

滞回比较电路分析 目录滞回比较电路分析过零滞回比较电路仿真分析波形图改进的波形图滞回比较电路仿真过零滞回比较电路仿真 正反馈运放电路构成比较器电路,由于运放本身就具有很大的开环增益,所有即便是带正反馈也并不会有什么影响,此处的正…

2026/7/23 18:22:58阅读更多 →
Django毕业设计-基于 Django 的物资仓储与配送管理系统设计与实现 智能物资配送调度管理平台的设计与实现(源码+LW+部署文档+全bao+远程调试+代码讲解等)

Django毕业设计-基于 Django 的物资仓储与配送管理系统设计与实现 智能物资配送调度管理平台的设计与实现(源码+LW+部署文档+全bao+远程调试+代码讲解等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/23 18:22:58阅读更多 →
AI自动化内容创作流水线:OpenClaw与优云智算实践指南

AI自动化内容创作流水线:OpenClaw与优云智算实践指南

1. 项目概述:AI自动化内容创作流水线 这个项目本质上构建了一套从创意萌发到最终发布的完整AI自动化流水线。作为一名长期关注AI应用落地的从业者,我亲测这套方案能节省约70%的内容创作时间。核心由两大组件构成:OpenClaw作为任务调度中枢&am…

2026/7/23 18:22:58阅读更多 →
RAG与微调双引擎架构在金融问答系统中的实践

RAG与微调双引擎架构在金融问答系统中的实践

1. 项目概述:RAG与微调双引擎架构的价值去年我们团队接手了一个金融行业的智能问答系统项目,客户要求系统不仅能准确回答专业问题,还要能理解行业术语和业务场景。经过多次技术选型讨论,我们最终采用了RAG(检索增强生成…

2026/7/23 18:22:58阅读更多 →
前端开发有个老问题——要快,还要稳。快了容易出 Bug,稳了又跟不上节奏。两边都想顾好,光靠堆人力很难解决。

前端开发有个老问题——要快,还要稳。快了容易出 Bug,稳了又跟不上节奏。两边都想顾好,光靠堆人力很难解决。

前端开发有个老问题——要快,还要稳。快了容易出 Bug,稳了又跟不上节奏。两边都想顾好,光靠堆人力很难解决。 作为前端开发者,你肯定经历过这样的场景:产品经理拍着桌子喊“明天上线”,测试同学举着 Bug 列…

2026/7/23 18:22:58阅读更多 →
2026最新:语音转文字在线生成怎么选?3款免费实用工具亲测好用

2026最新:语音转文字在线生成怎么选?3款免费实用工具亲测好用

先回答用户真正关心的问题 现在2026年找免费实用的语音转文字在线生成工具,不需要乱搜乱试,我作为长期测试AI效率工具的博主,亲测了三款不同场景下都好用的工具,你可以直接按需求对号入座:纯实时听写选Nerd Dictation…

2026/7/23 18:20:58阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/22 22:56:18阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →