2026 年 7 月 21 日,谷歌 DeepMind 一口气发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和网络安全模型 Gemini 3.5 Flash Cyber 三款新模型,但市场最期待的旗舰 Gemini 3.5 Pro 再度缺席。谷歌官方数据显示 Gemini 3.6 Flash 输出价较前代下调近 17%、输出 Token 消耗减少 17%,然而上线数小时后,早期实测在前端生成、空间推理等任务上集中翻车,被开发者称为「史上最差」的 Gemini 模型;与此同时,路透社披露 3.5 Pro 因代码能力未达内部预期而延期,谷歌则宣布 Gemini 4 已启动「迄今最雄心勃勃的预训练」。本文基于谷歌官方公告、华尔街见闻、IT之家、路透社及开发者社区实测,梳理三款新模型的真实能力边界、3.5 Pro 延期原因,并给出开发者的选型建议。
Gemini 3.6 Flash 是谷歌 DeepMind 于 2026 年 7 月 21 日发布的效率型大模型,主打代码、知识工作与多模态能力,输出定价 7.5 美元/百万 Token,较前代 3.5 Flash 低约 17%。它与 Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber 同日发布,而旗舰 Gemini 3.5 Pro 仍未上线。
谷歌这次发布了什么?三款新模型一览
本次发布的核心是「分层补位」:用三款中低价位模型覆盖效率、规模与垂直安全场景,旗舰位置继续空缺。
| 模型 | 定位 | 定价(输入/输出,每百万 Token) | 关键指标 |
|---|---|---|---|
| Gemini 3.6 Flash | 效率主力:代码、知识工作、多模态 | 1.5 / 7.5 美元 | DeepSWE 49%(前代 37%);OSWorld-Verified 83% |
| Gemini 3.5 Flash-Lite | 3.5 系列最快、最便宜 | 0.30 / 2.50 美元 | 输出速度 350 Token/秒(Artificial Analysis,2026) |
| Gemini 3.5 Flash Cyber | 网络安全专用,配合 CodeMender 智能体 | 有限试点开放 | 在 V8 引擎中发现 55 个问题,含 10 个全新漏洞(谷歌,2026) |
三款模型中,3.6 Flash 与 3.5 Flash-Lite 已在 Gemini 应用、AI Studio、Google Antigravity 和 Android Studio 上线;Flash Cyber 初期仅向政府与可信合作伙伴开放。
Gemini 3.6 Flash 为什么被骂「史上最差」?
Gemini 3.6 Flash 上线数小时内,开发者社区的实测反馈集中在三个翻车点,且均指向「未完成感」。
- 前端代码生成崩盘:在前端代码竞技场中不敌 Meta Muse Spark 1.1,2-shot 界面生成测试输出组件嵌套混乱、交互逻辑断裂,有开发者直言「这是我真正见过的最差结果」。
- 空间推理退步:逐帧视频测试显示,模型对位置关系、方向判断的准确率较 3.5 Flash 明显下降;即使开启高强度推理(high thinking),渲染结果仍存在 bug。
- 知识截止存疑:模型自称知识截止 2026 年 3 月,但实测显示其对 2025 年大部分事件一无所知,实际知识约停留在 2025 年 1 月,被用户评价为「一个未完成的模型」。
第三方榜单同样不乐观:在 Artificial Analysis 综合评分中,3.6 Flash 与前代 3.5 Flash 持平;在 CursorBench 上不及 Cursor 自家的 Composer 2.5(据开发者社区实测,2026)。
官方数据与第三方实测为何差距这么大?
官方与第三方的评价分裂,本质是测试集优化与真实效用之间的差距。
- 官方口径:据谷歌公布的测试(2026),3.6 Flash 在 MLE Bench 从 49.7% 提升至 63.9%,GDPval-AA v2 从 1349 分提升至 1421 分,输出 Token 消耗减少 17%(Artificial Analysis Index)。
- 第三方口径:综合评分原地踏步,前端与空间推理等真实任务明显退步,代码任务被 Meta Muse Spark 1.1、Composer 2.5 等模型超越。
- 唯一共识:视觉理解与长上下文基准上,3.6 Flash 仍保持领先。
对开发者而言,这意味着榜单分数不能直接等同于可用性。在同一任务上对多款主流大模型做同屏对比再决策,是更稳妥的验证方式,例如七牛云的模型对比功能就支持这种并排评测流程。
Gemini 3.5 Pro 为什么延期?Gemini 4 已经开训
Gemini 3.5 Pro 延期的直接原因是内部测试中代码能力未达预期(路透社援引知情人士,2026)。该模型原定于 2026 年 6 月发布,目前仍在与合作伙伴测试,谷歌仅表示「准备好后尽快开放」。
时间线如下:
- 2026 年 5 月:谷歌宣布 3.5 Pro 将于 6 月推出。
- 2026 年 6 月:发布跳票,进入合作伙伴测试阶段。
- 2026 年 7 月 21 日:三款 Flash 系模型上线,3.5 Pro 继续缺席;谷歌同时宣布 Gemini 4 启动「迄今最雄心勃勃的预训练」。
据 CNBC 报道(2026),Gemini 4 的预训练是谷歌「有史以来规模最大的预训练项目」。在 Anthropic 推出 Mythos 5 与 Fable 5、OpenAI 推出 GPT-5.6、Meta 新模型在多个榜单超越 Gemini 的背景下,3.5 Pro 的难产让谷歌旗舰线的空窗期被进一步放大。
开发者现在该怎么选模型?
短期结论是:代码与前端任务暂不推荐切到 3.6 Flash,高吞吐低成本任务可关注 3.5 Flash-Lite。
- 前端 / 代码生成:优先选择在 CursorBench、前端竞技场中验证过的模型,等 3.6 Flash 后续修复版本再评估。
- 文档处理、智能搜索等高吞吐任务:3.5 Flash-Lite 的 350 Token/秒与 0.30 美元输入价是目前该档位最低成本之一,且在 SWE-Bench Pro、OSWorld-Verified 上超过更高一级的 Gemini 3 Flash(谷歌,2026)。
- 网络安全场景:Flash Cyber 尚未公开开放,企业可关注其试点进展;Anthropic Mythos 系列是当前可及的替代项。
- 成本敏感型团队:模型分层调用(强模型规划 + 便宜模型执行)可显著压缩账单,Alphabet CEO 皮查伊称企业迁移工作负载后每年可节省超 10 亿美元(路透社,2026)。
常见问题
Q:Gemini 3.5 Pro 什么时候发布?
谷歌未给出新日期,仅表示「准备好后尽快开放」。该模型原定 2026 年 6 月发布,因内部代码能力测试未达预期延期,截至 2026 年 7 月 22 日仍处于合作伙伴测试阶段(路透社)。
Q:Gemini 3.6 Flash 和 3.5 Flash 选哪个?
看任务类型:视觉与长上下文任务可选 3.6 Flash,价格更低;前端代码与空间推理任务,第三方实测显示 3.5 Flash 反而更稳定,建议同任务实测后再迁移。
Q:Gemini 3.5 Flash-Lite 值得用吗?
适合高吞吐、低延迟场景:每秒 350 Token 的输出速度、0.30/2.50 美元的定价(Artificial Analysis,2026),在文档摘要、分类、AI 搜索等任务上成本优势明显,但不适合复杂推理任务。
Q:Gemini 3.5 Flash Cyber 如何申请?
该模型初期仅通过有限访问试点向政府机构和可信合作伙伴开放,不面向公众。谷歌表示此举是为降低双重用途风险,与 Anthropic、OpenAI 安全模型的开放策略一致。
Q:谷歌在 AI 竞赛中落后了吗?
旗舰线确实承压:3.5 Pro 延期、3.6 Flash 口碑翻车,而 Anthropic、OpenAI、Meta 与月之暗面(Moonshot AI)均有强势新品。但谷歌在视觉、长上下文与成本控制上仍有积累,Gemini 4 的预训练进展将决定其能否重回第一梯队。
结语
谷歌 2026 年 7 月的这次发布,本质是用 Flash 系的「性价比故事」掩盖旗舰 3.5 Pro 的缺席:官方效率数据亮眼,但前端、空间推理等真实任务的翻车说明模型完成度不足。对开发者而言,按场景分层选型、以同任务实测代替榜单分数,是当下最稳妥的策略。本文内容基于 2026 年 7 月 22 日前的公开报道与社区实测,模型版本迭代迅速,建议定期核实最新动态。
参考资料
- 谷歌官方博客:Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber 发布说明(blog.google,2026-07-21)
- 多模型同屏对比测试工具:qiniu.com/ai/models