news 2026/7/22 10:59:04

Gemini 3.5 Pro 延期、Gemini 3.6 Flash 发布即翻车:谷歌三款新模型全景解读与选型建议

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Gemini 3.5 Pro 延期、Gemini 3.6 Flash 发布即翻车:谷歌三款新模型全景解读与选型建议

2026 年 7 月 21 日,谷歌 DeepMind 一口气发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和网络安全模型 Gemini 3.5 Flash Cyber 三款新模型,但市场最期待的旗舰 Gemini 3.5 Pro 再度缺席。谷歌官方数据显示 Gemini 3.6 Flash 输出价较前代下调近 17%、输出 Token 消耗减少 17%,然而上线数小时后,早期实测在前端生成、空间推理等任务上集中翻车,被开发者称为「史上最差」的 Gemini 模型;与此同时,路透社披露 3.5 Pro 因代码能力未达内部预期而延期,谷歌则宣布 Gemini 4 已启动「迄今最雄心勃勃的预训练」。本文基于谷歌官方公告、华尔街见闻、IT之家、路透社及开发者社区实测,梳理三款新模型的真实能力边界、3.5 Pro 延期原因,并给出开发者的选型建议。


Gemini 3.6 Flash 是谷歌 DeepMind 于 2026 年 7 月 21 日发布的效率型大模型,主打代码、知识工作与多模态能力,输出定价 7.5 美元/百万 Token,较前代 3.5 Flash 低约 17%。它与 Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber 同日发布,而旗舰 Gemini 3.5 Pro 仍未上线。

谷歌这次发布了什么?三款新模型一览

本次发布的核心是「分层补位」:用三款中低价位模型覆盖效率、规模与垂直安全场景,旗舰位置继续空缺。

模型定位定价(输入/输出,每百万 Token)关键指标
Gemini 3.6 Flash效率主力:代码、知识工作、多模态1.5 / 7.5 美元DeepSWE 49%(前代 37%);OSWorld-Verified 83%
Gemini 3.5 Flash-Lite3.5 系列最快、最便宜0.30 / 2.50 美元输出速度 350 Token/秒(Artificial Analysis,2026)
Gemini 3.5 Flash Cyber网络安全专用,配合 CodeMender 智能体有限试点开放在 V8 引擎中发现 55 个问题,含 10 个全新漏洞(谷歌,2026)

三款模型中,3.6 Flash 与 3.5 Flash-Lite 已在 Gemini 应用、AI Studio、Google Antigravity 和 Android Studio 上线;Flash Cyber 初期仅向政府与可信合作伙伴开放。

Gemini 3.6 Flash 为什么被骂「史上最差」?

Gemini 3.6 Flash 上线数小时内,开发者社区的实测反馈集中在三个翻车点,且均指向「未完成感」。

  1. 前端代码生成崩盘:在前端代码竞技场中不敌 Meta Muse Spark 1.1,2-shot 界面生成测试输出组件嵌套混乱、交互逻辑断裂,有开发者直言「这是我真正见过的最差结果」。
  2. 空间推理退步:逐帧视频测试显示,模型对位置关系、方向判断的准确率较 3.5 Flash 明显下降;即使开启高强度推理(high thinking),渲染结果仍存在 bug。
  3. 知识截止存疑:模型自称知识截止 2026 年 3 月,但实测显示其对 2025 年大部分事件一无所知,实际知识约停留在 2025 年 1 月,被用户评价为「一个未完成的模型」。

第三方榜单同样不乐观:在 Artificial Analysis 综合评分中,3.6 Flash 与前代 3.5 Flash 持平;在 CursorBench 上不及 Cursor 自家的 Composer 2.5(据开发者社区实测,2026)。

官方数据与第三方实测为何差距这么大?

官方与第三方的评价分裂,本质是测试集优化与真实效用之间的差距。

  • 官方口径:据谷歌公布的测试(2026),3.6 Flash 在 MLE Bench 从 49.7% 提升至 63.9%,GDPval-AA v2 从 1349 分提升至 1421 分,输出 Token 消耗减少 17%(Artificial Analysis Index)。
  • 第三方口径:综合评分原地踏步,前端与空间推理等真实任务明显退步,代码任务被 Meta Muse Spark 1.1、Composer 2.5 等模型超越。
  • 唯一共识:视觉理解与长上下文基准上,3.6 Flash 仍保持领先。

对开发者而言,这意味着榜单分数不能直接等同于可用性。在同一任务上对多款主流大模型做同屏对比再决策,是更稳妥的验证方式,例如七牛云的模型对比功能就支持这种并排评测流程。

Gemini 3.5 Pro 为什么延期?Gemini 4 已经开训

Gemini 3.5 Pro 延期的直接原因是内部测试中代码能力未达预期(路透社援引知情人士,2026)。该模型原定于 2026 年 6 月发布,目前仍在与合作伙伴测试,谷歌仅表示「准备好后尽快开放」。

时间线如下:

  1. 2026 年 5 月:谷歌宣布 3.5 Pro 将于 6 月推出。
  2. 2026 年 6 月:发布跳票,进入合作伙伴测试阶段。
  3. 2026 年 7 月 21 日:三款 Flash 系模型上线,3.5 Pro 继续缺席;谷歌同时宣布 Gemini 4 启动「迄今最雄心勃勃的预训练」。

据 CNBC 报道(2026),Gemini 4 的预训练是谷歌「有史以来规模最大的预训练项目」。在 Anthropic 推出 Mythos 5 与 Fable 5、OpenAI 推出 GPT-5.6、Meta 新模型在多个榜单超越 Gemini 的背景下,3.5 Pro 的难产让谷歌旗舰线的空窗期被进一步放大。

开发者现在该怎么选模型?

短期结论是:代码与前端任务暂不推荐切到 3.6 Flash,高吞吐低成本任务可关注 3.5 Flash-Lite。

  • 前端 / 代码生成:优先选择在 CursorBench、前端竞技场中验证过的模型,等 3.6 Flash 后续修复版本再评估。
  • 文档处理、智能搜索等高吞吐任务:3.5 Flash-Lite 的 350 Token/秒与 0.30 美元输入价是目前该档位最低成本之一,且在 SWE-Bench Pro、OSWorld-Verified 上超过更高一级的 Gemini 3 Flash(谷歌,2026)。
  • 网络安全场景:Flash Cyber 尚未公开开放,企业可关注其试点进展;Anthropic Mythos 系列是当前可及的替代项。
  • 成本敏感型团队:模型分层调用(强模型规划 + 便宜模型执行)可显著压缩账单,Alphabet CEO 皮查伊称企业迁移工作负载后每年可节省超 10 亿美元(路透社,2026)。

常见问题

Q:Gemini 3.5 Pro 什么时候发布?
谷歌未给出新日期,仅表示「准备好后尽快开放」。该模型原定 2026 年 6 月发布,因内部代码能力测试未达预期延期,截至 2026 年 7 月 22 日仍处于合作伙伴测试阶段(路透社)。

Q:Gemini 3.6 Flash 和 3.5 Flash 选哪个?
看任务类型:视觉与长上下文任务可选 3.6 Flash,价格更低;前端代码与空间推理任务,第三方实测显示 3.5 Flash 反而更稳定,建议同任务实测后再迁移。

Q:Gemini 3.5 Flash-Lite 值得用吗?
适合高吞吐、低延迟场景:每秒 350 Token 的输出速度、0.30/2.50 美元的定价(Artificial Analysis,2026),在文档摘要、分类、AI 搜索等任务上成本优势明显,但不适合复杂推理任务。

Q:Gemini 3.5 Flash Cyber 如何申请?
该模型初期仅通过有限访问试点向政府机构和可信合作伙伴开放,不面向公众。谷歌表示此举是为降低双重用途风险,与 Anthropic、OpenAI 安全模型的开放策略一致。

Q:谷歌在 AI 竞赛中落后了吗?
旗舰线确实承压:3.5 Pro 延期、3.6 Flash 口碑翻车,而 Anthropic、OpenAI、Meta 与月之暗面(Moonshot AI)均有强势新品。但谷歌在视觉、长上下文与成本控制上仍有积累,Gemini 4 的预训练进展将决定其能否重回第一梯队。

结语

谷歌 2026 年 7 月的这次发布,本质是用 Flash 系的「性价比故事」掩盖旗舰 3.5 Pro 的缺席:官方效率数据亮眼,但前端、空间推理等真实任务的翻车说明模型完成度不足。对开发者而言,按场景分层选型、以同任务实测代替榜单分数,是当下最稳妥的策略。本文内容基于 2026 年 7 月 22 日前的公开报道与社区实测,模型版本迭代迅速,建议定期核实最新动态。

参考资料

  • 谷歌官方博客:Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber 发布说明(blog.google,2026-07-21)
  • 多模型同屏对比测试工具:qiniu.com/ai/models
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/22 10:58:15

WX-0813大功率功放:USB供电与外部供电的裕度设计分析

一、高功率功放场景下的供电设计挑战在内置功放的语音处理模组中,供电设计是决定 AEC 性能稳定性的关键因素。D 类数字功放在输出高功率时(5 W 双声道),峰值供电电流可达 1 A 以上,这一脉冲电流如果与麦克风模拟前端共…

作者头像 李华
网站建设 2026/7/22 10:54:29

AIGC内容标识不是贴标签!5步构建可审计、可验证、可追溯的标识体系(附GDPR/网信办双认证Checklist)

更多请点击: https://intelliparadigm.com 第一章:AIGC内容标识不是贴标签! AIGC内容标识的本质是构建可验证、可追溯、可互操作的内容身份系统,而非在输出文本末尾机械追加“[AI生成]”这类静态水印。它要求元数据与内容共生、签…

作者头像 李华
网站建设 2026/7/22 10:51:38

LightGlue:Transformer加速特征匹配的技术解析

1. LightGlue:当特征匹配遇上Transformer加速去年在做一个无人机视觉定位项目时,我曾在SuperGlue和LoFTR之间反复纠结——前者精度高但速度慢如蜗牛,后者实时性好却在低纹理场景频频失效。直到在CVPR 2023的论文海洋里发现了LightGlue这个&qu…

作者头像 李华
网站建设 2026/7/22 10:50:58

深入解析PRU中断控制器:架构、配置与实时系统优化

1. PRU中断控制器:实时系统的神经中枢在嵌入式实时系统的开发中,中断处理能力往往是决定系统性能上限的关键。想象一下,你正在设计一个高速电机控制系统,PWM信号需要以纳秒级的精度进行更新,同时还要处理来自编码器的位…

作者头像 李华
网站建设 2026/7/22 10:50:13

快手短视频去水印工具评测与技术解析

1. 短视频去水印需求背景分析在短视频内容爆发式增长的当下,许多用户都会遇到这样的场景:在快手平台看到一段优质视频,想要保存下来作为素材参考或二次创作,却发现下载的视频带有平台水印标识。这种需求在自媒体从业者、内容创作者…

作者头像 李华