隆重推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

产品 · 模型 · 2026年7月21日

构建生产级 AI 智能体的开发者和客户需要更高的 token 效率、更低的延迟和更可靠的性能。我们的 Flash 系列模型旨在满足效率与质量的最佳平衡点,以支持智能体工作流的扩展。在 Gemini 3.5 Flash 的基础上,我们推出新的 Gemini 模型:

  • 3.6 Flash:我们的工作模型,提供更好的编程、知识工作和多模态性能。根据 Artificial Analysis Index,相比 3.5 Flash 输出 token 使用量减少 17%,在 Datacurve 的 DeepSWE 等某些基准上减少高达 65%,且每输出 token 成本更低。

  • 3.5 Flash-Lite:我们最快、最具成本效益的 3.5 级别模型,根据 Artificial Analysis Index 达到每秒 350 个输出 token,在智能体工作流中也显著超越前代 Flash-Lite。

  • CodeMender 中的 3.5 Flash Cyber:成功的网络安全应用需要模型与智能体基础设施的精心编排。我们推出一个全新、高效、网络安全专用模型,与 CodeMender 代码安全智能体配合,在前沿水平提供有竞争力的性能。

除了今天的发布之外,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,我们计划在准备就绪后广泛提供。与此同时,我们的团队已经在专注于构建下一代模型。我们已经启动了迄今为止最宏大的预训练运行——Gemini 4,并对进展感到兴奋。

6 Flash:比 3.5 Flash 更高效且质量更好

Gemini 3.6 Flash 直接基于开发者和客户对 3.5 Flash 的反馈构建。3.6 Flash 不仅在编程和知识工作上有阶跃式提升,而且在 token 效率上也有显著改进。例如,在 Artificial Analysis Index 上,我们看到 3.6 Flash 比 3.5 Flash 消耗少 17% 的输出 token。它还需要更少的推理步骤和工具调用来完成多步骤工作流。

这种增强的效率还结合了比 3.5 Flash 更低的价格。定价为 $1.50/百万输入 token 和 $7.50/百万输出 token,3.6 Flash 降低了每个智能体任务的总体成本,使智能体的构建和运行更具成本效益。

3.6 Flash 在 OSWorld 验证任务中比 3.5 Flash 展现出更好的 token 效率和更少的冗余

即使更高效,3.6 Flash 在用例上相比 3.5 Flash 仍有性能提升:

  • 3.6 Flash 提供更高的精度,减少不必要的代码编辑和执行循环,如 DeepSWE(49% vs 37%)所示,在 ML 研究方面也有显著改进,如 MLE Bench(63.9% vs 49.7%)。

  • 它在计算机使用能力上有所提升,如 OSWorld-Verified(83.0% vs 78.4%)。计算机使用现在通过 Gemini API 和 Gemini Enterprise 作为内置客户端工具提供。

  • 它在知识工作上超越 3.5 Flash,如 GDPval-AA v2(1421 vs 1349)等基准所示。Hebbia 和 Harvey 等客户发现它在文档解析、图表数据分析和报告起草等多模态任务上特别有能力。

3.6 Flash 使用 AIS 上的 Managed Agents,可以比 3.5 Flash(AIS)更高效准确地解析和分析财务数据及转录

3.6 Flash 使用 AGY 上的多智能体编排执行代码迁移,延迟更低且质量更高(AGY)

3.6 Flash 帮助开发 3D 工作流的照片纹理提取器,使用 canvas(Gemini App)

3.6 Flash 使用 AGY 和 tldraw 离线编辑器,凭借其强大的视觉理解能力构建交互式主题工作室(AGY)

客户报告 3.6 Flash 在成本和质量上都向前迈进了一步,在复杂工作流和基于知识的任务中平衡了 token 效率、准确性和速度:

安全构建

3.6 Flash 附带增强的 前沿安全 防护措施,针对化学、生物、放射性和核(CBRN)以及网络攻击滥用领域。这些防护措施使模型对抗越狱的能力大幅增强。同时,模型经过训练以最小化对有益用途的拒绝。

更多信息请参阅 3.6 Flash 模型卡。

5 Flash-Lite:为扩展智能体工作流而构建

除了 Flash,我们还发布 Gemini 3.5 Flash-Lite,专为低延迟任务和高吞吐量对开发者工作流至关重要的场景设计,如智能体搜索和文档处理。

3.5 Flash-Lite 是 3.5 系列中最快的模型。根据 Artificial Analysis 测量,它以每秒 350 个输出 token 的速度运行。定价为 $0.3/百万输入 token 和 $2.5/百万输出 token,且质量显著优于 3.1 Flash-Lite,3.5 Flash-Lite 为运行高吞吐量生产流量的开发者和客户提供了强大的性价比。

3.5 Flash-Lite 以比 3.5 Flash 更低的延迟执行高容量任务

3.5 Flash-Lite 能够高效扩展智能体系统。在所有思考级别上,该模型显著超越 3.1 Flash-Lite。根据工作负载,开发者可以配置模型以最小和低思考级别优先处理高容量任务的低延迟、低成本执行,或使用更高思考级别处理多步骤子智能体工作负载。该模型现在还将计算机使用作为内置工具,可靠支持跨平台的这些智能体任务。

它在编码和智能体任务上是显著提升,如 Terminal-Bench 2.1(54% vs 31%)、长上下文如 GDM-MRCR v2(72.2% vs 60.1%)、真实世界任务执行如 GDPval-AA v2(1140 vs 642)。

事实上,在许多智能体和编码评估上,3.5 Flash-Lite 甚至超越 3 Flash,包括 SWE-Bench Pro(54.2% vs 49.6%)和 OSWorld-Verified(74.0% vs 65.1%),使其成为 2.5 和 3 Flash 工作负载更快且更有能力的选择。

3.5 Flash-Lite 从海量电商数据集中提取产品特性并进行合成

作为主智能体与 3.6 Flash 配合工作,3.5 Flash-Lite 即时生成 25 个独特的、可供探索的网页设计概念

3.5 Flash-Lite 凭借其多模态理解能力可扩展收据翻译和摘要

3.5 Flash-Lite 通过即时生成和迭代多个选项来构建游戏

3.5 Flash-Lite 的早期客户强调了其在扩展智能体工作流和数据处理任务方面速度、智能和成本效率的独特结合:

更多关于该模型的信息,请参阅 3.5 Flash-Lite 模型卡。

CodeMender 中的 3.5 Flash Cyber:高效发现和修复漏洞

AI 模型发现安全漏洞的速度已经超过了当前系统修复它们的速度。应对这一日益增长的威胁需要一种既有能力又高效的软件安全方法。

Flash 的性能和效率使其成为大规模检测、验证和修补代码安全问题的理想基础。Gemini 3.5 Flash Cyber 构建于 3.5 Flash 之上,经过微调专门用于以比更大模型更低的每 token 价格发现和修复网络安全漏洞。

在 CodeMender 中(使用多个 3.5 Flash Cyber 智能体协同工作以生成单个综合报告),3.5 Flash Cyber 在流行基准 CyberGym 上达到了前沿水平的竞争力。

鉴于该技术的双重用途性质,我们采取了有意的方式部署 3.5 Flash Cyber。该模型将很快通过 CodeMender 作为有限访问试点计划的一部分,专门提供给政府和可信合作伙伴。这将使一线防御者在漏洞被利用之前抢先发现和修复关键漏洞,同时减轻更广泛的滥用风险。

6 Flash 和 3.5 Flash-Lite:立即开始使用

3.6 Flash 和 3.5 Flash-Lite 从今天开始可用:

  • 所有人可通过 Gemini 应用 使用。3.5 Flash-Lite 也在 Google 搜索中推出。

当你开始使用 3.6 Flash 和 3.5 Flash-Lite 构建时,我们欢迎你的反馈以改进未来的 Gemini 模型,并期待很快发布 3.5 Pro。

ESC

输入关键词开始搜索

支持搜索标题、内容、标签