Gemini 3.7 Flash:基准测试、定价、API可用性和变化

Avatar
Lisa Ernst · 17.08.2026 · 人工智能 · 阅读时间 15 分钟

Google 于 2026 年 8 月 13 日发布了 Gemini 3.7 Flash,仅比 Gemini 3.6 Flash 晚三周。此次更新 squarely 针对编码、代理工作流、Web 开发和大量文档知识工作,Google 在多项软件工程和自动化基准测试中公布了比 3.6 Flash 显著的提升。

不同寻常的是定价:Gemini 3.7 Flash 通过标准付费 API 的价格为每百万输入 token 0.75 美元,每百万输出 token 3.75 美元,有效期至 2026 年 12 月 31 日。这些费率是暂时的,将于 2027 年 1 月 1 日翻倍。本指南将解释基准测试结果、API 可用性、模型限制、支持的工具、定价等级以及与 Gemini 3.6 Flash 的实际区别。

主要收获

Gemini 3.7 Flash 概览

规格 Gemini 3.7 Flash
发布日期 2026 年 8 月 13 日
发布阶段 普遍可用 (GA)
稳定 API 模型 ID gemini-3.7-flash
输入模式 文本、图像、视频、音频和 PDF
输出模式 文本
输入 token 限制 1,048,576 个 token
最大输出 65,536 个 token
思考级别 低、中和高;不支持最低级别
截至 2026 年 12 月 31 日的标准付费 API 价格 0.75 美元 / 100 万输入 token;3.75 美元 / 100 万输出 token

什么是 Gemini 3.7 Flash?

Gemini 3.7 Flash 是 Google Gemini 3 Flash 系列的下一代产品。Google DeepMind 表示,它基于 Gemini 3.6 Flash,并对模型的核心推理基础进行了算法改进。其定位也变得更加明确:Google 将 3.7 Flash 称为其编码和代理的主要“主力”,而不是一个仅用于最大化原始吞吐量的模型。

这种区别很重要。Flash 模型之所以传统上被选中,是因为它们比大型推理模型更快、更便宜。通过 3.7,Google 试图将更多多步工作纳入这个成本效益高的层级:代码库级别的编码、浏览器或计算机交互、函数调用、复杂文档处理以及需要多次工具调用才能完成答案的业务工作流。

如果您是前代产品的用户,Zerlo 的 Gemini 3.6 Flash 概述 提供了早期模型的发布背景。现在重要的更新是,3.7 Flash 保留了相同的百万 token 上下文窗口和广泛的工具集,同时提高了在 Google 公布的许多代理和编码评估中的性能。

与 Gemini 3.6 Flash 相比有什么变化?

领域 Gemini 3.7 Flash 变化 实际效果
编码 FrontierCode、DeepSWE 和 Terminal-bench 分数更高 在代码库工作、调试和长期编码代理方面更具优势
Web 开发 Code Arena 在 Google 模型卡上的 Elo 从 1538 升至 1588 在功能布局和功能完整的 Web 任务上公布的性能更好
企业自动化 AutomationBench 从 17.0% 升至 30.4% 在结合推理、工具和业务系统的工​​作流方面更具前景
文档推理 GDP.pdf 从 22.0% 升至 34.0% 在处理困难的 PDF 文档知识工作方面公布的结果得到改进
长上下文 GDM-MRCR v2 在 128k 上的得分从 91.8% 升至 97.0% 在该评估中,长输入文本的检索和推理能力更好
开发者行为 Google 表示,该模型能更好地适应障碍,澄清意图并更忠实地遵循指令 在多步工​​作流中可能需要更少的重试和更少的手动监督
定价 3.7 以每 100 万 token 0.75 美元(输入)/3.75 美元(输出)的临时价格启动 短期成本低于 3.6 的原始发布价格,尽管 3.6 目前也享受相同的临时价格

最后一行很容易被误解。Google 将 Gemini 3.7 Flash 描述为以低于 Gemini 3.6 Flash 原始价格一半的价格启动。然而,Google 目前的模型卡显示,在相同的临时促销下,3.6 Flash 和 3.7 Flash 的价格均为每百万 token 0.75 美元(输入)和 3.75 美元(输出)。因此,3.7 目前的标准 token 价格并不比 3.6 便宜;而是与 3.6 的原始发布定价进行比较。

Gemini 3.7 Flash 基准测试

Google 2026 年 8 月的模型卡发布了一套广泛的基准测试,涵盖软件工程、代理终端使用、企业自动化、知识工作、PDF、长上下文、计算机使用和科学推理。以下数字使用该模型卡中的值比较了 Gemini 3.7 Flash 和 Gemini 3.6 Flash。

基准测试 测量内容 Gemini 3.6 Flash Gemini 3.7 Flash
人工智能分析指数 复合模型智能 52 56
FrontierCode 1.1 主版 生产代码质量 34.4% 43.6%
DeepSWE v1.1 长时程软件工程 48.6% 65.3%
代码竞技场 Web 开发 1538 Elo 1588 Elo
Terminal-bench 2.1 智能终端编码 78.0% 85.8%
AutomationBench 企业工作流自动化 17.0% 30.4%
GDP.pdf 专家PDF理解 22.0% 34.0%
GDM-MRCR v2 (128k) 长上下文检索与推理 91.8% 97.0%
OSWorld-2.0 智能计算机使用 33.8% 47.9%
Google 内部对 Gemini 3.7 Flash 与 Gemini 3.6 Flash 及其他 AI 模型进行比较的基准测试表

来源: blog.google

Google 2026 年 8 月的评估表显示,在长时程软件工程、企业工作流自动化、文档理解和计算机使用方面,3.7 Flash 取得了尤其显著的提升。这些基准测试衡量的是不同的工作负载,不应合并为一个通用分数。

提升最显著的领域

最明显的进步体现在需要模型持续工作而非一次性回答的工作负载上。DeepSWE 从 48.6% 上升到 65.3%,而 AutomationBench 从 17.0% 上升到 30.4%。这支持了 Google 的说法,即该模型对于需要规划、调用工具、检查结果和克服障碍的代理更加有用。

在 Google 公布的数据中,文档工作也得到了显著改进。GDP.pdf 从 22.0% 上升到 34.0%,该公司特别强调了金融、法律和生物科学等知识密集型领域,期望在这些领域能有更好的推理能力。这并不意味着该模型可以取代受监管或高风险工作中的专家审查;这只是意味着在测试的任务上,基准测试结果比 3.6 Flash 有了实质性的提高。

3.7 Flash 并非在所有基准测试中都获胜

此次发布并非全胜。在不使用工具的 CharXiv 测试中,Gemini 3.7 Flash 的得分为 84.5%,而 3.6 Flash 为 85.2%;使用工具时,3.7 Flash 得分为 88.7%,3.6 Flash 为 89.4%。在 Google 的跨模型表中,GPT-5.6 Terra 在某些编码和终端评估方面仍然领先。这就是为什么应该使用基准测试表来识别有前景的工作负载,而不是宣布一个普遍的赢家。

还有一个值得注意的小的报告差异:Google 的发布文章将 Gemini 3.6 Flash 在 DeepSWE 上的结果四舍五入为 49.0%,而详细的 DeepMind 模型卡列出了 48.6%。本文在比较表中使用了更精确的模型卡值。

Google Gemini 3.7 Flash 在 DeepSWE v1.1 上的成本效益图

来源: blog.google

Google 还围绕每项已完成的软件工程任务的成本而非仅仅是每 token 的价格来构建此次发布。这才是代理的正确生产指标:重试、推理 token 和重复的工具调用可能比标称的 token 率更重要。

Gemini 3.7 Flash 定价

Gemini 3.7 Flash 有一个限时定价计划。当前的介绍性费率将持续到 2026 年 12 月 31 日。之后,Google 的定价文档将在 2027 年 1 月 1 日将 token 费率翻倍。

消费选项 2026 年 12 月 31 日之前的输入 / 100 万 token 2026 年 12 月 31 日之前的输出 / 100 万 token 2027 年 1 月 1 日之后的输入 / 输出
标准付费 $0.75 $3.75 $1.50 / $7.50
批量 $0.375 $1.875 $0.75 / $3.75
灵活 $0.375 $1.875 $0.75 / $3.75
优先 $1.35 $6.75 $2.70 / $13.50

输出定价包括思考 token。在介绍期内,标准上下文缓存每百万缓存 token 的费用为 0.075 美元,外加每百万 token 每小时 0.50 美元的缓存存储费;这些费率在 2027 年也将翻倍。Google 搜索 grounding 和 Google Maps grounding 在超出 Google 定价文档中所述的共享月度额度后可能会产生单独的费用。

标准 API 还有一个免费层,列为免费。这不应被视为保证的生产容量:速率限制取决于模型、项目、使用层级和账户状态,Google 明确表示已发布的限制不予保证。对于付费的生产工作负载,模型成本只是预算的一部分;grounding、外部 API、存储以及代理步骤失败或重复都可能改变总成本。

标准 API 成本示例

月度 token 用量 截至 2026 年 12 月 31 日的预估成本 自 2027 年 1 月 1 日起的预估成本
1000 万输入 + 200 万输出 $15.00 $30.00
5000 万输入 + 500 万输出 $56.25 $112.50
1 亿输入 + 2000 万输出 $150.00 $300.00

这些示例仅包括模型的输入和输出 token。它们不包括 grounding、缓存存储、外部服务或应用程序基础设施。

Gemini 3.7 Flash API 可用性

Gemini 3.7 Flash 并非仅是预览发布。Google Cloud 列出了 gemini-3.7-flash 作为 GA,发布日期为 2026 年 8 月 13 日,Gemini API 文档将相同的字符串标识为稳定模型版本。

用户组 Gemini 3.7 Flash 可用之处 重要细节
API 开发者 Gemini API 和 Google AI Studio 使用稳定模型 ID gemini-3.7-flash
Android 开发者 Android Studio Google 将 Android Studio 列为开发者的发布平台
代理开发者 Google Antigravity 专为代理优先编码和多步工作流而设计
企业 Gemini Enterprise Agent Platform 和 Gemini Enterprise 应用 适用企业治理、账单和区域控制
个人 Gemini 应用中的 Gemini Spark Google 表示,Spark 为 160 多个支持国家/地区的 Google AI Pro 和 Ultra 订阅用户提供 3.7 Flash 支持

对于尚未设置访问权限的开发者,Zerlo 的 Gemini API 密钥指南 涵盖了 Google AI Studio 的设置。一旦访问就绪,关键的部署更改是模型标识符;生产迁移仍应包括对工具、模式、延迟和总 token 使用量的回归测试。

开发者在笔记本电脑上处理源代码

来源: pexels.com

切换到新的模型 ID 是简单部分。更安全的迁移是在暂存环境中测试代表性的编码和代理任务,记录任务成功率、延迟、token 使用量、重试次数和工具调用次数,然后才转移生产流量。

速率限制因项目而异

没有一个适用于所有账户的 Gemini 3.7 Flash RPM 或 TPM 数字。Google 按项目而非按 API 密钥衡量每分钟请求数、每分钟 token 数和每天请求数等限制,并根据使用层级和账户状态进行调整。Google 建议直接在 AI Studio 中查看项目的活动限制。批量流量有单独的限制;例如,文档中描述的 Tier 1 批量队列允许 Gemini 3.7 Flash 入队 300 万 token。

上下文窗口、模态和支持的工具

核心 API 信封对于任何已经在使用 3.6 Flash 的人来说都很熟悉:1,048,576 token 的输入上下文和最大 65,536 token 的文本输出。该模型可以摄入文本、图像、视频、音频和 PDF 文档,但它本身不生成图像或音频。

功能 Gemini 3.7 Flash 中的状态
缓存 支持
代码执行 支持
计算机使用 预览中支持
文件搜索 支持
函数调用 支持
Google搜索接地 支持
Google地图接地 支持
结构化输出 支持
URL上下文 支持
思考级别 低、中、高
实时API 不支持
图像生成 不支持
音频生成 不支持

一个迁移陷阱是思维配置。Gemini 3.7 Flash支持低、中、高。Google Cloud文档中的企业代理平台默认使用中等设置,而显式设置最小会产生验证错误。以前使用最小设置的应用程序应将该行为映射到受支持的级别,并重新测量延迟和输出质量。

办公室职员在笔记本电脑旁审阅文件

来源: pexels.com

Gemini 3.7 Flash改进了Google发布的PDF和知识工作成果,这与文档密集型工作流程相关。更大的基准分数并不能消除幻觉风险,因此重要的提取事实和关键决策仍需要验证。

这些变化在实践中的意义

对于编码代理

当应用程序执行长时程编码而非孤立的代码片段时,Gemini 3.7 Flash的升级故事最为强劲。DeepSWE、FrontierCode和Terminal-bench的收益都指向同一个方向:该模型能够更好地完成多步工程任务。Google还表示,它在适应障碍和澄清意图方面更加严谨,当代理有权编辑文件或反复调用工具时,这一点可能很重要。

对于文档和知识工作流程

百万token上下文窗口保持不变,但在发布评估中,处理密集材料的质量似乎有所提高。这使得3.7 Flash成为年度报告、法律文件管道、科学文献、内部知识库和混合PDF工作流程的更强候选者。然而,巨大的上下文窗口并不等于完美的检索;检索系统、文件搜索和提示分段在每次请求时发送所有内容仍然可能更可靠且成本更低。

对于Web开发

Google强调了更强的首次代码准确性、更实用的布局以及更少的提示即可实现功能完整的应用程序。Code Arena的1588 Elo分数是最清晰的公开指标。团队仍应在自己的代码库中评估设计遵循度、浏览器行为、可访问性和框架特定约定,因为综合Web基准无法代表每个前端堆栈。

对于高流量简单任务

不要假设3.7 Flash应该取代所有更便宜的模型。如果工作负载是分类、提取或模板化转换,并且具有非常高的流量,那么Flash-Lite模型在成本和吞吐量方面可能仍然占优。3.7 Flash的目的是将更强的推理和代理性能推入Flash层,而不是成为每个请求的最低成本选项。

是否应该从Gemini 3.6 Flash迁移?

工作负载 推荐方向 原因
存储库级别的编码代理 大力测试3.7 Flash DeepSWE和FrontierCode上发布的大幅收益
业务流程自动化 测试3.7 Flash AutomationBench从17.0%提高到30.4%
PDF和文档分析 测试3.7 Flash 更高的GDP.pdf和长上下文结果
现有的稳定3.6 Flash管道 切换前进行基准测试 当前的入门级token费率相同,因此质量、延迟和任务成本应该决定
高流量简单提取 与Flash-Lite进行比较 更轻量级的模型可能仍然具有更好的吞吐量/成本配置文件
实时语音应用 使用支持实时API的模型 Gemini 3.7 Flash不支持实时API
图像或音频生成 使用其他模型 3.7 Flash生成文本输出,而不是生成的图像或音频

Gemini 3.7 Flash迁移清单

  1. 首先在暂存环境中将目标模型更改为gemini-3.7-flash
  2. 检查思维配置。不要发送minimal;选择低、中或高。
  3. 重新运行函数调用测试、结构化输出验证和工具权限检查。
  4. 使用与生产中相同的代表性文档测试长上下文和PDF工作流程。
  5. 测量成功的任务完成率、延迟、输入token数、输出和思维token数、重试次数、轮次和工具调用数。
  6. 在比较每个任务的总成本时,包括接地和缓存费用。
  7. 逐步推出,并保持一个经过测试的回滚路径到现有的生产模型。

需要注意的限制

Google DeepMind的模型卡列出了基础模型的标准限制,包括幻觉,并指出偶尔的缓慢或超时问题可能会发生。它将Gemini 3.7 Flash的知识截止日期定为2026年3月,同时警告某些领域可能有效限制在2025年1月。因此,当新鲜度很重要时,当前信息仍然需要接地或从最新来源检索。

计算机使用被标记为预览版,因此应用程序应限制权限、验证操作并为关键步骤保留人工确认。该模型还缺乏实时API、图像生成和音频生成。最后,吸引人的初始定价明确是暂时的;2027年有实质性使用量的应用程序应根据促销后费率进行预算,而不是假设2026年8月的价格会持续。Gemini与Claude技术比较提供附加上下文。由于模型迭代和价格变动迅速,请使用最新的供应商文档进行采购决策,并对您计划部署的确切模型进行基准测试。

常见问题

Gemini 3.7 Flash是什么时候发布的?

Google于2026年8月13日宣布并发布了Gemini 3.7 Flash。Google Cloud将稳定模型列为通用可用,而不是仅限预览。

Gemini 3.7 Flash的API模型名称是什么?

稳定模型标识符是gemini-3.7-flash。Google在其Gemini API模型文档和企业模型文档中列出了此确切ID。

Gemini 3.7 Flash的成本是多少?

截至2026年12月31日,标准付费API使用费为每百万输入token 0.75美元,每百万输出token 3.75美元,包括思维token。从2027年1月1日起,费率将分别提高到1.50美元和7.50美元。批量、Flex和Priority有单独的费率。

Gemini 3.7 Flash比Gemini 3.6 Flash便宜吗?

在当前的入门级token费率下不是。Google的2026年8月模型卡列出了Gemini 3.6 Flash和Gemini 3.7 Flash在2026年12月31日前的费率为每百万输入token 0.75美元,每百万输出token 3.75美元。Google的“成本减半”的发布措辞是将3.7与原始3.6 Flash的发布价格进行比较。

Gemini 3.7 Flash是否可在API中使用?

是的。它可通过Gemini API和Google AI Studio使用,稳定模型ID为gemini-3.7-flash。Google还通过Antigravity和企业Gemini产品提供。

Gemini 3.7 Flash的上下文窗口是多少?

输入token限制为1,048,576个token,最大输出为65,536个token。输入可以包括文本、图像、视频、音频和PDF文档;输出是文本。

Gemini 3.7 Flash 是否支持 Live API?

否。Google 的模型文档将 Live API 标记为不支持。需要原生实时语音交互的应用应选择与 Live API 兼容的模型。

Gemini 3.7 Flash 比 Gemini 3.6 Flash 更好吗?

Google 公布的评估显示,在多项编码、自动化、PDF、长上下文和计算机使用基准测试中有了显著的改进,但并非所有基准测试都有所提升。实际答案取决于工作负载、延迟目标、工具行为和每次成功任务的成本,因此生产团队应运行自己的代表性评估。

总而言之

Gemini 3.7 Flash 对于 Flash 系列中对开发人员最重要的部分来说是一次有意义的升级:多步编码、代理、自动化和文档密集型工作流。Google 最强的已发布改进并非微小的排行榜推动;DeepSWE 从 48.6% 上升到 65.3%,AutomationBench 从 17.0% 上升到 30.4%,GDP.pdf 从 22.0% 上升到 34.0%,同时模型保持相同的百万 token 上下文窗口和广泛的 Gemini 工具支持。

定价方面同样重要。标准 API 使用暂时为每百万输入 token 0.75 美元,每百万输出 token 3.75 美元,但这些费率将于 2027 年 1 月 1 日翻倍。因此,对于已经使用 Gemini 3.6 Flash 的团队来说,迁移的最佳理由是相同的当前入门 token 费率下更好的任务性能,而不是永久降价。请在实际工作负载上测试 3.7 Flash,包括工具和重试成本,并根据成功任务的成本和可靠性做出迁移决策,而不是仅凭模型名称。

分享我们的文章!
来源