Gemini 3.7 Flash 评测:定价、基准与升级建议
Gemini 3.7 Flash 是 Google 面向编码、多模态理解和多步骤 Agent 工作流推出的主力 Flash 模型。它延续了 1M tokens 上下文、多模态输入、可调 thinking 强度和内置工具,并在 Google 公布的多项编程、终端、PDF 与自动化基准中超过 Gemini 3.6 Flash。
不过,这并不是一次可以无条件迁移的升级。部分图表推理成绩略有下降,发布初期的独立测试仍然有限,而且当前 API 优惠价格会在 2026 年底到期。生产团队应先用真实任务验证结构化输出、函数调用、延迟和完整交付成本。

核心结论
| 问题 | 结论 |
|---|---|
| 什么时候发布? | Google 于 2026 年 8 月 13 日发布,模型 ID 为 gemini-3.7-flash,已正式可用。 |
| API 价格是多少? | 2026 年底前,每百万输入 0.75 美元、输出 3.75 美元;2027 年起分别调整为 1.50 美元和 7.50 美元。 |
| 相比 3.6 Flash 有何提升? | 厂商数据主要显示编程、长程工程、终端、PDF 分析和业务自动化能力增强。 |
| 是否所有基准都更高? | 不是。两项 CharXiv 图表推理结果略低,部分 Agent 测试的增幅也较小。 |
| 是否值得升级? | 新的编程与 Agent 工作流值得优先测试;稳定运行的 3.6 流程应先完成回归测试。 |
模型规格与获取方式
| 规格 | Gemini 3.7 Flash |
|---|---|
| 发布时间 | 2026 年 8 月 13 日 |
| API 模型 ID | gemini-3.7-flash |
| 状态 | 正式可用 |
| 上下文 / 最大输出 | 1M / 64K tokens |
| 输入类型 | 文本、图像、视频、音频、PDF |
| 输出类型 | 文本 |
| thinking 级别 | low、medium(默认)、high |
| 工具能力 | Function calling、搜索、computer use |
| 2026 年底前价格 | 每百万输入 $0.75、输出 $3.75 |
| 2027 年起价格 | 每百万输入 $1.50、输出 $7.50 |
Gemini 3.7 Flash 可通过 Gemini API、Google AI Studio、Gemini 应用、Gemini Enterprise 和 Google Antigravity 使用,也为 Gemini Spark 提供支持。需要注意的是,模型 API、面向个人的 Gemini 应用和其他产品具有不同的界面、运行时、权限、额度与计费方式,不能直接视为同一种服务。
1M 上下文与 64K 输出并不是这一代独有的提升。真正需要评估的是模型在长上下文中能否稳定规划、调用工具、处理错误并完成相互依赖的步骤,而不只是能否容纳更多材料。

Gemini 3.7 Flash 与 3.6 Flash 基准对比
Google 公布的数据覆盖代码质量、长程软件工程、终端操作、文档处理、自动化和图表推理。下表统一列出主要结果,但这些成绩来自模型提供方,并非独立复测。
| 基准 | Gemini 3.7 Flash | Gemini 3.6 Flash | 变化 |
|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | +9.2 个百分点 |
| DeepSWE v1.1 | 65.3% | 48.6% | +16.7 个百分点 |
| Terminal-Bench 2.1 | 85.8% | 78.0% | +7.8 个百分点 |
| Code Arena | 1588 Elo | 1538 Elo | +50 Elo |
| GDP.pdf | 34.0% | 22.0% | +12.0 个百分点 |
| AutomationBench | 30.4% | 17.0% | +13.4 个百分点 |
| CharXiv,无工具 | 84.5% | 85.2% | -0.7 个百分点 |
| CharXiv,使用工具 | 88.7% | 89.4% | -0.7 个百分点 |
| Agent's Last Exam | 26.3% | 24.2% | +2.1 个百分点 |
编程与长程 Agent 能力
最明显的提升来自 DeepSWE v1.1、FrontierCode 1.1 和 Terminal-Bench 2.1。这组结果说明 3.7 Flash 可能更擅长仓库级修改、长时间工程任务和终端执行,也可能更容易从工具错误中恢复。
但基准提升不等于真实任务一定成功。迁移评估仍应记录测试通过情况、无关修改、格式错误的工具调用、停止原因和人工清理时间。模型输出是否漂亮,远没有补丁能否直接通过验收重要。
Web、文档与自动化
Google 表示,3.7 Flash 能更准确地遵循视觉参考和设计系统,以较少提示生成可用的 Web 布局。这类能力适合需要读取截图、实现页面、运行预览、对比结果并继续修订的工作流。
GDP.pdf 从 22.0% 提升至 34.0%,AutomationBench 从 17.0% 提升至 30.4%,也反映出模型处理高密度报告和多工具业务任务的潜力。涉及财务、权限或外部操作时,仍应保留源数据核验、最小权限和人工批准。
哪些结果仍不明确?
3.7 Flash 并非在所有测试中领先。CharXiv 的无工具和使用工具结果都比 3.6 Flash 低 0.7 个百分点;Agent's Last Exam 虽然有所提高,但增幅有限,在桌面和操作系统任务中也不一定能超过更大的前沿模型。
发布初期的数据主要来自 Google 和早期合作方。结构化输出稳定性、高并发延迟、长对话退化以及复杂工具 schema 的表现,还需要更多独立证据。现阶段更准确的定位是“值得重点测试的候选模型”,而不是所有 Flash 工作流的自动替代品。
API 定价:优惠期结束后翻倍
截至 2026 年 12 月 31 日,Gemini 3.7 Flash 每百万输入 tokens 为 0.75 美元、输出 tokens 为 3.75 美元,输出计费包含 thinking tokens。从 2027 年 1 月 1 日起,输入与输出价格将分别调整为 1.50 美元和 7.50 美元。
Gemini 3.6 Flash 在优惠期内暂时采用相同价格,之后也计划进入同一档标准价格。因此,促销期间的迁移决策更应该取决于任务可靠性,而不是标称单价。
Agent 工作流的实际成本可以用下面的方式衡量:
(模型费用 + 重试成本 + 审查时间 + 修复时间)÷ 通过验收的任务数
高 thinking 强度可能消耗更多输出 tokens,但如果能避免失败循环或一次交付可用结果,总成本反而可能更低。对于分类、提取等简单任务,high 又可能只是额外开销。实测时可以从默认的 medium 开始,在常规且对延迟敏感的任务中测试 low,只在困难推理和复杂工具调用中启用 high。
实际使用价值与限制
Gemini 3.7 Flash 的优势是组合完整:正式可用、多模态输入、三档 thinking、内置工具,以及较有吸引力的短期价格。它尤其适合结果可以明确验证的工作,例如测试通过、PDF 被正确转换、浏览器到达目标状态或报告包含指定字段。
主要限制则包括:上下文容量没有扩大,独立评测仍少,优惠价格具有期限,而且 API 行为变化可能影响旧集成。模型能力提高不能抵消不兼容的请求参数、函数调用格式或停止行为。
迁移时需要检查什么?
- 将模型 ID 更新为
gemini-3.7-flash。 - 移除已经弃用或不再兼容的采样控制。
- 使用
thinking_level配置推理强度。 - 校验多轮对话中的消息顺序与角色。
- 在需要时保留 thought signatures。
- 检查 function-call 请求与返回负载。
- 重新测试结构化输出、停止条件、超时和重试逻辑。
- 分别统计模型 tokens、工具调用和完整任务成本。
谁应该升级?
| 优先测试 3.7 Flash | 暂时保留 3.6 Flash |
|---|---|
| 新的仓库级编程、重复工具调用、复杂 PDF、视觉转代码和浏览器任务 | 已有流程高度依赖稳定 schema、可预测函数调用和固定延迟 |
| 3.5 或 3.6 在长执行链、终端操作或错误恢复上表现吃力的任务 | 尚未完成 3.7 同条件回归测试的定时任务和关键自动化 |
| 可通过测试、字段或页面状态自动验收的高吞吐流程 | 单次失败代价高、缺乏回滚和人工复核机制的生产任务 |
对于关键自动化,不应直接全量切换。可以先选择少量代表性任务,以影子运行或小流量方式比较 3.6 与 3.7,再逐类迁移真正受益的工作负载。
一套可复用的 A/B 测试方法
- 选择边界清楚、结果可验证的任务,例如修复失败测试、分析 PDF 或生成仓库报告。
- 为 3.6 和 3.7 创建独立干净会话,使用相同提示词、文件、工具、权限和预算。
- 固定
thinking_level、超时、最大轮数与重试策略;必要时重复运行,降低偶然结果的影响。 - 使用自动化测试、schema 校验或验收清单判定结果,不以主观观感代替通过标准。
- 记录完成率、错误工具调用、重试、延迟、token 费用、无关修改和审查工作量。
- 按任务类型选择“每个可接受结果成本”最低的模型,而不是寻找一个覆盖所有流程的赢家。
最终结论
Gemini 3.7 Flash 是 Flash 产品线中一个重要的能力升级。编程、长程工程、终端、PDF 和自动化基准都有积极信号,多模态输入、内置工具和灵活 thinking 也让它适合作为新 Agent 工作流的起点。
它仍然需要谨慎验证:少数指标略有下降,独立测试不足,API 迁移存在兼容性要求,而且优惠价格将在 2026 年底结束。最稳妥的策略是先在同条件下比较 3.6 与 3.7,只有当 3.7 能减少重试、人工清理或每个验收任务的总成本时,再扩大迁移范围。


