Back to Research
Gemini 3.7 Flash 评测:定价、基准与升级建议

Gemini 3.7 Flash 评测:定价、基准与升级建议

Article Information

51agentic.com
August 16, 2026
AIGemini

Gemini 3.7 Flash 评测:定价、基准与升级建议

Gemini 3.7 Flash 是 Google 面向编码、多模态理解和多步骤 Agent 工作流推出的主力 Flash 模型。它延续了 1M tokens 上下文、多模态输入、可调 thinking 强度和内置工具,并在 Google 公布的多项编程、终端、PDF 与自动化基准中超过 Gemini 3.6 Flash。

不过,这并不是一次可以无条件迁移的升级。部分图表推理成绩略有下降,发布初期的独立测试仍然有限,而且当前 API 优惠价格会在 2026 年底到期。生产团队应先用真实任务验证结构化输出、函数调用、延迟和完整交付成本。

Gemini 3.7 Flash 评测封面

核心结论

问题结论
什么时候发布?Google 于 2026 年 8 月 13 日发布,模型 ID 为 gemini-3.7-flash,已正式可用。
API 价格是多少?2026 年底前,每百万输入 0.75 美元、输出 3.75 美元;2027 年起分别调整为 1.50 美元和 7.50 美元。
相比 3.6 Flash 有何提升?厂商数据主要显示编程、长程工程、终端、PDF 分析和业务自动化能力增强。
是否所有基准都更高?不是。两项 CharXiv 图表推理结果略低,部分 Agent 测试的增幅也较小。
是否值得升级?新的编程与 Agent 工作流值得优先测试;稳定运行的 3.6 流程应先完成回归测试。

模型规格与获取方式

规格Gemini 3.7 Flash
发布时间2026 年 8 月 13 日
API 模型 IDgemini-3.7-flash
状态正式可用
上下文 / 最大输出1M / 64K tokens
输入类型文本、图像、视频、音频、PDF
输出类型文本
thinking 级别lowmedium(默认)、high
工具能力Function calling、搜索、computer use
2026 年底前价格每百万输入 $0.75、输出 $3.75
2027 年起价格每百万输入 $1.50、输出 $7.50

Gemini 3.7 Flash 可通过 Gemini API、Google AI Studio、Gemini 应用、Gemini Enterprise 和 Google Antigravity 使用,也为 Gemini Spark 提供支持。需要注意的是,模型 API、面向个人的 Gemini 应用和其他产品具有不同的界面、运行时、权限、额度与计费方式,不能直接视为同一种服务。

1M 上下文与 64K 输出并不是这一代独有的提升。真正需要评估的是模型在长上下文中能否稳定规划、调用工具、处理错误并完成相互依赖的步骤,而不只是能否容纳更多材料。

Gemini 3.7 Flash 官方发布视觉

Gemini 3.7 Flash 与 3.6 Flash 基准对比

Google 公布的数据覆盖代码质量、长程软件工程、终端操作、文档处理、自动化和图表推理。下表统一列出主要结果,但这些成绩来自模型提供方,并非独立复测。

基准Gemini 3.7 FlashGemini 3.6 Flash变化
FrontierCode 1.143.6%34.4%+9.2 个百分点
DeepSWE v1.165.3%48.6%+16.7 个百分点
Terminal-Bench 2.185.8%78.0%+7.8 个百分点
Code Arena1588 Elo1538 Elo+50 Elo
GDP.pdf34.0%22.0%+12.0 个百分点
AutomationBench30.4%17.0%+13.4 个百分点
CharXiv,无工具84.5%85.2%-0.7 个百分点
CharXiv,使用工具88.7%89.4%-0.7 个百分点
Agent's Last Exam26.3%24.2%+2.1 个百分点

编程与长程 Agent 能力

最明显的提升来自 DeepSWE v1.1、FrontierCode 1.1 和 Terminal-Bench 2.1。这组结果说明 3.7 Flash 可能更擅长仓库级修改、长时间工程任务和终端执行,也可能更容易从工具错误中恢复。

但基准提升不等于真实任务一定成功。迁移评估仍应记录测试通过情况、无关修改、格式错误的工具调用、停止原因和人工清理时间。模型输出是否漂亮,远没有补丁能否直接通过验收重要。

Web、文档与自动化

Google 表示,3.7 Flash 能更准确地遵循视觉参考和设计系统,以较少提示生成可用的 Web 布局。这类能力适合需要读取截图、实现页面、运行预览、对比结果并继续修订的工作流。

GDP.pdf 从 22.0% 提升至 34.0%,AutomationBench 从 17.0% 提升至 30.4%,也反映出模型处理高密度报告和多工具业务任务的潜力。涉及财务、权限或外部操作时,仍应保留源数据核验、最小权限和人工批准。

哪些结果仍不明确?

3.7 Flash 并非在所有测试中领先。CharXiv 的无工具和使用工具结果都比 3.6 Flash 低 0.7 个百分点;Agent's Last Exam 虽然有所提高,但增幅有限,在桌面和操作系统任务中也不一定能超过更大的前沿模型。

发布初期的数据主要来自 Google 和早期合作方。结构化输出稳定性、高并发延迟、长对话退化以及复杂工具 schema 的表现,还需要更多独立证据。现阶段更准确的定位是“值得重点测试的候选模型”,而不是所有 Flash 工作流的自动替代品。

API 定价:优惠期结束后翻倍

截至 2026 年 12 月 31 日,Gemini 3.7 Flash 每百万输入 tokens 为 0.75 美元、输出 tokens 为 3.75 美元,输出计费包含 thinking tokens。从 2027 年 1 月 1 日起,输入与输出价格将分别调整为 1.50 美元和 7.50 美元。

Gemini 3.6 Flash 在优惠期内暂时采用相同价格,之后也计划进入同一档标准价格。因此,促销期间的迁移决策更应该取决于任务可靠性,而不是标称单价。

Agent 工作流的实际成本可以用下面的方式衡量:

(模型费用 + 重试成本 + 审查时间 + 修复时间)÷ 通过验收的任务数

高 thinking 强度可能消耗更多输出 tokens,但如果能避免失败循环或一次交付可用结果,总成本反而可能更低。对于分类、提取等简单任务,high 又可能只是额外开销。实测时可以从默认的 medium 开始,在常规且对延迟敏感的任务中测试 low,只在困难推理和复杂工具调用中启用 high

实际使用价值与限制

Gemini 3.7 Flash 的优势是组合完整:正式可用、多模态输入、三档 thinking、内置工具,以及较有吸引力的短期价格。它尤其适合结果可以明确验证的工作,例如测试通过、PDF 被正确转换、浏览器到达目标状态或报告包含指定字段。

主要限制则包括:上下文容量没有扩大,独立评测仍少,优惠价格具有期限,而且 API 行为变化可能影响旧集成。模型能力提高不能抵消不兼容的请求参数、函数调用格式或停止行为。

迁移时需要检查什么?

  • 将模型 ID 更新为 gemini-3.7-flash
  • 移除已经弃用或不再兼容的采样控制。
  • 使用 thinking_level 配置推理强度。
  • 校验多轮对话中的消息顺序与角色。
  • 在需要时保留 thought signatures。
  • 检查 function-call 请求与返回负载。
  • 重新测试结构化输出、停止条件、超时和重试逻辑。
  • 分别统计模型 tokens、工具调用和完整任务成本。

谁应该升级?

优先测试 3.7 Flash暂时保留 3.6 Flash
新的仓库级编程、重复工具调用、复杂 PDF、视觉转代码和浏览器任务已有流程高度依赖稳定 schema、可预测函数调用和固定延迟
3.5 或 3.6 在长执行链、终端操作或错误恢复上表现吃力的任务尚未完成 3.7 同条件回归测试的定时任务和关键自动化
可通过测试、字段或页面状态自动验收的高吞吐流程单次失败代价高、缺乏回滚和人工复核机制的生产任务

对于关键自动化,不应直接全量切换。可以先选择少量代表性任务,以影子运行或小流量方式比较 3.6 与 3.7,再逐类迁移真正受益的工作负载。

一套可复用的 A/B 测试方法

  1. 选择边界清楚、结果可验证的任务,例如修复失败测试、分析 PDF 或生成仓库报告。
  2. 为 3.6 和 3.7 创建独立干净会话,使用相同提示词、文件、工具、权限和预算。
  3. 固定 thinking_level、超时、最大轮数与重试策略;必要时重复运行,降低偶然结果的影响。
  4. 使用自动化测试、schema 校验或验收清单判定结果,不以主观观感代替通过标准。
  5. 记录完成率、错误工具调用、重试、延迟、token 费用、无关修改和审查工作量。
  6. 按任务类型选择“每个可接受结果成本”最低的模型,而不是寻找一个覆盖所有流程的赢家。

最终结论

Gemini 3.7 Flash 是 Flash 产品线中一个重要的能力升级。编程、长程工程、终端、PDF 和自动化基准都有积极信号,多模态输入、内置工具和灵活 thinking 也让它适合作为新 Agent 工作流的起点。

它仍然需要谨慎验证:少数指标略有下降,独立测试不足,API 迁移存在兼容性要求,而且优惠价格将在 2026 年底结束。最稳妥的策略是先在同条件下比较 3.6 与 3.7,只有当 3.7 能减少重试、人工清理或每个验收任务的总成本时,再扩大迁移范围。

Related Tags

Gemini 3.7 FlashGoogle GeminiAI Agent编程模型大模型评测

More Articles

Continue with related AI tool news and reviews.