Gemini 3.7 Flash vs 3.1 Pro:编程、速度与价格对比
Gemini 3.7 Flash 与 Gemini 3.1 Pro 拥有相同的约 1M tokens 输入窗口和 64K 输出上限,也都支持多模态输入、代码执行、函数调用、结构化输出和搜索增强。真正影响开发体验的差异,不是上下文容量,而是速度、价格、Stable 与 Preview 状态,以及工具接口。
对于新的编程和 Agent 工作流,Gemini 3.7 Flash 是更合理的默认起点:它正式可用、价格更低,早期第三方测量显示输出速度约为 3.1 Pro 的三倍。Gemini 3.1 Pro 仍适合保留为对照模型,尤其是已经围绕其 custom-tools endpoint 完成调优的系统。

核心结论
| 问题 | 结论 |
|---|---|
| 大多数开发者该选哪个? | 新工作流优先使用 Gemini 3.7 Flash,它在状态、价格、速度和编程能力之间更均衡。 |
| 3.7 Flash 一定更适合编程吗? | 多数短反馈循环、Web 开发和工具驱动任务值得优先测试 3.7,但仍需在真实仓库中验证。 |
| 3.1 Pro 何时仍有价值? | 已有流程围绕它调优、内部困难任务测试仍领先,或依赖专用 custom-tools endpoint 时。 |
| 上下文窗口有差异吗? | 基本没有。两者均支持 1,048,576 输入 tokens 和 65,536 输出 tokens。 |
| 最大实际差异是什么? | 3.7 Flash 是 Stable、价格更低且约快三倍;3.1 Pro 是 Preview,但有专用工具端点。 |
规格与定位对比
| 对比项 | Gemini 3.7 Flash | Gemini 3.1 Pro Preview |
|---|---|---|
| API 状态 | Stable,2026 年 8 月 13 日发布 | Preview,2026 年 2 月 19 日发布 |
| 输入 / 输出上限 | 1,048,576 / 65,536 tokens | 1,048,576 / 65,536 tokens |
| 2026 年 API 价格 | 每百万输入 $0.75、输出 $3.75 | 低于或等于 200K 输入时为 $2 / $12 |
| 后续或长上下文价格 | 2027 年起为 $1.50 / $7.50 | 超过 200K 输入时为 $4 / $18 |
| 早期独立输出速度 | 约 340 tokens/秒 | 约 112 tokens/秒 |
| 工具差异 | 文件搜索;computer use 处于 Preview | 为 bash 与 custom tools 提供专用 endpoint |
| 推荐起点 | 日常编程、Web 开发、生产 Agent、高吞吐任务 | 已验证的 custom-tools 流程与困难推理对照 |
速度数据来自早期第三方测量,不代表所有提供商、区域、提示长度和负载下的固定性能。但在 Agent 需要连续读取文件、修改代码、运行测试、分析失败并重试时,每一步延迟都会累积,三倍左右的输出速度差异会显著影响整条任务链。
编程表现:不能直接拼接不同基准

Google 公布的 Gemini 3.7 Flash 数据显示,它相较 3.6 Flash 在多项编程与 Agent 指标上提升:
| 评测 | Gemini 3.7 Flash | Gemini 3.6 Flash | 变化 |
|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% | +9.2 个百分点 |
| DeepSWE v1.1 | 65.3% | 49.0% | +16.3 个百分点 |
| Terminal-Bench 2.1 | 85.8% | 78.0% | +7.8 个百分点 |
| WebDev Arena | 1588 Elo | 1538 Elo | +50 Elo |
这组结果说明 3.7 Flash 在生产代码、长周期工程、终端执行和 Web 开发上有明显的代际进步。对于编辑、测试和调试组成的循环,更高速度和较低单价还允许 Agent 在相同时间与预算内运行更多验证步骤。
Gemini 3.1 Pro 也有不错的公开成绩,包括 SWE-Bench Verified 80.6% 和 Terminal-Bench 2.0 68.5%。但这些是 2026 年 2 月的结果,与 3.7 Flash 采用的基准版本、环境和 Agent 框架并不完全一致。把 Terminal-Bench 2.1 的 85.8% 与 Terminal-Bench 2.0 的 68.5% 直接比较,会夸大数据的证明力。
一项较新的独立评测提供了更可比的方向性信号:3.7 Flash 的综合智能指数为 56,3.1 Pro 为 48;同时 3.7 的输出速度约为 340 tokens/秒,3.1 Pro 约为 112 tokens/秒。这支持优先评估 3.7 Flash,但不能证明它在每种语言、代码库和工具配置中都必然领先。
真实编程工作中的差异
日常修改、调试与前端生成
以下短反馈任务适合先使用 3.7 Flash:
- 修复失败测试或追踪 bug。
- 实现边界清晰的小功能。
- 审查 pull request 和定位风险。
- 把截图或设计参考转换成可运行页面。
- 在浏览器、终端和编辑器之间连续迭代。
其 WebDev Arena 表现和更低延迟,使它更适合需要频繁查看结果并继续修正的前端任务。不过,生成页面仍要检查可访问性、响应式布局、框架规范和视觉一致性,不能只看首屏截图。

大型代码仓库与长周期 Agent
两款模型都有 1M 输入窗口,但大窗口不等于完美召回。仓库级任务的成功更依赖 Agent 是否能够:
- 选择真正相关的文件,而不是无差别加载上下文。
- 在多步操作中维持架构、产品和权限约束。
- 稳定调用搜索、终端和测试工具。
- 修改代码后继续验证,而不是生成补丁后立即停止。
当任务包含大量“规划、执行、检查”循环时,3.7 Flash 的速度和价格更有优势。只有当 3.1 Pro 在某类架构迁移、困难推理或内部代码库中持续产出更好的已验证结果时,才有必要保留对应路由。
Custom Tools 与旧工作流
Google 提供了 gemini-3.1-pro-preview-customtools endpoint,重点支持 bash 和自定义工具,例如仓库搜索与文件检查。如果现有 Agent 框架已围绕该端点优化,并且工具调用格式、错误恢复和停止行为都很稳定,就不应只改模型名称后直接上线。
迁移前应固定系统提示、权限、文件、验收测试和重试策略,在两个模型上运行相同任务。对生产系统而言,已经稳定的工具契约可能比公开排行榜上的小幅领先更有价值。
API 价格对比
| 计费场景 | 输入 / 1M | 输出 / 1M |
|---|---|---|
| Gemini 3.7 Flash,至 2026 年 12 月 31 日 | $0.75 | $3.75 |
| Gemini 3.7 Flash,自 2027 年 1 月 1 日 | $1.50 | $7.50 |
| Gemini 3.1 Pro,不超过 200K 输入 | $2.00 | $12.00 |
| Gemini 3.1 Pro,超过 200K 输入 | $4.00 | $18.00 |
在 3.7 Flash 优惠期内,相比 3.1 Pro 的低上下文档位,其输入成本低 62.5%,输出成本低 68.75%。即使 2027 年价格按计划上涨,如果 3.1 Pro 费率不变,3.7 Flash 的输入和输出仍分别低 25% 与 37.5%。
Agent 的真实成本不能只看 token 单价。应采用下面的完整口径:
每个验收结果成本 = 模型费用 + 工具调用 + 重试 + 审查与修复时间
3.7 Flash 的低价格允许更多测试和纠错轮次;如果 3.1 Pro 能在特定困难任务中一次完成,而 3.7 需要多次重试,它仍可能具备更低的最终交付成本。
相同上下文,不同 API 交付方式
两款模型都支持多模态输入、代码执行、function calling、structured output、search grounding、URL context 和 thinking。主要差异如下:
Gemini 3.7 Flash
- API 状态为 Stable,模型生命周期的不确定性相对较低。
- 支持
low、medium、highthinking levels。 - 支持文件搜索。
- computer use 仍处于 Preview。
Gemini 3.1 Pro
- API 状态为 Preview,生产部署需要更明确的版本监控和回退方案。
- 文件搜索仅在 AI Studio 中提供。
- 提供面向成熟 bash 与工具框架的 custom-tools endpoint。
Stable 不代表不需要监控。无论选择哪个模型,都应记录模型 ID、停止原因、工具负载、tokens、错误与回退路径,并在版本或端点变化时重新执行回归测试。
应该选择哪个模型?
优先选择 Gemini 3.7 Flash,如果工作负载是日常编程、调试、前端开发、高吞吐 Agent,或者延迟和 token 成本会限制测试轮数。它也是新生产流程更稳妥的默认起点。
继续测试 Gemini 3.1 Pro,如果现有系统已经围绕 custom-tools endpoint 完成调优,它在内部高难度任务中持续领先,或者迁移工具协议的风险高于模型本身带来的收益。
按工作负载路由,如果两者分别在不同任务中胜出。常规任务交给速度更快、价格更低的 3.7 Flash,把 3.1 Pro 留给经过验证的工具流程或少数困难任务,比全局使用一个模型更合理。
一套可复用的仓库级对照测试
- 选择 10 到 30 个真实任务,覆盖修复、功能实现、前端生成、仓库搜索和长周期修改。
- 固定系统提示、文件、权限、工具、thinking level、重试策略、超时和 token 预算。
- 为每个模型使用干净会话,保存完整 action trace,而不只是最终回答。
- 运行相同自动化测试、静态检查和人工验收清单。
- 记录补丁正确性、测试通过率、无关改动、重试、总耗时、tokens 和人工审查时间。
- 按任务类型比较“每个验收结果成本”,再配置默认模型、特殊路由和回退条件。
最终结论
新的编程和 Agent 工作流应先从 Gemini 3.7 Flash 开始。它与 3.1 Pro 具有相同的上下文和输出容量,但 API 状态更成熟、速度更快、价格更低,也展示出很强的编程与工具执行信号。
Gemini 3.1 Pro 不需要立即退出所有系统。对于已经验证的 custom-tools 工作流,或少数内部高难度任务,它仍值得作为对照和专用路由。只有当同一套仓库级验收测试显示出可衡量优势时,才应继续为它保留生产流量。


