Gemini 3.7 Flash API 接入指南:$0.75 的价格,和 minimal 档被删掉的坑
Gemini 3.7 Flash 输入 $0.75 / 输出 $3.75,和 3.6 Flash 现在完全同价。thinking 只剩 low/medium/high 三档,3.6 上能用的 minimal 传过去会报错。定价口径、接入代码、官方评测强弱项与选型对照。
Gemini 3.7 Flash 在 2026-08-13 上线,输入 $0.75、输出 $3.75(每百万 token)。 这个价有两个附加条件:它写死到 2026-12-31,之后翻倍;而且 Gemini 3.6 Flash 现在挂着一模一样的价。
真正会让迁移代码挂掉的是另一件事。thinking 档位从四个变成三个,minimal 被拿掉了,官方规格页在那一行下面加了一句 Note: minimal is not supported and returns an error.
最后更新 2026-08-21。$0.75 / $3.75 是限时价,2026-12-31 之后翻倍,跨年做预算前请重新核一遍。
Gemini 3.7 Flash 的 API 多少钱?
Google 定价页把两个日期塞进了同一个格子里,所以照抄单价很容易抄到错的那一行。
| 档位 | 输入 / 百万 token | 输出 / 百万 token | 生效期 |
|---|---|---|---|
| Standard | $0.75 | $3.75 | 至 2026-12-31 |
| Standard | $1.50 | $7.50 | 2027-01-01 起 |
| Batch / Flex | $0.375 | $1.875 | 至 2026-12-31 |
| Batch / Flex | $0.75 | $3.75 | 2027-01-01 起 |
缓存读取 $0.075,缓存存储 $0.50 每百万 token 每小时(2027 年起翻倍为 $0.15 和 $1.00)。输出价里已经含了思考 token,官方原话是 response pricing is the sum of output tokens and thinking tokens——也就是说你为 thinking_level: high 多消耗的那部分推理,是按输出价结账的。
发布当天 Google for Developers 的说法是「3.6 Flash 每百万 token 原价的一半」。这句话本身没错,但那个「原价」是 3.6 Flash 在 2026-07-21 上线时的 $1.50 / $7.50,而在 3.7 发布的同一天,3.6 Flash 也降到了 $0.75 / $3.75。现在官方定价页上两个模型的每一格逐字相同。换代这件事本身既不加钱也不省钱,省的是限时。
Gemini 3.7 Flash 的 ofox 模型页上还有几项官方定价页不单列的费率:音频输入 $0.75、缓存写入 $0.0415、一小时期限的缓存写入 $0.50、联网搜索 $0.014 每次请求。
Gemini 3.7 Flash 怎么接入?
两条路,代码差别只在 base URL 和模型名。
走 ofox 的 OpenAI 兼容端点:
from openai import OpenAI
client = OpenAI(
api_key="sk-...",
base_url="https://api.ofox.io/v1",
)
r = client.chat.completions.create(
model="google/gemini-3.7-flash",
reasoning_effort="low",
messages=[{"role": "user", "content": "把这段 SQL 改写成窗口函数版本"}],
)
print(r.choices[0].message.content)
直连 Google 的 OpenAI 兼容层,模型名去掉 google/ 前缀:
client = OpenAI(
api_key="AIza...",
base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)
r = client.chat.completions.create(
model="gemini-3.7-flash",
reasoning_effort="low",
messages=[...],
)
用 Gemini 原生协议的话,控制推理的参数名不是 reasoning_effort 而是 thinking_level,接受 low / medium / high,不传时默认 medium。ofox 侧两种协议都开着,模型页列的是 OpenAI(/v1/chat/completions)和 Gemini 两条,上游走 Google 与 Cloud Vertex 两个供应商。
能力清单直接抄官方规格页,省得试:函数调用、结构化输出、上下文缓存、代码执行、搜索接地、URL context、文件搜索、Google Maps 接地都支持,Computer use 标的是 Preview;Batch API、Flex inference、Priority inference 三种消费模式都开。不支持的是 Live API、图像生成和音频生成——输入吃文本、图像、视频、音频、PDF,输出只有文本。
从 3.6 Flash 迁过来要改什么?
改模型 ID 之外,有三处会真的咬人。
第一处是 minimal 档没了。 官方规格页 Thinking 那一行写的是 Supported (low, medium, high),紧跟着一句 Note: minimal is not supported and returns an error. 3.6 Flash 是接受 minimal 的,所以任何把这个值写死在配置里的调用,换成 3.7 之后会拿到报错而不是静默降级。
这里有个口径需要你自己确认一次:Google 的 OpenAI 兼容层文档里有一张 reasoning_effort 到 thinking level 的映射表,那张表列的是 Gemini 3.1 Pro、3.1 Flash-Lite、Gemini 3 Flash 和 2.5 几列,没有单独的 3.7 Flash 列。规格页说 3.7 不收 minimal,映射表又把 OpenAI 侧的 minimal 往下映射,两页对不齐。上线前拿一个最短的 prompt 探一次 reasoning_effort="minimal",看回的是 200 还是 400,比读文档快。这类「参数校验到底发生在模型侧还是路由侧」的坑不是 Gemini 独有,GLM 5.3 那边同一个参数在两条路由上给出过相反答案。
第二处是默认档。 原生协议不传 thinking_level 的默认值是 medium。如果你原来的负载是靠 minimal 压成本的,删掉这个参数等于跳到 medium,账单会涨,而且涨的部分按输出价计。
第三处是输出上限。 输入 1,048,576 token,输出只有 65,536。1M 的窗口很容易让人以为可以一次性吐出等体量的内容,长文档重写、整仓代码生成这类任务还是要自己切片。
Gemini 3.7 Flash 强在哪、弱在哪?
Google 模型卡里给了一张同价位对照表,把 3.7 Flash 和 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2 摆在一起。挑其中差距明显的几项:
| 评测 | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| AA Intelligence Index | 56 | 52 | 55 | 57 |
| FrontierCode 1.1 | 43.6% | 34.4% | 42.7% | 41.3% |
| Code Arena Web | 1588 | 1538 | 1541 | 1523 |
| AutomationBench | 30.4% | 17.0% | 10.7% | 23.6% |
| GDM-MRCR v2(128k) | 97.0% | 91.8% | 81.5% | 93.5% |
| LVBench | 85.4% | 84.2% | 68.5% | 78.9% |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% |
| Terminal-bench 3.0 | 14.9% | 5.4% | 14.6% | 20.8% |
| DeepSWE v1.1 | 65.3% | 48.6% | 53.8% | 69.6% |
| GDPVal-AA v2 | 1525 | 1422 | 1598 | 1578 |
| Agent’s Last Exam | 26.3% | 24.2% | 33.3% | 28.0% |
| CharXiv(无工具) | 84.5% | 85.2% | 77.0% | 85.9% |
强项集中在三块:长上下文检索(MRCR 128k 拿到 97.0%,是这张表里唯一上 95 的)、视频与前端代码(LVBench 85.4%、Code Arena Web 1588 都是第一)、以及 GUI/浏览器自动化(AutomationBench 30.4%,接近 Sonnet 5 的三倍)。
弱项也集中在要跑很久的活上:Terminal-bench 两个版本都落在 GPT-5.6 Terra 后面,2.1 是 85.8% 对 87.4%,3.0 是 14.9% 对 20.8%;DeepSWE v1.1 同样落后;GDPVal-AA v2 那类模拟真实经济产出的任务是全表最低的 1525。Agent’s Last Exam 26.3% 也明显不如 Sonnet 5。让它做流程里的一步没问题,交给它无人值守跑八小时就不合适。
有一项值得单独拎出来:CharXiv 是整张表里唯一比自家上一代退步的指标,无工具 84.5% 对 3.6 的 85.2%,带工具 88.7% 对 89.4%。图表密集的多模态负载,换代之前先用自己的样本比一遍。
还有一点得说破:Terminal-bench 这两行都是厂商自己跑的。模型卡给 2.1 报的是 85.8%,而公开的 Terminal-Bench 2.1 榜榜首只有 83.8% ± 1.2%——我们拉的时候榜上一共 17 条验证过的提交,没有一条是 3.7 Flash。自报分数越过了验证榜的第一名,这张表里最该当成「主张」而不是「结果」读的就是这个数。
另外一条不在模型卡里的数据:Artificial Analysis 在 high 档、直连 Google API 实测的首个 token 延迟是 14.52 秒,被它自己标注为高于同价位推理模型的平均(中位 2.80 秒);输出速度 389.5 token/秒,这一项是全站第一。一个叫 Flash 的模型首字要等十几秒,这个反差在交互式产品里是要命的,批处理里则完全无所谓。
什么场景该选 Gemini 3.7 Flash?
| 你的场景 | 建议 | 依据 |
|---|---|---|
| 128k 以上的文档检索、RAG 召回 | 选 | MRCR v2 97.0%,同表最高 |
| 视频理解、长视频问答 | 选 | LVBench 85.4%,领先 Sonnet 5 近 17 个点 |
| 前端 / Web 代码生成 | 选 | Code Arena Web 1588 第一 |
| 浏览器与 GUI 自动化 | 选 | AutomationBench 30.4%,Sonnet 5 只有 10.7% |
| 多步终端任务、长跑 agent | 谨慎 | Terminal-bench 3.0 仅 14.9% |
| 低延迟对话、语音前端 | 换模型 | AA 实测 TTFT 14.52 秒(high 档),且不支持 Live API |
| 图表密集的多模态分析 | 先自测 | CharXiv 是唯一比 3.6 退步的项 |
| 一次要吐 10 万 token 以上 | 要分片 | 输出上限 65,536 |
如果你的场景不在这张表里,ofox 的模型选型工具按任务类型(编程、agent、RAG 长文档、视觉、抽取、翻译等)把 100+ 模型按质量、成本、速度排一遍,价格和上下文长度是实时拉的,不用注册也不用 API Key。
性能相当的是哪几个模型?
按 Google 模型卡引用的 AA Intelligence Index,56 分这一档挤着四个模型,分差在三分以内,价格却差了三倍多。
| 模型 | AA Index | 输入 / 百万 | 输出 / 百万 |
|---|---|---|---|
| GPT-5.6 Terra | 57 | $2.00 | $12.00 |
| Muse Spark 1.2 | 57 | $1.25 | $4.25 |
| Gemini 3.7 Flash | 56 | $0.75 | $3.75 |
| Claude Sonnet 5 | 55 | $2.00 | $10.00 |
| Gemini 3.6 Flash | 52 | $0.75 | $3.75 |
在这一档里 3.7 Flash 是最便宜的,输出价只有 GPT-5.6 Terra 的三分之一不到。代价是前面那些弱项——终端长跑和 GDPVal 类任务上它排在末位,所以「分数相当」只在综合指数这一个维度成立,落到具体任务上要看上一节那张表。
再往下一档,Gemini 3.6 Flash 现在和 3.7 同价却低 4 分,除非你有已经调好的 prompt 依赖它的行为,否则没有留下的理由。文本负载想再省一个数量级,DeepSeek V4 Flash 和 GLM-5.3 是另一条路,但都不吃图像和视频。上一代 Gemini 3.5 Flash 的接入方式与 3.7 基本一致,老代码换个模型 ID 就能跑。
References
- https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash
- https://ai.google.dev/gemini-api/docs/pricing
- https://ai.google.dev/gemini-api/docs/thinking
- https://ai.google.dev/gemini-api/docs/openai
- https://deepmind.google/models/model-cards/gemini-3-7-flash/
- https://artificialanalysis.ai/models/gemini-3-7-flash
- https://ofox.io/zh/models/google/gemini-3.7-flash
常见问题
- Gemini 3.7 Flash 的 API 多少钱?
- Google 定价页写的是输入 $0.75 / 输出 $3.75 每百万 token,缓存读取 $0.075。但这一格里还有第二行:这个价到 2026-12-31 为止,2027-01-01 起变成 $1.50 / $7.50。Batch 与 Flex 档是 $0.375 / $1.875,同样在 2027 年翻倍。输出价包含思考 token,官方原文是 response pricing is the sum of output tokens and thinking tokens。
- Gemini 3.7 Flash 比 3.6 Flash 贵吗?
- 不贵,两个现在完全同价。Google 官方定价页上,3.6 Flash 和 3.7 Flash 的每一格逐字相同,包括那句 $0.75 through December 31, 2026 和 $1.50 starting January 1, 2027。发布当天的宣传语说 3.7 是 3.6 原价的一半,那个原价指的是 3.6 在 2026-07-21 上线时的 $1.50 / $7.50,同一天 3.6 也跟着降到了 $0.75。所以换代本身不加钱,也不省钱。
- Gemini 3.7 Flash 的 thinking 档位有哪些?
- 原生参数是 thinking_level,接受 low、medium、high 三个值,默认 medium。官方模型规格页在 Thinking 那一行明确写了 Note: minimal is not supported and returns an error。3.6 Flash 上可以传 minimal,所以从 3.6 迁过来的代码如果硬编码了这个值,换模型 ID 之后会直接报错。
- Gemini 3.7 Flash 的上下文和输出上限是多少?
- 输入上限 1,048,576 token,输出上限 65,536 token。1M 的上下文窗口不代表能一次吐出等量内容,输出侧只有 64K,长文档改写或者整仓代码生成要自己分片。输入支持文本、图像、视频、音频和 PDF,输出只有文本。
- Gemini 3.7 Flash 适合做实时语音应用吗?
- 不适合,Live API 在官方能力表上是 Not supported,图像生成和音频生成同样不支持。它是纯文本输出的多模态输入模型。要做实时语音走 Gemini 3.1 Flash Live 或者 3.5 Live Translate 那条线。另外 Artificial Analysis 在 high 档、直连 Google API 的条件下实测首个 token 延迟 14.52 秒,在 Flash 这个命名下算慢的,交互式场景要先自己量一遍。
- 和 Gemini 3.7 Flash 分数相当的是哪几个模型?
- 按 Google 模型卡里引用的 Artificial Analysis Intelligence Index,3.7 Flash 是 56,同一张表里 Claude Sonnet 5 是 55、GPT-5.6 Terra 和 Muse Spark 1.2 都是 57。差距在三分以内,但价格不在同一档:3.7 Flash $0.75 / $3.75、Sonnet 5 $2 / $10、GPT-5.6 Terra $2 / $12、Muse Spark 1.2 $1.25 / $4.25。这一档里它是最便宜的那个。
- Gemini 3.7 Flash 在网关上的模型 ID 是什么?
- ofox 上是 google/gemini-3.7-flash,走 OpenAI 兼容协议或 Gemini 原生协议都行。直连 Google 时模型代号是 gemini-3.7-flash,OpenAI 兼容层的 base URL 为 https://generativelanguage.googleapis.com/v1beta/openai/。


