Gemini 3.7 Flash API: цена $0.75 временная, minimal отдаёт 400

Gemini 3.7 Flash стоит $0.75 на входе и $3.75 на выходе — ровно столько же, сколько 3.6 Flash. Уровней thinking осталось три, minimal теперь возвращает 400, а самый дешёвый доступный уровень обходится в 8.4 раза дороже.

Gemini 3.7 Flash API: цена $0.75 временная, minimal отдаёт 400

Gemini 3.7 Flash вышел 13 августа 2026 года по цене $0.75 за миллион входных токенов и $3.75 за миллион выходных. В этой цене легко упустить две вещи: она истекает 31 декабря 2026 и на следующий день удваивается, а у Gemini 3.6 Flash теперь ровно те же цифры.

Ломает сборки не цена. Уровней thinking стало три вместо четырёх. minimal исчез — и исчез громко, без тихой деградации.

Цена:         $0.75 вход / $3.75 выход за 1M до 2026-12-31
              $1.50 / $7.50 с 2027-01-01
              Batch и Flex: $0.375 / $1.875, та же дата удвоения
Кэш:          чтение $0.075, хранение $0.50 за 1M в час
Контекст:     1 048 576 вход / 65 536 выход
Thinking:     thinking_level low | medium | high, по умолчанию medium
              minimal возвращает HTTP 400
Шлюзы:        google/gemini-3.7-flash на ofox
Замерено:     minimal — 400, none и xhigh принимаются и тарифицируются
Срез:         2026-08-21, по 10 стриминговых вызовов на уровень

Последнее обновление: 2026-08-21. Стартовая цена действует до 2026-12-31 — пересчитайте бюджет, прежде чем планировать за эту дату.

Сколько стоит API Gemini 3.7 Flash

$0.75 на входе, $3.75 на выходе — пока это так. Страница цен Google кладёт два тарифа в одну ячейку, и именно так в бюджетную таблицу попадает не тот.

УровеньВход / 1MВыход / 1MДействует
Standard$0.75$3.75до 2026-12-31
Standard$1.50$7.50с 2027-01-01
Batch / Flex$0.375$1.875до 2026-12-31
Batch / Flex$0.75$3.75с 2027-01-01

Чтение из кэша — $0.075 за миллион, хранение — $0.50 за миллион токенов в час, и то и другое удваивается в ту же дату. Search grounding даёт 5 000 бесплатных запросов в месяц на все модели Gemini 3.x сразу, а не на каждую отдельно, дальше — $14 за тысячу.

Одна строка на этой странице влияет на счёт сильнее заголовочного тарифа: в строке выхода написано «Output price (including thinking tokens)». Reasoning считается по выходной ставке, поэтому настройка effort — это множитель цены, а не ручка качества с погрешностью округления.

Дешевле ли Gemini 3.7 Flash, чем 3.6 Flash

Нет. Цена совпадает ячейка в ячейку. Если вы видели 3.7 Flash в подаче «вдвое дешевле 3.6 Flash», у этого сравнения был срок годности примерно в сутки — и история самой страницы цен объясняет почему.

То есть база сравнения сдвинулась внутри тех же 48 часов, что и само сравнение. Карточка модели Google фиксирует финал сноской без комментариев: звёздочка у обеих ценовых строк говорит, что стартовая цена истекает 31 декабря 2026 года. Переход с 3.6 ничего не удорожает и ничего не экономит. Скидка покупает четыре с половиной месяца — одинаково для обеих моделей.

На странице модели в ofox есть тарифы, которые Google отдельно не расписывает: запись в кэш $0.0415 за миллион, часовая запись в кэш $0.50, аудиовход $0.75, веб-поиск $0.014 за запрос.

Как вызывать Gemini 3.7 Flash

Два маршрута, и отличаются они только базовым URL и строкой модели.

from openai import OpenAI

client = OpenAI(api_key="sk-...", base_url="https://api.ofox.io/v1")

r = client.chat.completions.create(
    model="google/gemini-3.7-flash",
    reasoning_effort="low",
    messages=[{"role": "user", "content": "Rewrite this query with a window function"}],
)
print(r.choices[0].message.content)

Напрямую к Google строка модели теряет префикс google/, а базовый URL меняется:

client = OpenAI(
    api_key="AIza...",
    base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)
r = client.chat.completions.create(model="gemini-3.7-flash", reasoning_effort="low", messages=[...])

В нативном протоколе Google параметр называется не reasoning_effort. Это thinking_level, он принимает low, medium и high и по умолчанию равен medium. На ofox открыты оба протокола, наверху — Google и Cloud Vertex.

Список возможностей дешевле переписать со страницы модели, чем выяснять по ошибкам 400: function calling, структурированный вывод, кэширование контекста, выполнение кода, search grounding, URL context, file search и Maps grounding поддерживаются, computer use помечен как Preview, доступны Batch, Flex и Priority. Live API, генерация изображений и генерация аудио не поддерживаются. На вход идут текст, изображения, видео, аудио и PDF, на выходе только текст.

Почему minimal возвращает ошибку

Потому что уровень убрали, и запрос падает вместо отката на соседний. Страница модели говорит это прямым текстом в строке Thinking: Supported (low, medium, high), а следом Note: minimal is not supported and returns an error.

Мы всё равно отправили. Через маршрут ofox reasoning_effort: "minimal" возвращает HTTP 400 с телом:

{"error": {"code": null,
           "message": "Thinking level is unsupported: THINKING_LEVEL_MINIMAL",
           "param": null, "type": "invalid_request_error"}}

3.6 Flash значение minimal пока принимает, и мы замерили, что этот уровень делал для вас, пока он у вас есть. На 3.6 Flash тот же промпт на minimal дал медиану 42 completion-токена при нуле токенов размышления и первом токене через 1.36 секунды. Самый дешёвый уровень, который примет 3.7, — low — дал медиану 354 токена за 4.19 секунды. Это 8.4 раза по тарифицируемому выходу и втрое по ожиданию, при том что видимый ответ в обоих случаях — те же 40 токенов.

Так что миграция здесь — не «поменять ID модели и жить дальше». Конфиг с захардкоженным minimal перестаёт работать в момент подмены ID, а ближайшее допустимое значение молча стоит в восемь раз дороже. Уровня «не думать» у 3.7 Flash нет вообще.

Более интересная половина этой пробы — то, что не упало. none и xhigh для этой модели не документированы, но оба вернули HTTP 200 и токены размышления в счёте: медианы 271 и 604 за десять прогонов, что и даёт 308 и 637 completion-токенов в таблице ниже. Отвергается только minimal. Ответ 200 не подтверждает, что отправленное значение выбрало уровень, который обещает его имя, — та же ловушка, что GLM 5.3 расставляет недокументированными значениями reasoning_effort, где валидация живёт на маршруте, а не в модели. Пробуйте свой маршрут до релиза: «вернулось 200» и «сделало то, что я просил» — разные утверждения.

Страница OpenAI-совместимости Google стоит двух минут: в её таблице соответствий для reasoning_effort перечислены Gemini 3.1 Pro, 3.1 Flash-Lite, Gemini 3 Flash и 2.5, колонки 3.7 нет, а OpenAI-овский minimal отображается вниз. Страница модели при этом говорит, что 3.7 его отвергает. Две страницы Google, согласия нет, и одна короткая проба решает вопрос для того маршрута, который вы реально вызываете.

Сколько на самом деле стоит каждый уровень thinking

Ответ тот же, счёт — до двух раз больше. Mak, product lead в ofox, 21 августа 2026 года прогнал по десять стриминговых вызовов на уровень через один и тот же маршрут ofox, на одном коротком промпте (переписать GROUP BY через оконную функцию), фиксируя время до первого содержательного токена и usage, который вернул API.

reasoning_effortМедиана TTFTДиапазон TTFTCompletion-токеныДиапазонВидимый ответ
low4.19 с2.22–5.4035440–418~41
medium5.47 с4.47–6.98384291–558~41
high7.69 с5.97–9.68688560–806~40
не задан5.58 с4.32–5.98431333–583~36
none (не документирован)4.64 с1.88–5.0530840–361~40
xhigh (не документирован)7.35 с5.89–9.10637513–892~39

Медианы по десяти прогонам; диапазоны — наблюдаемые минимум и максимум, они расширяются с числом прогонов, так что читайте их как разброс, а не как границы. Всё это один промпт на одном маршруте, а обработка параметров у разных маршрутов к одной модели может отличаться — форму считайте переносимой, а числа нашими.

Размер ответа не меняется. Меняется невидимая часть. Текстовых токенов на каждом уровне было около 40, потому что запрошенный SQL-запрос занимает 40 токенов, сколько над ним ни думай. Всё, что выше этой линии, — reasoning, тарифицируемый по выходной ставке. Только по выходу при $3.75 за миллион тысяча таких вызовов стоит $1.33 на low и $2.58 на high; промпт в 34 токена добавляет меньше трёх центов на тысячу в обоих случаях, так что всю разницу делает именно настройка effort.

low в одном прогоне из десяти опустился до 40 completion-токенов при ровно нулевом reasoning; none сделал так дважды. Ни medium, ни high не делали этого ни разу, и этот пол — основная причина, почему их диапазоны разошлись.

low и high разделяются чисто. low и medium — нет. Диапазон high (560–806) не пересекается с диапазоном low (40–418), так что на этом промпте разрыв настоящий. У low и medium разница медиан 30 токенов, а диапазоны перекрываются почти на всём протяжении — десять прогонов их не различают. Полезен ли medium как середина — вопрос про ваш промпт, и ответить на него своими данными занимает минуты четыре.

Недокументированные значения не падают и не делают того, что обещают. none вернул HTTP 200 и потратил медианно 271 токен размышления — почти столько же, сколько тратит low. Если вы прочитали это имя как выключатель, вы платите за размышления, которые считаете отключёнными. xhigh встаёт рядом с high. Отвергается только minimal.

Ничто из этого не противоречит тому, что модель быстрая. Artificial Analysis ставит 3.7 Flash на 1-е место из 182 по скорости выдачи — 389.5 токена в секунду. На той же странице они меряют 14.52 секунды до первого токена на high при прямом обращении к API Google, против медианы 2.80 секунды у моделей его ценовой группы и примерно вдвое больше нашей медианы на high через этот маршрут. Ожидание стоит перед потоком, а не внутри него — поэтому пользователь чувствует настройку effort, а не токены в секунду.

В чём Gemini 3.7 Flash хорош

Карточка модели Google публикует сравнение с 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra и Muse Spark 1.2. Строки, где разрыв реальный:

Бенчмарк3.7 Flash3.6 FlashSonnet 5GPT-5.6 Terra
AA Intelligence Index56525557
GDM-MRCR v2 (128k)97.0%91.8%81.5%93.5%
LVBench (длинное видео)85.4%84.2%68.5%78.9%
Code Arena (веб-разработка, Elo)1588153815411523
AutomationBench30.4%17.0%10.7%23.6%
FrontierCode 1.143.6%34.4%42.7%41.3%
HLE-Verified53.6%51.2%31.0%51.1%
DeepSWE v1.165.3%48.6%53.8%69.6%
Terminal-bench 2.185.8%78.0%80.4%87.4%
Terminal-bench 3.014.9%5.4%14.6%20.8%
GDPVal-AA v2 (Elo)1525142215981578
Agent’s Last Exam26.3%24.2%33.3%28.0%
CharXiv, без инструментов84.5%85.2%77.0%85.9%

Сильные стороны группируются: поиск по длинному контексту, видео, фронтенд-код и автоматизация браузера. 97.0% на поиске иголки в 128k — единственный результат выше 95 в таблице, а 30.4% на AutomationBench против 10.7% у Sonnet 5 — не тот отрыв, который получают правкой промпта.

Слабые стороны группируются так же плотно, и все они про работу, которая идёт долго. По обеим версиям Terminal-bench модель стоит позади GPT-5.6 Terra: 85.8% против 87.4% на 2.1 и 14.9% против 20.8% на 3.0. DeepSWE v1.1 тоже отстаёт от Terra на 4.3 пункта, а 1525 на GDPVal-AA v2 — последнее место в таблице. Берите эту модель на шаг процесса, а не на восьмичасовой автономный цикл.

Две строки в этой таблице стоит читать внимательно. CharXiv — единственная строка, где 3.7 хуже модели, которую заменяет: 84.5% против 85.2% без инструментов и 88.7% против 89.4% с ними, так что насыщенную графиками мультимодальную работу стоит прогнать через собственный A/B до замены. И строки Terminal-bench получены самим вендором. Карточка заявляет 85.8% на Terminal-bench 2.1 — это выше, чем 83.8% ± 1.2% у лидера публичной таблицы Terminal-Bench 2.1, где на момент нашей выгрузки было 17 проверенных заявок и ни одной от 3.7 Flash. Самозаявленный результат, перекрывающий проверенного лидера, — единственное число в этой таблице, которое стоит читать как утверждение, а не как результат.

Ещё две строки из карточки, словами самого Google: обучающие данные обрываются в марте 2026, часть областей — ещё в январе 2025, и «may also be occasional slowness or timeout issues».

Когда стоит выбирать Gemini 3.7 Flash

НагрузкаРешениеПочему
RAG и поиск за пределами 128kБеритеMRCR v2 на 97.0%, максимум в карточке
Понимание видео и вопросы к немуБеритеLVBench 85.4%, на 17 пунктов выше Sonnet 5
Генерация фронтенда и веб-кодаБеритеCode Arena 1588, вершина таблицы
Автоматизация браузера и GUIБеритеAutomationBench 30.4% против 10.7% у Sonnet 5
Долгоживущие терминальные агентыОсторожноTerminal-bench 3.0 на 14.9%
Интерактивный чат и голосовой фронтендИщите другоеНет Live API, а время размышления стоит перед первым токеном
Мультимодальный анализ с обилием графиковСначала проверьтеCharXiv — единственный откат относительно 3.6
Одиночные ответы длиннее 64k токеновРежьте на частиПотолок вывода — 65 536

Если вашей задачи в списке нет, подборщик моделей ofox ранжирует 100+ моделей по качеству, цене и скорости под выбранный тип задачи (код, агенты, RAG по длинным документам, зрение, извлечение, перевод), подтягивая актуальные цены и лимиты контекста. Без регистрации и без ключа.

Какие модели набирают примерно столько же

Четыре модели укладываются в три пункта друг от друга по индексу Artificial Analysis Intelligence Index при разбросе цен больше чем втрое. Оценки и тарифы ниже — те, что напечатаны в карточке модели Google, то есть это один источник, а не четыре: перед тем как закладывать бюджет, перепроверьте на странице самого вендора.

МодельAA IndexВход / 1MВыход / 1M
GPT-5.6 Terra57$2.00$12.00
Muse Spark 1.257$1.25$4.25
Gemini 3.7 Flash56$0.75$3.75
Claude Sonnet 555$2.00$10.00
Gemini 3.6 Flash52$0.75$3.75

Самый дешёвый из четырёх по выходу, в 3.2 раза ниже Terra, и на пункт позади него по сводному индексу. Подвох как раз в сводном индексе: он прячет терминальные строки и GDPVal, где 3.7 Flash приходит последним, так что «сопоставимо» — утверждение об индексе и ни о чём больше.

Строкой ниже 3.6 Flash теперь стоит столько же при четырёх пунктах отставания, и оснований оставаться на нём не остаётся — кроме промптов, уже подогнанных под его поведение. Если вы всё ещё на нём, в нашем сравнении стоимости задачи с DeepSeek V4 Flash есть подсчёты, а уровень ниже разбирает сравнение бюджетных агентов на 3.1 Flash-Lite. Если переходите через поколение, руководство по кодинг-агентам на 3.5 Flash применимо к 3.7 без изменений, не считая ID модели и отсутствующего minimal.

В ofox до 2026-08-31 действует +15% к пополнению и возврат 15% от расхода по коду OFOXAI2608: google/gemini-3.7-flash и google/gemini-3.6-flash стоят за одним OpenAI-совместимым эндпоинтом, так что A/B из сниппета выше — замена одной строки.

References

Часто задаваемые вопросы

Сколько стоит API Gemini 3.7 Flash?
$0.75 за миллион входных токенов и $3.75 за миллион выходных — до 31 декабря 2026 года, а с 1 января 2027 будет $1.50 и $7.50. Страница цен Google печатает обе строки в одной ячейке. Batch и Flex стоят вдвое меньше, $0.375 / $1.875, и дорожают в ту же дату. В цену выхода входят токены размышления, то есть reasoning тарифицируется по выходной ставке.
Gemini 3.7 Flash дешевле, чем 3.6 Flash?
Нет, они стоят одинаково. На странице цен Google у обеих моделей одни и те же четыре уровня и одни и те же две даты. Архивные копии показывают, почему формулировка «вдвое дешевле» не выдерживает проверки: 12 августа 2026 у 3.6 Flash было ровно $1.50 / $7.50 без всякой скидки, а 3.7 Flash на странице ещё не было; 14 августа обе модели читаются как $0.75 / $3.75. База сравнения сдвинулась в те же 48 часов, что и само сравнение.
Почему reasoning_effort minimal падает на Gemini 3.7 Flash?
Потому что этот уровень убрали. На странице модели прямо написано: «Note: minimal is not supported and returns an error.» В нашей пробе запрос вернул HTTP 400 с телом «Thinking level is unsupported: THINKING_LEVEL_MINIMAL» и типом invalid_request_error. 3.6 Flash значение minimal принимает, поэтому конфиг с захардкоженным minimal ломается ровно в момент подмены ID модели, а не деградирует тихо.
Какие уровни thinking есть у Gemini 3.7 Flash?
Нативный параметр называется thinking_level и принимает low, medium и high, по умолчанию medium. Через OpenAI-совместимый слой параметр называется reasoning_effort. Мы прогнали по десять стриминговых вызовов на уровень на одном коротком промпте: медиана completion-токенов на low — 354 против 688 на high, диапазоны не пересекаются, а видимый ответ на всех уровнях остаётся около 40 токенов.
Какие лимиты контекста и вывода у Gemini 3.7 Flash?
1 048 576 входных токенов и 65 536 выходных. Окно на миллион токенов не означает ответов на миллион токенов, так что переписывание длинных документов и генерацию целого репозитория всё равно придётся резать на части. На вход идут текст, изображения, видео, аудио и PDF, на выходе только текст.
Gemini 3.7 Flash быстрый?
Смотря какую половину мерить. Artificial Analysis ставит его на 1-е место из 182 по скорости выдачи — 389.5 токена в секунду, — и на той же странице фиксирует 14.52 секунды до первого токена на уровне high при прямом обращении к API Google, против медианы 2.80 секунды у моделей его ценовой группы. Время размышления стоит перед первым токеном, поэтому задержка и пропускная способность — разные истории. Наши медианы через маршрут ofox: 4.19 с на low, 5.47 на medium и 7.69 на high.
Какие модели набирают примерно столько же, сколько Gemini 3.7 Flash?
По индексу Artificial Analysis Intelligence Index, напечатанному в карточке модели Google, у 3.7 Flash 56 против 57 у GPT-5.6 Terra и Muse Spark 1.2 и 55 у Claude Sonnet 5. Там же указаны цены: $2.00 / $12.00, $1.25 / $4.25 и $2.00 / $10.00 за миллион, то есть по цене выхода 3.7 Flash из этой четвёрки самый дешёвый.
Какой ID у Gemini 3.7 Flash на шлюзах?
На ofox это google/gemini-3.7-flash, доступный и по протоколу OpenAI /v1/chat/completions, и по нативному протоколу Gemini. При прямом обращении к Google код модели — gemini-3.7-flash, а OpenAI-совместимый base URL — https://generativelanguage.googleapis.com/v1beta/openai/.