DeepSeek V4 Flash vs Gemini 3.6 Flash: тот же балл, 10x цена

Оба набирают 50 в Artificial Analysis. DeepSeek стоит $0.14/M против $1.50/M у Gemini, но тратит 210M токенов против 59M. Куда девается разрыв в 10x.

DeepSeek V4 Flash vs Gemini 3.6 Flash: тот же балл, 10x цена

Коротко: DeepSeek V4 Flash 0731 и Gemini 3.6 Flash оба набирают 50 в Artificial Analysis Intelligence Index v4.1, а GPT-5.6 Luna на один пункт впереди с 51. Их прайсовые цены различаются более чем на порядок. Интересное начинается, когда перестаешь сравнивать ценники и начинаешь сравнивать счета за одну и ту же оцениваемую нагрузку. Artificial Analysis публикует, во сколько ей обошелся прогон каждой модели: $72.02 для DeepSeek, $190.87 для Luna, $726.70 для Gemini. Разрыв по ценнику на выходе 27x. Разрыв по реальному счету 10.1x, потому что DeepSeek сжег на том прогоне 210M выходных токенов против 59M у Gemini. Оба числа говорят: берите DeepSeek, если ваша нагрузка текстовая; ни одно из них не выживает при столкновении с конвейером, который отправляет изображения.

Коротко: какую выбрать?

Ваша ситуацияВыборПочему
Только текст, большие объемы, ограничение по стоимостиDeepSeek V4 Flash 0731Самая дешевая за токен примерно в 10x, плюс скидка 98% на кеш
Что угодно с изображениями, аудио, видео или PDFGemini 3.6 FlashDeepSeek 0731 работает только с текстом; более дешевого обходного пути нет
Интерактивный UX, где задержка видна пользователюGemini 3.6 Flash~220 выходных токенов/сек и самый низкий TTFT из трех по прогонам AA
Длинные одиночные генерации (целые файлы, длинные отчеты)DeepSeek V4 Flash 0731Максимум 384K на выходе против 64K у Gemini
Нужен топовый балл индекса и зрение в одной моделиGPT-5.6 Luna51 по индексу, зрение и снижение цены на 80% 2026-07-30
Ограниченные агентные циклы с агрессивным кешированиемDeepSeek V4 Flash 0731Чтение из кеша по $0.0028/M, самое низкое из трех с большим отрывом
Нужны воспроизводимые сторонние данные по задержке уже сегодняGemini 3.6 Flash или GPT-5.6 LunaУ AA не было данных по скорости или TTFT для сборки 0731 на срез

Здесь можно закончить чтение двумя способами. Если ваша нагрузка отправляет любой нетекстовый ввод, вторая строка все решает, а остальная часть статьи это фон. Если ваша нагрузка текстовая и укладывается примерно в 20M токенов в месяц, годовая разница между самым дешевым и самым дорогим из вариантов выше меньше, чем день инженерного времени, так что выбирайте по задержке и двигайтесь дальше. Все, что ниже, написано для случая, когда счет достаточно велик, чтобы о нем спорить.

Табло: DeepSeek V4 Flash 0731 и Gemini 3.6 Flash набирают по 50 в Artificial Analysis Intelligence Index v4.1, GPT-5.6 Luna, 51, при этом их прайс за 1M токенов составляет $0.14/$0.28, $1.50/$7.50 и $0.20/$1.20

Что на самом деле изменилось 31 июля

DeepSeek выпустила новую сборку V4 Flash 2026-07-31 и не поменяла саму модель. Те же 284B общих параметров, те же 13B активных, тот же контекст 1M, та же цена $0.14 / $0.28. Имя модели в API тоже не изменилось, deepseek-v4-flash, а сборка идентифицируется в документации DeepSeek как версия модели DeepSeek-V4-Flash-0731. Изменилась пост-тренировка.

Измеренный эффект больше, чем обычно подразумевает фраза «только пост-тренировка». В Artificial Analysis Intelligence Index v4.1 балл вырос с 40 до 50. Агентная оценка AA, GDPval-AA v2, сдвинулась с 1189 Elo до 1559. Terminal-Bench 2.1 прибавил 17 пунктов и достиг 79%. AA также ставит сборку 0731 на 6 пунктов выше DeepSeek V4 Pro, собственного флагмана DeepSeek, а это неудобный результат для всех, кто писал правила маршрутизации, исходя из того, что тяжелые случаи берет на себя Pro.

Мы были среди этих людей. Наш гайд по маршрутизации DeepSeek V4 Pro против Flash от мая заключал, что многофайловая работа и длинные агентные циклы принадлежат Pro. Для сборки 0731 этот вывод больше не держится, и честная версия в том, что теперь Flash стал вариантом по умолчанию, а Pro исключением, которое надо обосновывать.

Веса выложили быстрее, чем кто-либо обещал. В анонсе AA полные веса описывались как ожидаемые «в ближайшие недели», и большинство вторичных публикаций до сих пор это повторяет. По проверке на 2026-08-01 deepseek-ai/DeepSeek-V4-Flash-0731 на Hugging Face уже содержит модель в виде 48 safetensors shards под MIT, без гейтинга. Если вы где-то прочитали, что 0731 доступна только через API, это было правдой примерно один день.

Одна оговорка, которую стоит сделать до того, как начнутся цифры. Intelligence Index это скользящий лидерборд, и все ниже это срез 2026-08-01. Считайте порядок устойчивым фактом, а абсолютный балл показанием, снятым в конкретный день.

Быстрое сравнение характеристик

DeepSeek V4 Flash 0731Gemini 3.6 FlashGPT-5.6 Luna
ID модели в ofoxdeepseek/deepseek-v4-flashgoogle/gemini-3.6-flashopenai/gpt-5.6-luna
AA Intelligence Index v4.1505051 🏆
Выпуск2026-07-31 (сборка 0731)2026-07-212026-07-09
Цена входа (прайс вендора)$0.14/M 🏆$1.50/M$0.20/M
Цена выхода (прайс вендора)$0.28/M 🏆$7.50/M$1.20/M
Кешированный вход$0.0028/M 🏆$0.15/M$0.02/M
Окно контекста1M1M (1,048,576)1M
Максимум на выходе384K 🏆64K (65,536)128K
Модальности вводаТекстТекст, изображения, видео, аудио, PDF 🏆Текст, изображения
Скорость вывода (AA)не опубликовано на срез219.6 tok/s 🏆172.1 tok/s
Время до первого токена (AA)не опубликовано на срез15.11s 🏆121.89s
Открытые весаДа, MIT на Hugging Face 🏆НетНет
Проводные протоколыOpenAI, Anthropic, ResponsesOpenAI, GeminiOpenAI, Anthropic, Responses

Две строки заслуживают повторного взгляда. Максимум на выходе это настоящий разделитель: 384K против 64K это разница между генерацией длинного файла за один вызов и построением цикла продолжения. А пустые ячейки задержки это не ошибка форматирования. Страница провайдера AA для сборки 0731 не содержала данных по скорости или времени до первого токена на срез 2026-08-01, так что любой, кто называет вам цифру токенов в секунду для этой сборки, называет что-то другое.

Картина бенчмарков: три модели разделяет один пункт

Вот детализация суб-баллов AA для сборки 0731, с дельтой относительно апрельской сборки там, где AA ее опубликовала.

ОценкаDeepSeek V4 Flash 0731Изменение к апрельской сборке
Intelligence Index v4.150+10
GDPval-AA v2 (Elo)1559+370
Terminal-Bench 2.179%+17
GPQA Diamond91%+1
AA-LCR66%+3
SciCode50%+5
Humanity’s Last Exam37%+5
τ³-Bench Banking31%+8
CritPt17%+9
AA-Omniscience Index-16+7

Строку Omniscience люди обычно пропускают. AA сообщает, что улучшение пришло от меньшего числа галлюцинаций, а не от большего объема знаний, при неизменной точности. Для модели, которую вы вот-вот направите на продакшн-трафик, «ошибается реже» это более полезный апгрейд, чем «знает больше», и это как раз то, что скрывает единственный сводный балл.

Две заметки об источниках, потому что у этого релиза гуляет не один набор цифр.

Собственные материалы к релизу DeepSeek сообщают Terminal-Bench 2.1 на уровне 82.7, DeepSWE 54.4 и Cybergym 76.7. Artificial Analysis сообщает Terminal-Bench 2.1 на уровне 79%. Оба варианта могут быть верны; харнессы, обвязки и настройки усилия различаются, а стороннего воспроизведения цифр DeepSWE и Cybergym на момент среза не было. Мы используем цифры AA повсюду, потому что это единственные, измеренные одинаково для всех трех моделей здесь. Если вы где-то увидите цитату 82.7, это харнесс вендора, а не противоречие.

Вторая заметка: балл LMArena, привязанный к DeepSeek V4 Flash на большинстве каталожных страниц, включая нашу, читается как 1438 Overall с рангом в районе семидесятых, обновлено 2026-07-12. Это предшествует сборке 0731 на девятнадцать дней. Он измеряет апрельскую модель. Баллам Arena для новой сборки понадобятся новые голоса, а до тех пор число, стоящее рядом с «DeepSeek V4 Flash» на любой странице сравнения, описывает модель, которая набрала на 10 пунктов меньше по AA.

Налог на многословность: почему разрыв по ценнику это не разрыв по счету

Всякое сравнение этих двух моделей начинается с $0.14 против $1.50 и на этом останавливается. Это соотношение реально, и оно же наименее надежное число в этой статье, потому что оно оценивает токен, а не задачу.

Artificial Analysis публикует кое-что получше: во сколько ей реально обошелся прогон каждой модели через один и тот же набор Intelligence Index, счет прилагается.

Столбчатая диаграмма, во сколько Artificial Analysis обошелся прогон каждой модели через Intelligence Index: DeepSeek V4 Flash 0731 на 210M выходных токенов за $72.02, GPT-5.6 Luna на 130M за $190.87 и Gemini 3.6 Flash на 59M за $726.70

МодельВыходных токенов на прогон индексаОбщая стоимость прогона по AA
DeepSeek V4 Flash 0731210M$72.02
GPT-5.6 Luna130M$190.87
Gemini 3.6 Flash59M$726.70

Одна и та же оценка, три реальных счета. Gemini стоит 10.1x от DeepSeek, а Luna 2.7x. На фоне ценниковых соотношений 27x и 4.3x по цене выхода это означает, что примерно 60% бумажного преимущества DeepSeek исчезает где-то между прайсом и счетом.

Уходит оно в токены. DeepSeek потратил 210M выходных токенов на этом наборе против 59M у Gemini, что AA помечает как очень многословно на фоне остальных. Оцените одну только выходную часть по прайсовым ставкам, и получите $58.80 для DeepSeek, $156.00 для Luna и $442.50 для Gemini, разрыв 7.5x на этой части. Форма двух счетов соответственно различается: выход это около 82% того, во что обошелся прогон DeepSeek, и около 61% у Gemini. Это подпись модели, которая пишет в три с половиной раза больше, чтобы набрать тот же балл. AA не публикует число входных токенов по каждой модели, так что остаток по опубликованным цифрам дальше не разложить.

Какое число закладывать, зависит от вашего трафика. Нагрузка, где преобладает промпт, идет по входному соотношению 10.7x. Нагрузка, где преобладает генерация, сжимается к 7.5x за счет многословности. Сквозная цифра AA в 10.1x лежит между ними, на наборе, который сам является смесью, поэтому 10x это лучшее значение по умолчанию, чем 27x, для всего, что придется отстаивать на разборе бюджета.

Две оговорки по числу токенов. Они взяты из конфигураций AA с максимальным и высоким усилием, а это дорогой край диапазона каждой модели, а не типичная продакшн-настройка. И многословность зависит от нагрузки; набор, полный трудных задач на рассуждение, льстит моделям, которые рассуждают кратко, а ваш конвейер извлечения это не тот набор.

Одна сноска про 210M, поскольку ходят два числа AA. Страница модели сообщает 210M выходных токенов для прогона индекса; статья-анонс AA сообщает ~206M, наряду с более интересным фактом, что это на 12% меньше выходных токенов, чем потратила предыдущая сборка V4 Flash (~234M). Так что 0731 одновременно многословнее своих конкурентов и менее многословна, чем ее собственный предшественник. Мы используем 210M повсюду, потому что цифра со страницы модели опубликована одинаково для всех трех моделей здесь.

Но рычаг реален, и это один флаг. Документация DeepSeek указывает, что deepseek-v4-flash поддерживает и режим без размышления, и режим размышления, причем размышление стоит по умолчанию, а токены рассуждений тарифицируются как выход. Для ограниченной работы отключение размышления это то место, где налог на многословность исчезает.

Измерьте на своем трафике

Соотношение AA это стартовая оценка, а не ваше число. Чтобы получить свое, хватит одного прогона по выборке ваших реальных промптов, потому что каждый OpenAI-совместимый ответ несет нужные вам счетчики токенов:

import collections
from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")

costs = {  # input, output, per 1M tokens
    "deepseek/deepseek-v4-flash": (0.14, 0.28),
    "google/gemini-3.6-flash": (1.50, 7.50),
    "openai/gpt-5.6-luna": (0.20, 1.20),
}
totals = collections.defaultdict(float)

for prompt in load_your_real_prompts():        # 50 is enough to see the shape
    for model, (pin, pout) in costs.items():
        u = client.chat.completions.create(
            model=model, messages=[{"role": "user", "content": prompt}]
        ).usage
        totals[model] += (u.prompt_tokens * pin + u.completion_tokens * pout) / 1e6

for model, spend in sorted(totals.items(), key=lambda kv: kv[1]):
    print(f"{model:32} ${spend:.4f} over the sample")

Пятьдесят репрезентативных промптов стоят несколько центов на прогон по всем трем и расскажут вам больше, чем любой лидерборд. Две вещи, за которыми стоит следить. Прогоните дважды с включенным и выключенным размышлением для DeepSeek, поскольку этот флаг двигает выходную колонку сильнее, чем выбор модели. И берите выборку из реального распределения вашего трафика, а не из самых сложных случаев, потому что соотношения многословности, измеренные на трудных задачах на рассуждение, не переносятся на очередь из двухстрочных классификаций.

Расчет цены: два реальных месячных счета

Все цены ниже это прайс вендора, срез 2026-08-01, за 1M токенов.

Сценарий A, конвейер извлечения. 200M входных токенов и 10M выходных токенов в месяц, без кеширования, короткие структурированные выводы.

МодельСтоимость входаСтоимость выходаМесячный итог
DeepSeek V4 Flash 0731$28.00$2.80$30.80
GPT-5.6 Luna$40.00$12.00$52.00
Gemini 3.6 Flash$300.00$75.00$375.00

Вход доминирует, так что этот сценарий близко следует за соотношением цены входа: Gemini стоит 12x от DeepSeek, Luna 1.7x. Обратите внимание, насколько снижение цены 30 июля изменило позицию Luna здесь. При старых $1 / $6 та же нагрузка стоила $260 в месяц.

Сценарий B, цикл кодинг-агента. 100M входных токенов при 70% попадании в кеш и 40M выходных токенов в месяц.

МодельКешированный входСвежий входВыходМесячный итог
DeepSeek V4 Flash 0731$0.20$4.20$11.20$15.60
GPT-5.6 Luna$1.40$6.00$48.00$55.40
Gemini 3.6 Flash$10.50$45.00$300.00$355.50

Эта таблица держит число токенов постоянным, что тихо предполагает, будто все три модели пишут одинаковый объем, чтобы сделать одну и ту же работу. Это не так. Если держать постоянной работу и масштабировать выход по соотношениям многословности из прогона индекса, картина того же агентного цикла выходит честнее:

МодельВыходных токенов на равную работуМесячный итог
DeepSeek V4 Flash 0731142M$44.16
GPT-5.6 Luna88M$113.00
Gemini 3.6 Flash40M (базис)$355.50

DeepSeek с 23x дешевле становится 8x дешевле. Решение не меняется. А число, которое вы поставите в слайд, должно.

Более глубокая версия этой арифметики конкретно по DeepSeek, включая то, что делают со счетом промахи по кешу, есть в нашем разборе стоимости V4 Pro и в гайде по ценам DeepSeek V4 API.

Две детали цены, которые сдвинут ваш счет

DeepSeek вот-вот введет цену пиковых часов. В ее документации по ценам есть сноска: API перейдет на политику пик/непик, при которой цены в пиковые часы вдвое выше обычных, применительно ко всем позициям биллинга, с датой вступления в силу до официального объявления. Пиковые окна это 09:00 to 12:00 и 14:00 to 18:00 по пекинскому времени, UTC+8.

Переведите это на свои часы, прежде чем считать это безобидным. Эти окна приходятся на 21:00 to 00:00 и 02:00 to 06:00 US Eastern, что для нагрузки в дневное время США приходится на середину ночи, и на 03:00 to 06:00 и 08:00 to 12:00 Central European, что съедает европейской команде все утро. Если вы работаете в Европе и DeepSeek это включит, ваши $0.14 станут $0.28 на первую половину рабочего дня. Это все еще ниже Gemini, но это не то число, которое вы закладывали.

Маршрут, через который вы покупаете, может отличаться от прайса вендора. OpenAI срезала GPT-5.6 Luna на 80% 2026-07-30, с $1 / $6 до $0.20 / $1.20. Листинги, обслуживающие Luna через Azure, на срез 2026-08-01 не сдвинулись, включая наш, где openai/gpt-5.6-luna это маршрут через Azure с прайсом $1 / $6. Тот же ID модели, разница 5x, чисто на том, к какому апстриму вы попадаете.

МодельМаршрут на срезВходВыходКешированный вход
DeepSeek V4 Flash 0731DeepSeek напрямую$0.14$0.28$0.0028
DeepSeek V4 Flash 0731Aliyun BaiLian$0.14$0.28$0.028
DeepSeek V4 Flash 0731Azure$0.19$0.51$0.19
Gemini 3.6 FlashGoogle / Vertex$1.50$7.50$0.15
Gemini 3.6 FlashGoogle batch или flex$0.75$3.75$0.075
GPT-5.6 LunaOpenAI напрямую$0.20$1.20$0.02
GPT-5.6 LunaAzure$1.00$6.00$0.10

Две сноски к этой таблице. Наш листинг Luna на срез шел с промоакцией 20%, что доводит маршрут через Azure до эффективных $0.80 / $4.80, все еще вчетверо выше прайса OpenAI. И колонка чтения из кеша заслуживает отдельного взгляда: на маршруте DeepSeek через Azure чтение из кеша стоит столько же, сколько свежий вход, что стирает самое крупное ценовое преимущество этой модели.

Общее правило, которому учит таблица: проверяйте маршрут, а не имя модели. Снижение цены, объявленное лабораторией, доходит до собственного API этой лаборатории немедленно, а до всех остальных по их собственному расписанию. Две из семи строк выше это одна и та же модель за очень разные деньги.

Во что вам на самом деле обходится «только текст»

Самая дешевая модель в этом сравнении не видит. DeepSeek V4 Flash 0731 принимает текст, вызывает функции, возвращает JSON и говорит на проводных форматах и OpenAI, и Anthropic, и это весь список. Gemini 3.6 Flash принимает текст, изображения, видео, аудио и PDF. GPT-5.6 Luna принимает текст и изображения.

Это не разрыв в качестве, который можно закрыть промпт-инжинирингом или большим бюджетом. Если ваш конвейер отправляет скриншоты сломанного UI, отсканированные счета или кадры из видео, вызов DeepSeek не проваливается изящно за более высокую цену. Он проваливается структурно. Каждая таблица стоимости выше становится неактуальной для этого класса работы, поэтому строка модальности стоит ближе к верху таблицы характеристик, а не спрятана в самом низу.

Распространенное решение это разделить трафик: мультимодальные запросы на Gemini, все остальное на DeepSeek, один маршрутизатор впереди. Это больше работы, чем выбрать одну модель, и для конвейера, где 90% запросов текстовые, это обычно окупается уже в первый месяц.

Когда выбирать DeepSeek V4 Flash 0731

Только текстовые нагрузки в объеме, где счет это реальная строка бюджета. Все с высоким процентом попадания в кеш выигрывает непропорционально, потому что чтение из кеша по $0.0028/M это скидка 98% на свежий вход, снижение в 50x. Длинные одиночные генерации тоже в его пользу: максимум 384K на выходе это в шесть раз выше потолка Gemini. Это также единственная из трех с опубликованными весами, под лицензией MIT на Hugging Face, так что если план в том, чтобы прототипировать на API, а позже развернуть у себя, то путь есть только у этой.

Отключайте размышление для ограниченной работы. Это разница между строками $15.60 и $44.16 выше.

Когда выбирать Gemini 3.6 Flash

Всегда, когда задействована нетекстовая модальность, что решает вопрос еще до того, как в разговор входит цена. Также когда задержка видна пользователю: 219.6 выходных токенов в секунду ставят ее на третье место из 185 моделей в рейтинге скорости AA на срез, а 15.11 секунды до первого токена это быстро для модели с рассуждением. И когда вы хотите, чтобы сторонняя сторона уже измерила то, на что вы вот-вот положитесь, поскольку AA опубликовала скорость и задержку для Gemini, а для сборки 0731 нет.

Batch-тариф недооценен. При $0.75 / $3.75 для работы, которая терпит задержку, эффективная дистанция Gemini от DeepSeek уменьшается вдвое.

Когда выбирать GPT-5.6 Luna

Когда вы хотите самый высокий балл индекса из трех и зрение в одной модели, и снижение цены на 80% сделало эту комбинацию доступной так, как не было три недели назад. Luna при $0.20 / $1.20 теперь ближе к DeepSeek, чем к Gemini, по цене, набирая на пункт больше, чем оба.

Две вещи проверить сначала. Время до первого токена в 121.89 секунды, которое замерила AA, это конфигурация с максимальным усилием, а максимальное усилие это не интерактивная настройка; если используете Luna в UI, ставьте более низкий уровень усилия. И подтвердите, на какой маршрут вас ставит ваш шлюз, потому что доснижения тариф Azure в 5x выше прайса OpenAI. Наш гайд по тирам GPT-5.6 разбирает, как Sol, Terra и Luna делят работу.

Когда ни один из трех не является правильным ответом

Если ваша нагрузка мала, все это не имеет значения. При нескольких миллионах токенов в месяц разница между самым дешевым и самым дорогим вариантом здесь это ошибка округления против часа инженерного времени, и выбирать стоит по возможностям и двигаться дальше.

Если вы гонитесь за нулем, хостируемое API это неправильный инструмент. Бесплатные и самохостинговые пути для этого семейства моделей это отдельное упражнение с реальными лимитами, разобранное в DeepSeek V4 Flash бесплатно: четыре пути с нулевой стоимостью. Эти пути были проверены против сборки, предшествовавшей 0731, так что перепроверьте лимиты, прежде чем на них полагаться. Маршрут самохостинга с тех пор изменился: веса 0731 теперь на Hugging Face под MIT, так что вариант без лицензии применим к текущей сборке, а не к апрельской.

А если задача это глубокая многошаговая агентная работа с вызовами инструментов в двузначных числах, ни одна из этих трех моделей flash-тира не является очевидным выбором. Это территория frontier-тира, и честный ответ в том, чтобы тестировать на своих собственных трейсах, а не на чьем-либо индексе. Наше более раннее сравнение Gemini Flash Lite против DeepSeek V4 Flash в агентном цикле проходит по тому, как надежность вызова инструментов меняет расчет на глубине.

Попробуйте все три через ofox: A/B в одном цикле

Все три работают на одном OpenAI-совместимом эндпоинте, так что сравнение это замена строки, а не три интеграции. ID моделей это deepseek/deepseek-v4-flash, google/gemini-3.6-flash и openai/gpt-5.6-luna.

Python

from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")

MODELS = [
    "deepseek/deepseek-v4-flash",
    "google/gemini-3.6-flash",
    "openai/gpt-5.6-luna",
]

prompt = "Refactor this function to remove the nested loop. Return only code."

for model in MODELS:
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    u = r.usage
    print(f"{model:32} in={u.prompt_tokens:6} out={u.completion_tokens:6}")

Логируйте completion_tokens, а не только задержку. Именно эта колонка показывает разницу в многословности на вашем собственном трафике, и это число, которого прайс вам не сообщает.

Node

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.ofox.io/v1",
  apiKey: process.env.OFOX_API_KEY,
});

const models = [
  "deepseek/deepseek-v4-flash",
  "google/gemini-3.6-flash",
  "openai/gpt-5.6-luna",
];

for (const model of models) {
  const r = await client.chat.completions.create({
    model,
    messages: [{ role: "user", content: "Summarize this changelog in 3 bullets." }],
  });
  console.log(model, r.usage.prompt_tokens, r.usage.completion_tokens);
}

Вызов, который DeepSeek не может выполнить

Тот же клиент, тот же эндпоинт, один блок контента, который меняет все. Отправьте это на google/gemini-3.6-flash или openai/gpt-5.6-luna, и получите ответ. Отправьте на deepseek/deepseek-v4-flash, и нет цены, при которой это работает.

import base64

img = base64.b64encode(open("screenshot.png", "rb").read()).decode()

r = client.chat.completions.create(
    model="google/gemini-3.6-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Which element is misaligned?"},
            {"type": "image_url",
             "image_url": {"url": f"data:image/png;base64,{img}"}},
        ],
    }],
)
print(r.choices[0].message.content)

Альтернативы

Если ни один из трех не подходит, соседи, которых стоит проверить, на том же эндпоинте. DeepSeek V4 Pro по прайсу $0.435 / $0.87, который листинг ofox округляет до $0.45 / $0.88, теперь более дорогой и ниже по баллу собрат по индексу AA, хотя он остается верным выбором, если у вас есть привязанное к нагрузке доказательство, что он выигрывает на ваших трейсах. GPT-5.6 Terra стоит выше Luna, когда flash-тира по-настоящему недостаточно. За пределами каталога ofox те же модели доступны напрямую от DeepSeek, Google AI Studio и OpenAI API, что является правильным выбором, если вам когда-либо нужен только один вендор и вы хотите снижение цены в тот день, когда оно выходит, а не тогда, когда маршрут догонит.

Страницы моделей с живыми ценами: DeepSeek V4 Flash, Gemini 3.6 Flash, GPT-5.6 Luna.

Источники