Qwen 3.7 Max vs Kimi K3 vs DeepSeek V4: разрыв в цене 34x

Один и тот же набор оценок: Kimi K3 набирает 57 и стоит $2437 за прогон. DeepSeek V4 Flash набирает 50 и стоит $72. Qwen 3.7 Max набирает 46 за $1604.

Qwen 3.7 Max vs Kimi K3 vs DeepSeek V4: разрыв в цене 34x

Три семейства китайских флагманов, один набор бенчмарков и разброс в 34 раза по стоимости его прохождения. Разрыв в способностях между лучшей и худшей — 13 баллов индекса. Разрыв в счёте — $2365.

  • Самая способная: Kimi K3 (max), 57 по Artificial Analysis Intelligence Index v4.1
  • Лучшая по соотношению с большим отрывом: DeepSeek V4 Flash 0731, 50 баллов за $72.02 на прогон индекса
  • Самая быстрая: Qwen 3.7 Max, 206.4 выходных токена в секунду
  • Неожиданность: самая дешёвая модель группы обходит оба флагмана, которые дороже её
  • Все четыре сегодня есть на ofox, так что переключение — это смена идентификатора модели

Три постамента почти одинаковой высоты, перед каждым стопка круглых жетонов резко разной высоты, самая высокая стопка ярко-оранжевая; плоская изометрия на тёплом сером фоне

TL;DR: что выбрать

Ваша ситуацияВыборПочему
Самые сложные рассуждения, бюджет не ограничениеKimi K3Лучший результат из четырёх, 57 баллов
Много агентских циклов, решает стоимостьDeepSeek V4 Flash 073150 баллов, тот же прогон дешевле K3 в 34 раза
Задержка важнее последних балловQwen 3.7 Max206.4 tok/s против 35 у K3
Нужен ввод изображенийKimi K3 или Qwen 3.8 MaxОстальные три в каталоге текстовые
Вы сегодня на DeepSeek V4 ProПересмотретьFlash 0731 на 6 баллов выше и в 2.4 раза дешевле в прогоне
Выбираете модель по умолчанию под смешанную нагрузкуDeepSeek V4 Flash 0731Баллы на доллар лучше на порядок, плюс контекст 1M
Нужен самый новый QwenQwen 3.8 MaxДешевле 3.7 Max, но сторонней оценки пока нет

Два повода закончить чтение здесь. Если ваши месячные траты на токены меньше примерно $200, берите DeepSeek V4 Flash и идите дальше: ни одна оптимизация ниже не стоит потраченного вечера. Если у вас продакшен-циклы дороже $2000 в месяц, переходите сразу к разделу про стоимость прогона, потому что 34 раза живут именно там.

Краткое сравнение характеристик

Все цифры ниже взяты из каталога моделей ofox, живой запрос 2026-08-03.

Kimi K3DeepSeek V4 FlashDeepSeek V4 ProQwen 3.7 Max
Идентификаторmoonshotai/kimi-k3deepseek/deepseek-v4-flashdeepseek/deepseek-v4-probailian/qwen3.7-max
Вход / 1M$3.00$0.14$0.45$2.50
Выход / 1M$15.00$0.28$0.88$7.50
Чтение кеша / 1M$0.30$0.0028$0.0037$0.50
Контекстное окно1 048 5761 000 0001 000 0001 064 000
Максимум вывода1 048 576384 000384 00064 000
Входные модальностиТекст, изображениеТекстТекстТекст
Открытые весаДаДа (MIT)ДаНет

В этой таблице стоит задержаться на трёх вещах.

Колонка чтения кеша — это не разница в округлении. DeepSeek берёт $0.0028 за 1M кешированных входных токенов. Qwen 3.7 Max за то же самое берёт $0.50, это в 179 раз больше, а K3 берёт $0.30, это в 107 раз больше. Для нагрузки с большим стабильным системным промптом, который читают много раз, счёт определяет именно ставка чтения кеша, а не заметная ставка входа.

Потолок вывода в 64K у Qwen 3.7 Max самый жёсткий из четырёх: в шесть раз ниже, чем у DeepSeek, и в шестнадцать, чем у K3. Если ваша задача звучит как «прочитать большой репозиторий и выдать большой артефакт», именно этот потолок сработает первым. Qwen 3.8 Max поднимает его до 131K, подробности в разборе запуска Qwen 3.8 Max.

Только у K3 есть и открытые веса, и результат фронтир-уровня. Веса DeepSeek под MIT и доступны для скачивания, но лучший результат здесь у дешёвой модели, а не у флагмана. У Qwen 3.7 Max открытых весов нет вовсе, хотя Alibaba анонсировала открытие весов модели класса Max на неделю 2026-08-10.

Что показывает единая линейка

Artificial Analysis Intelligence Index v4.1, снимок 2026-08-03. Это единственный источник в статье, который измеряет все четыре модели одинаково, поэтому всё сравнение закреплено на нём.

МодельБалл индексаМесто в группе
Kimi K3 (max)571
DeepSeek V4 Flash 0731502
Qwen 3.7 Max463
DeepSeek V4 Pro (Reasoning, Max Effort)444

Индекс собран из девяти оценок: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience и AA-LCR.

Читайте порядок, а не абсолютные числа. Это скользящий рейтинг, который пересчитывают при смене версии индекса и сборок моделей, поэтому «K3 первый, Flash второй» состарится лучше, чем «57 и 50». Разрыв в четыре балла между Flash и Qwen 3.7 Max лежит в пределах того, что может сдвинуть один перепрогон.

Что не меняется, так это направление неожиданности: самая дешёвая модель группы стоит выше двух флагманов, один из которых от того же вендора.

Три вещи могут изменить этот порядок, и все три реальны в пределах квартала:

  • Qwen 3.8 Max получит оценку. Он дешевле 3.7 Max, и собственная таблица Alibaba ставит его заметно выше предшественника. Если он приземлится рядом с K3 по $2.00 / $6.00, колонка выгоды перестроится.
  • Выйдет новая сборка DeepSeek. Переобучение 0731 сдвинуло Flash на 10 баллов без смены архитектуры. Ничто не говорит, что это было в последний раз.
  • Сменится версия индекса. В v4.1 добавили и перевзвесили оценки; v4.2 вполне может поменять местами модели с разницей в четыре балла, при том что сами модели не изменятся.

Это и есть довод в пользу того, чтобы перепрогонять собственные оценки ежеквартально, а не наследовать рейтинг из статьи, включая эту.

Каждый вендор публикует и свою таблицу, но между собой они несопоставимы. Таблица Qwen для 3.8 Max сравнивает с Claude и GPT на харнессах, которые выбрал сам Qwen. Таблица запуска K3 у Moonshot даёт Terminal-Bench 2.1 на уровне 88.3 при лидере 88.8, то есть это второе место, а не победа. Собственная цифра DeepSeek по Terminal-Bench для V4 Flash выше той, что Artificial Analysis замерила для той же модели. Это разные схемы измерения, и смешивание их в одну таблицу — верный способ обессмыслить сравнение.

Сколько на самом деле стоит один прогон оценок

Именно эта цифра переворачивает всё сравнение. Artificial Analysis публикует полную стоимость прогона собственного индекса на каждой модели, так что это реальный счёт за идентичную нагрузку, а не умножение прайса.

МодельБаллСгенерировано выходных токеновСтоимость прогона индекса
Kimi K3 (max)57130M$2437.41
Qwen 3.7 Max46100M$1604.13
DeepSeek V4 Pro44180M$176.34
DeepSeek V4 Flash 073150210M$72.02

Производные от этих четырёх строк (derived):

  • K3 стоит в 33.8 раза дороже V4 Flash за +7 баллов.
  • Qwen 3.7 Max стоит в 22.3 раза дороже V4 Flash и при этом проигрывает 4 балла.
  • V4 Pro стоит в 2.4 раза дороже V4 Flash и при этом проигрывает 6 баллов.
  • K3 стоит в 1.5 раза дороже Qwen 3.7 Max за +11 баллов.

Одно замечание по ценовым колонкам: Artificial Analysis указывает DeepSeek V4 Pro по $0.435 / $0.87, а каталог ofox округляет до $0.45 / $0.88. Цифры стоимости прогона взяты у Artificial Analysis и используют её ставки; таблица характеристик выше использует каталожные.

Только одно из этих четырёх сопоставлений описывает сделку. Остальные три описывают модель, которая одновременно хуже и дороже.

Надбавка за K3 хотя бы объяснима: вы платите в 1.5 раза больше, чем за Qwen 3.7 Max, и получаете честные 11 баллов, а если ваша работа упирается в самые сложные рассуждения, это рациональная покупка. Платить в 22 раза больше, чем за V4 Flash, и набирать на четыре балла меньше — это не сделка, а следствие того, что после 2026-07-31 никто не перепрогонял цифры.

Почему самая дешёвая модель обходит два флагмана

Потому что 0731 была переобучением, а не новой моделью, и сдвинула результат на 10 баллов. DeepSeek V4 Flash 0731 сохранила ту же MoE-архитектуру на 284B суммарно и 13B активных, и вернулась с 50 баллами против 40 у предыдущей сборки.

Вторая половина ответа — многословность, и она играет против DeepSeek.

  • V4 Flash сгенерировала 210M выходных токенов на индексе, больше всех четырёх.
  • Qwen 3.7 Max сгенерировала 100M, меньше всех.
  • То есть на одной и той же работе Flash выдаёт в 2.1 раза больше токенов, чем Qwen.

Поэтому фактический разрыв меньше прайсового. Ставка вывода у Qwen 3.7 Max в 26.8 раза выше, чем у Flash ($7.50 против $0.28), но реальные счета за индекс разошлись в 22.3 раза. Flash возвращает примерно пятую часть своего ценового преимущества тем, что больше говорит, и всё равно выигрывает с огромным запасом.

У DeepSeek режим размышления включён по умолчанию, а токены рассуждения тарифицируются как выходные — отсюда и многословность. Его можно выключить. Но вместе с ним вы отдаёте часть того результата, который поднял Flash выше двух флагманов, так что измерьте оба режима на своих промптах, прежде чем решать.

Практическая версия этого раздела: прайс за токен — плохой заменитель стоимости. Две модели с разницей ставок в 27 раз закончили одну работу с разницей в 22 раза, а две модели с разницей ставок в 1.5 раза — с разницей в 2.4 раза. Расход токенов различается между моделями сильнее, чем цены.

Во что это обойдётся в месяц

Набор бенчмарков — это не ваша нагрузка. Ниже то же сравнение на конкретной команде, по каталожным ставкам ofox из таблицы характеристик.

Сценарий: 5 разработчиков с кодинг-агентом.

  • 40 задач на разработчика в день, 21 рабочий день
  • Медианная задача: 12 000 входных токенов контекста репозитория, 3000 выходных
  • 40% входа попадает в кеш промптов

Месячный объём на разработчика: 10.08M входных токенов (4.03M из кеша, 6.05M без) и 2.52M выходных.

Кеш-входНекеш-входВыходНа разработчикаКоманда из 5
Kimi K3$1.21$18.14$37.80$57.15$285.77
Qwen 3.7 Max$2.02$15.12$18.90$36.04$180.18
DeepSeek V4 Pro$0.01$2.72$2.22$4.95$24.77
DeepSeek V4 Flash$0.01$0.85$0.71$1.56$7.82

Между K3 и Flash выходит 36.5 раза, близко к 33.8, которые дал прогон индекса. Две совершенно разные нагрузки, дающие одно и то же соотношение, — разумный признак того, что соотношение реально.

К этой таблице нужна одна поправка, и она не в пользу Flash. Она исходит из того, что каждая модель выдаёт 3000 выходных токенов на задачу, а прогон индекса говорит, что это неверно: на идентичной работе Flash выдала в 2.1 раза больше токенов, чем Qwen. Умножьте строку вывода Flash на 2.1, и месячная стоимость команды вырастет с $7.82 примерно до $11.70, а разрыв с K3 сократится с 36.5 до примерно 24 раз.

Всё ещё 24 раза. Налог на многословность реален, но и близко не закрывает эту пропасть.

Где этот сценарий может вас ввести в заблуждение:

  • Доля попаданий в кеш здесь делает многое. При 40% попаданий почти бесплатное чтение кеша у DeepSeek почти незаметно, потому что абсолютные суммы малы. На нагрузке с системным промптом в 200K токенов, который читают сотни раз в день, эта колонка становится всем счётом, и разрыв только растёт.
  • Здесь оценены токены, а не результаты. Если K3 доводит задачу, которую Flash перезапускает трижды, стоимость повторов и время инженера перекроют всё выше.
  • Ставки меняются. Обе сборки DeepSeek за последний квартал меняли и цену, и результат. Возьмите актуальные цифры, прежде чем закладываться.

Насколько они быстрые

Qwen 3.7 Max быстрее Kimi K3 по выходной пропускной способности в 5.9 раза.

МодельВыходных токенов/с
Qwen 3.7 Max206.4
DeepSeek V4 Pro55.0
Kimi K3 (max)35
DeepSeek V4 Flash 0731нет опубликованных данных

Artificial Analysis помечает K3 как заметно медленный, а V4 Pro как ниже среднего, тогда как Qwen 3.7 Max заметно выше среднего в своей ценовой категории. Для сборки Flash 0731 на момент написания замера скорости опубликовано не было, поэтому строка остаётся пустой, а не берёт цифру предыдущей сборки.

Скорость меняет не то же, что баллы. Разрыв в 12 баллов проявляется как способность или неспособность довести задачу. Разрыв в 5.9 раза по пропускной способности проявляется как превращение сорокаминутного прогона агента в четырёхчасовой. Для интерактивных инструментов и длинных автономных циклов именно второе чаще оказывается тем ограничением, которое реально чувствуют.

Когда стоит брать Kimi K3

Когда задача проваливается на остальных трёх, а цена провала выше цены токенов.

Конкретные признаки:

  • Ваши оценки показывают, что другие модели именно проваливают класс задач, а не делают их чуть хуже.
  • Нужен ввод изображений вместе с рассуждениями фронтир-уровня. Мы проверили это через шлюз 2026-08-03: изображение подняло число промпт-токенов с 97 до 189 и вернуло корректное описание, так что зрение работает, а не просто числится.
  • Нужен очень длинный единичный ответ. Максимум вывода K3 в 1 048 576 токенов в 16 раз выше потолка Qwen 3.7 Max.
  • Нужны открытые веса именно у лучшей по баллам модели: у K3 они есть, у Qwen 3.7 Max нет.

Признаки, что выбор неверный: высокий поток запросов, чувствительный к задержкам интерфейс или любая нагрузка, где вы не измерили разницу в качестве. При 35 токенах в секунду и $15 за 1M вывода K3 наказывает и за объём, и за нетерпение. Как он выглядит за пределами китайской группы — в сравнении Kimi K3 с GPT-5.5 и Opus 4.8, а настройка — в материале как использовать Kimi K3.

Когда стоит брать DeepSeek V4 Flash

По умолчанию, пока что-нибудь не заставит его провалиться.

Он второй из четырёх, дешевле на порядок, имеет окно 1M и потолок вывода 384K, и поставляется с открытыми весами под MIT. Аргументы против узкие:

  • Только текст. Ввода изображений нет, поэтому любой конвейер со скриншотами или документами-картинками отпадает.
  • Многословен. 210M выходных токенов на индексе, больше всех четырёх. Закладывайте бюджет на токены рассуждения и ставьте потолок max_tokens в длинных циклах.
  • На 7 баллов ниже K3. Это реально и скажется на самой сложной части работы.

Если вы сейчас на DeepSeek V4 Pro, действовать нужно именно по этому разделу. Flash 0731 на 6 баллов выше, а прогон индекса вышел в 2.4 раза дешевле. Любое правило маршрутизации, отправляющее сложное на Pro, а простое на Flash, написано под сборку, которой больше нет. Межвендорское сравнение в бюджетной категории — в материале V4 Flash против Gemini 3.6 Flash.

Когда стоит брать Qwen

Когда ограничение — пропускная способность, или когда вы уже внутри экосистемы Alibaba.

Аргумент Qwen 3.7 Max в этой группе — скорость: 206.4 выходных токена в секунду, почти вчетверо больше V4 Pro и почти вшестеро больше K3. Для чат-продукта, где пользователь смотрит на появляющиеся токены, или для агентского цикла, который меряют временем, а не долларами, это реальная продуктовая разница, которую не ловит ни один балл индекса.

Аргумент против в том, что на этих цифрах он средний по способностям и высокий по цене, а это неудобное место. Он на четыре балла ниже модели, которая прогоняет тот же набор в 22 раза дешевле.

И он больше не самый новый у Alibaba. Qwen 3.8 Max вышел 2026-08-03 по $2.00/$6.00, дешевле 3.7 Max с обеих сторон, с потолком вывода 131K и вводом изображений. В это сравнение он не попал, потому что на момент написания у Artificial Analysis не было для него страницы и нет сопоставимой оценки. Если вы сегодня выбираете Qwen, а не сравниваете опубликованные цифры, начинать стоит с 3.8 Max. Про более дешёвого собрата — в сравнении 3.7 Plus и 3.7 Max.

Когда не стоит брать ни одну из них

Три случая, когда неверна вся полка:

  • Нужен ввод видео. Через шлюз его не принимает ни одна из четырёх. Запись Qwen 3.8 Max в каталоге перечисляет только текст и изображение, хотя на собственной странице QwenCloud видео указано.
  • Нужна конкретная фронтир-способность, которой у них нет. Если ваши оценки откалиброваны под поведение Claude или GPT, разница в 7 баллов индекса не скажет вам, безопасна ли замена. Прогоните собственный набор.
  • Ваше узкое место не модель. Если баг в retrieval или плохой промпт стоят вам дороже счёта за токены, ни одна цифра из этой статьи не поможет.

Попробовать все три через ofox: A/B в 10 строк

Все четыре модели лежат в одном каталоге, так что сравнение — это цикл по идентификаторам, а не четыре интеграции.

Python: один промпт через все четыре модели

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("OFOX_API_KEY"),
    base_url="https://api.ofox.io/v1",
)

MODELS = [
    "moonshotai/kimi-k3",
    "deepseek/deepseek-v4-flash",
    "deepseek/deepseek-v4-pro",
    "bailian/qwen3.7-max",
]

prompt = "Отрефактори этот модуль и объясни риски миграции."

for model in MODELS:
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
        max_tokens=2048,
    )
    u = r.usage
    print(f"{model:<32} out={u.completion_tokens:<7} total={u.total_tokens}")

Node: та же форма

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.OFOX_API_KEY,
  baseURL: "https://api.ofox.io/v1",
});

for (const model of ["moonshotai/kimi-k3", "deepseek/deepseek-v4-flash", "bailian/qwen3.7-max"]) {
  const r = await client.chat.completions.create({
    model,
    messages: [{ role: "user", content: prompt }],
    max_tokens: 2048,
  });
  console.log(model, r.usage.completion_tokens);
}

Печатайте completion_tokens, а не только задержку. Весь смысл таблицы стоимости выше в том, что расход токенов между этими моделями различается сильнее, чем цены, поэтому число выходных токенов на ваших собственных промптах ценнее любого опубликованного индекса.

Одна оговорка про каталог. Запись K3 перечисляет только /v1/chat/completions, а записи Qwen и DeepSeek — ещё и /v1/responses. Это поле уже ошибалось в обе стороны, поэтому отправьте один реальный запрос по тому протоколу, который планируете использовать, вместо того чтобы закладываться на метаданные. Актуальные ставки — на страницах моделей Kimi K3, DeepSeek V4 Flash и Qwen 3.7 Max.

FAQ

Какая китайская модель лучшая в 2026 году? По Artificial Analysis Intelligence Index v4.1 на снимке 2026-08-03 лучший результат в этой группе у Kimi K3 (max) — 57 баллов. По баллам на доллар DeepSeek V4 Flash 0731 выигрывает примерно на порядок.

Стоит ли Kimi K3 своей цены против DeepSeek V4 Flash? Он покупает 7 баллов индекса за 33.8-кратную стоимость того же прогона. Это оправдано только если конкретный класс задач проваливается на Flash и проходит на K3, а это надо измерить на своих промптах.

Есть ли у DeepSeek V4 Flash открытые веса? Есть. Сборка 0731 лежит на Hugging Face как deepseek-ai/DeepSeek-V4-Flash-0731 под MIT, в fp8, без гейтинга.

Почему в сравнении Qwen 3.7 Max, а не 3.8 Max? Потому что на момент написания у 3.8 Max не было страницы Artificial Analysis, то есть нет оценки, измеренной так же, как у остальных трёх. Qwen 3.7 Max — самый новый Qwen с сопоставимой сторонней цифрой.

У какой модели самый большой потолок вывода? У Kimi K3, 1 048 576 токенов. Две модели DeepSeek дают 384 000, Qwen 3.7 Max — 64 000.

Кто-нибудь из них поддерживает зрение? Kimi K3 поддерживает, проверено через шлюз 2026-08-03. Qwen 3.8 Max поддерживает. Qwen 3.7 Max и обе модели DeepSeek V4 в каталоге текстовые.

Стоимость индекса от Artificial Analysis равна моему счёту? Нет. Это один конкретный набор из 9 оценок, поэтому он говорит о соотношении между моделями на фиксированной нагрузке, а не о вашей абсолютной трате. Используйте его для ранжирования, а потом измеряйте на своих промптах.

Проверенные источники

Часто задаваемые вопросы

Что лучше: Qwen 3.7 Max, Kimi K3 или DeepSeek V4?
По Artificial Analysis Intelligence Index v4.1 (снимок 2026-08-03) Kimi K3 (max) набирает 57, DeepSeek V4 Flash 0731 — 50, Qwen 3.7 Max — 46, DeepSeek V4 Pro — 44. То есть K3 самый способный из четырёх, а V4 Flash идёт вторым, обходя оба флагмана, которые стоят заметно дороже за токен. Но порядок по способностям не равен порядку по выгоде: прогон одного и того же индекса обошёлся в $2437.41 на K3 и в $72.02 на V4 Flash.
Сколько стоит прогнать одну и ту же нагрузку на каждой модели?
Artificial Analysis публикует полную стоимость собственного прогона Intelligence Index по каждой модели — это самая чистая сопоставимая цифра из доступных. На снимке 2026-08-03: Kimi K3 (max) $2437.41, Qwen 3.7 Max $1604.13, DeepSeek V4 Pro $176.34, DeepSeek V4 Flash 0731 $72.02. Разброс между самой дорогой и самой дешёвой — 33.8 раза при разнице в 7 баллов индекса.
DeepSeek V4 Flash действительно лучше V4 Pro?
На этом индексе да. V4 Flash 0731 набирает 50 против 44 у V4 Pro, а прогон индекса стоил $72.02 на Flash против $176.34 на Pro. Сборка 0731 была переобучением на той же архитектуре, а не новой моделью, и подняла результат Flash на 10 баллов. Если ваше решение по маршрутизации на V4 Pro принято до 2026-07-31, стоит перепрогнать свои оценки перед продлением.
Почему Kimi K3 такой дорогой?
Складываются две вещи. Цены за токен у него самые высокие в группе: $3.00 на входе и $15.00 на выходе за 1M. И он медленный — 35 выходных токенов в секунду по замеру Artificial Analysis. Цена за токен видна в счёте, скорость видна в реальном времени вашего агентского цикла. При этом K3 остаётся лучшим по баллам из четырёх, так что надбавка покупает что-то настоящее, просто недёшево.
А как же Qwen 3.8 Max?
Qwen 3.8 Max вышел 2026-08-03 по $2.00 на входе и $6.00 на выходе за 1M, дешевле 3.7 Max с обеих сторон, с потолком вывода 131K вместо 64K. Он сознательно не включён в таблицу: на момент написания у Artificial Analysis не было для него страницы, то есть нет оценки, измеренной тем же способом. Подмешивать в стороннюю таблицу цифру от вендора значит сломать ту сопоставимость, на которой держится вся статья.
Какие из этих моделей принимают изображения?
Kimi K3 и Qwen 3.8 Max. Qwen 3.7 Max, DeepSeek V4 Pro и V4 Flash в каталоге ofox указаны как текстовые. K3 мы проверили через шлюз 2026-08-03: изображение подняло число промпт-токенов с 97 до 189 и вернуло корректное описание, так что ввод изображений работает, а не просто числится в поле.
Можно ли работать со всеми через один ключ API?
Да. Все четыре модели есть в каталоге ofox как bailian/qwen3.7-max, moonshotai/kimi-k3, deepseek/deepseek-v4-pro и deepseek/deepseek-v4-flash, поэтому переключение — это смена идентификатора модели, а не новая интеграция. Именно это делает A/B на ваших собственных промптах достаточно дешёвым, чтобы его действительно провели, и это важнее любого опубликованного индекса.
Какая модель самая быстрая?
Qwen 3.7 Max, с большим отрывом. Artificial Analysis замеряет 206.4 выходных токена в секунду против 55.0 у DeepSeek V4 Pro и 35 у Kimi K3, страницу которого описывают как заметно медленную. Для сборки V4 Flash 0731 на момент написания скорость опубликована не была. В длинном агентском цикле разница в пропускной способности в 5.9 раза меняет ход рабочего дня сильнее, чем несколько баллов индекса.