GLM-5.3-Flash против DeepSeek V4 Flash: ни у того, ни у другого нет одной цены

Ставка DeepSeek удваивается 21% недели, скидка GLM истекает 9 сентября. Победитель зависит от доли попаданий в кэш и от часов, в которые вы шлёте запросы.

GLM-5.3-Flash против DeepSeek V4 Flash: ни у того, ни у другого нет одной цены

Обе модели называются Flash, и ни у одной нет цены, которую можно вписать в ячейку таблицы. DeepSeek V4 Flash тарифицирует по часам суток и удваивает ставку на 21% недели. Дешёвая цифра у GLM-5.3-Flash — это акция с датой окончания. Так что «что дешевле» не имеет ответа, пока вы не назовёте, в какие часы шлёте запросы, какая у вас доля попаданий в кэш и сколько вывода вы генерируете.

Хорошая новость: все три величины считаются по опубликованным прайсам. Бенчмарк не нужен.

Цифры ниже взяты из документации по ценам DeepSeek и страницы цен Z.ai, сверено 2026-08-28. Раскрытие: Ofox перепродаёт обе модели, и один невыгодный для нас факт вынесен в четвёртый раздел.

Как выглядят прайсы на самом деле?

Их четыре, потому что каждый вендор публикует по два. Доллары США за миллион токенов.

GLM прайсGLM со скидкойDeepSeek вне пикаDeepSeek пик
Некэшированный вход0,150,0750,220,44
Вход из кэша0,030,0150,0070,014
Выход0,500,250,661,32

Два «вторых столбца» — это принципиально разные вещи, и различие важнее, чем кажется.

$0,075 у GLM — акция. На странице Z.ai написано прямо: «GLM-5.3-Flash is available at a 50% discount (strikethrough prices are list prices). The promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time)». После этого цена возвращается к $0,15 — один раз и насовсем.

Внепиковая ставка DeepSeek — не акция, а постоянная конструкция. Пик определён как «01:00 - 04:00 and 06:00 - 10:00 UTC, Monday through Friday», всё остальное внепиковое, и «off-peak rates are half of the peak rates». Это 35 часов из 168, то есть примерно 79% недели идёт по цене вдвое ниже.

Сколько из этих 79% достанется вам, зависит от часового пояса. По Москве пик — это 04:00–07:00 и 09:00–13:00. Первое окно целиком закрывается до начала рабочего дня, второе бьёт по утру. У команды, чей трафик следует за московским рабочим днём, реальная доля внепикового времени будет заметно ниже 79%, но всё же лучше, чем, скажем, в Японии, где пик ложится ровно на рабочие часы.

Почему у вопроса «что дешевле» нет одного ответа?

Потому что вендоры выигрывают на противоположных строках счёта.

Сравниваем прайс GLM с внепиковой ставкой DeepSeek, чтобы ни одна сторона не получала временного преимущества:

СтрокаGLM прайсDeepSeek вне пикаКто дешевле
Некэшированный вход$0,15$0,22GLM, в 1,47 раза
Выход$0,50$0,66GLM, в 1,32 раза
Вход из кэша$0,03$0,007DeepSeek, в 4,29 раза

Кэш у DeepSeek радикально дешевле, а вывод дороже. Это не мелкие расхождения в одну сторону, а крупные расхождения в противоположные, и что перевесит — свойство вашей нагрузки, а не самих моделей.

Классификатор длинных документов, который переигрывает один и тот же контекст и выдаёт двадцать токенов, живёт почти целиком на строке кэша. Кодовый агент, возвращающий несколько тысяч токенов за ход, живёт на строке вывода. Те же две модели, противоположные выводы.

Какая доля попаданий в кэш нужна DeepSeek, чтобы выиграть?

Здесь есть точный ответ, потому что он зависит только от опубликованных цен.

Пусть h — доля входных токенов, попавших в кэш, а r — отношение объёма вывода к объёму входа. Внепиковый DeepSeek дешевле GLM по прайсу, когда:

0,22(1-h) + 0,007h + 0,66r  <  0,15(1-h) + 0,03h + 0,50r

что сводится к:   h > (0,07 + 0,16r) / 0,093

Подставляем:

Вывод как доля входаНужная доля попаданий в кэш
Пренебрежимо малвыше 75%
5%выше 84%
10%выше 92%
Выше 14,4%недостижимо даже при 100%

Как только вывод превышает примерно 14,4% объёма входа, кэш, который дешевле в 4,29 раза, уже не вытягивает строку вывода, которая дороже в 1,32 раза. Скидка действует только на вход, а на выходе аналогичного рычага нет.

Поэтому выбор начинается не с прайса, а с двух чисел из ваших собственных логов: доли попаданий в кэш и отношения выходных токенов к входным. Большинство диалоговых и генеративных нагрузок сидят заметно выше 14,4%, и на этом можно остановиться. По-настоящему на стороне DeepSeek оказываются задачи с длинным контекстом, высокой повторяемостью и коротким выводом — форма агентного цикла, который раз за разом переигрывает большой системный промпт ради небольшого вызова инструмента. Соседний случай мы считали в сравнении Gemini 3.1 Flash Lite и DeepSeek V4 Flash для агентных циклов.

Почему наш собственный шлюз выставляет GLM в лучшем свете, чем следует?

Потому что мы тарифицируем эти две модели по-разному, и вам стоит знать это до того, как вы примете решение по нашему прайсу.

На нашей странице DeepSeek V4 Flash указаны $0,44 за вход, $1,32 за выход и $0,014 за чтение кэша. Сравните эти три числа с таблицей выше: это в точности пиковые ставки DeepSeek. Запрос через наш шлюз оплачивается по пиковой цене круглосуточно и никогда не попадает во внепиковое окно половинной стоимости, которое покрывает 79% недели.

С GLM мы поступаем иначе. На странице GLM-5.3-Flash стоят $0,075, $0,25 и $0,015 с зачёркнутым прайсом рядом — это акция Z.ai, транслированная без изменений. Когда она закончится 2026-09-09, наша страница поднимется вслед за ней.

Следствие простое и не в нашу пользу: сравнение этих моделей по нашему собственному прайсу преувеличивает преимущество GLM. Если вы принимаете решение по цифрам шлюза, сначала разделите столбец DeepSeek пополам и посмотрите ещё раз.

Чем модели различаются помимо цены?

Тремя вещами, все задокументированы.

Потолок вывода, разница в 2,9 раза. У DeepSeek V4 Flash это 384K выходных токенов, у GLM-5.3-Flash — 131 072. Контекст у обоих 1M, так что разница не в том, сколько можно подать на вход, а в том, сколько может вернуться за один вызов. Генерация длинного отчёта или крупной пачки структурированных записей упрётся в 131K раньше, чем во что-либо ещё.

Протоколы и конкурентность. DeepSeek публикует эндпоинт в формате OpenAI по адресу https://api.deepseek.com и в формате Anthropic по https://api.deepseek.com/anthropic, документирует лимит конкурентности 2500 для уровня flash и по умолчанию включает режим рассуждений с возможностью его отключить. Если вы переносите инструментарий, написанный под форму Anthropic, второй эндпоинт экономит заметный объём работы.

Веса и архитектура. GLM-5.3-Flash — модель с открытыми весами: 320B всего параметров, 18B активных, 45 слоёв; Z.ai называет её первой открытой frontier-моделью с гибридом разреженного и линейного внимания. Что именно определяет каждое из этих чисел, разобрано в материале о трёх числах параметров GLM-5.3-Flash. Документация DeepSeek об открытости весов V4 Flash не говорит ничего, поэтому мы не утверждаем ни того, ни другого.

Как выбирать?

Четыре шага по убыванию денежного эффекта.

  1. Достаньте из логов два числа до того, как открывать прайс: долю попаданий в кэш на входе и объём вывода как долю от входа. Таблица выше после этого отвечает на вопрос напрямую.
  2. Если вывод превышает 14,4% от входа — берите GLM и не считайте дальше. Преимущество DeepSeek по кэшу математически не способно закрыть этот разрыв.
  3. Для задач с длинным контекстом, высокой повторяемостью и коротким выводом считайте DeepSeek напрямую, а не через шлюз. И вычислите свою реальную долю внепикового времени, а не берите 79% на веру: если трафик следует за рабочим днём, утреннее пиковое окно съест ощутимую часть.
  4. Впишите 2026-09-09 в календарь. В этот день удельная цена GLM возвращается к прайсу. По прайсу GLM всё ещё впереди на некэшированном входе и на выводе, так что большинство выводов устоят, но проверьте свой, а не наследуйте чужой.

Детали эндпоинтов старшей модели — в руководстве по GLM 5.3 API, а рычаги экономии на стороне DeepSeek — в материале о том, как платить меньше за DeepSeek V4 Flash.

Оба вендора опубликовали правила целиком, вплоть до часов пикового окна. Остаётся не гадать, кто дешевле, а измерить, как выглядит ваша собственная нагрузка.

Источники

Часто задаваемые вопросы

Что дешевле: GLM-5.3-Flash или DeepSeek V4 Flash?
Ни у одного из них нет единой цены, поэтому вопросу нужны три входных параметра. Ставка DeepSeek удваивается в часы пиковой нагрузки; текущая цена GLM — это скидка 50%, у которой есть дата окончания. По прайсу GLM против внепикового DeepSeek: GLM дешевле на некэшированном входе ($0,15 против $0,22) и на выходе ($0,50 против $0,66), а DeepSeek дешевле в 4,29 раза на попаданиях в кэш ($0,007 против $0,03).
Когда у DeepSeek пиковые часы?
На странице цен DeepSeek пик определён как 01:00–04:00 и 06:00–10:00 UTC с понедельника по пятницу, всё остальное время — внепиковое, и «off-peak rates are half of the peak rates». Это 35 часов из 168, то есть примерно 79% времени вы платите по сниженной ставке. По Москве пик приходится на 04:00–07:00 и 09:00–13:00, и первая половина окна закрывается до начала рабочего дня.
Какая доля попаданий в кэш нужна, чтобы DeepSeek выиграл?
Зависит от объёма вывода. Против прайса GLM при пренебрежимо малом выводе внепиковому DeepSeek нужна доля попаданий выше 75%. При выводе в 5% от объёма входа — выше 84%, при 10% — выше 92%, а как только вывод превышает примерно 14,4% от входа, не спасают и 100%. Кэш DeepSeek дешевле в 4,29 раза, но вывод дороже в 1,32 раза, и эти два эффекта гасят друг друга.
Чем модели различаются помимо цены?
Сильнее всего — потолком вывода: у DeepSeek V4 Flash это 384K токенов против 131 072 у GLM-5.3-Flash, разница в 2,9 раза при контекстном окне 1M у обоих. DeepSeek публикует эндпоинты в форматах OpenAI и Anthropic, документированный лимит конкурентности 2500 для уровня flash и по умолчанию включает режим рассуждений. GLM-5.3-Flash — модель с открытыми весами: 320B всего параметров, 18B активных, 45 слоёв.
Меняет ли сравнение покупка через шлюз?
Может менять, и здесь меняет. На странице Ofox для DeepSeek V4 Flash указаны $0,44 за вход, $1,32 за выход и $0,014 за чтение кэша — это в точности пиковые ставки DeepSeek, то есть через шлюз вы платите пик круглосуточно и не получаете внепиковую половинную цену. Скидку GLM Ofox транслирует как есть. Из-за этой асимметрии на нашем собственном прайсе GLM выглядит выгоднее, чем при честном сравнении.