GLM-5.3-Flash против DeepSeek V4 Flash: ни у того, ни у другого нет одной цены
Ставка DeepSeek удваивается 21% недели, скидка GLM истекает 9 сентября. Победитель зависит от доли попаданий в кэш и от часов, в которые вы шлёте запросы.
Обе модели называются Flash, и ни у одной нет цены, которую можно вписать в ячейку таблицы. DeepSeek V4 Flash тарифицирует по часам суток и удваивает ставку на 21% недели. Дешёвая цифра у GLM-5.3-Flash — это акция с датой окончания. Так что «что дешевле» не имеет ответа, пока вы не назовёте, в какие часы шлёте запросы, какая у вас доля попаданий в кэш и сколько вывода вы генерируете.
Хорошая новость: все три величины считаются по опубликованным прайсам. Бенчмарк не нужен.
Цифры ниже взяты из документации по ценам DeepSeek и страницы цен Z.ai, сверено 2026-08-28. Раскрытие: Ofox перепродаёт обе модели, и один невыгодный для нас факт вынесен в четвёртый раздел.
Как выглядят прайсы на самом деле?
Их четыре, потому что каждый вендор публикует по два. Доллары США за миллион токенов.
| GLM прайс | GLM со скидкой | DeepSeek вне пика | DeepSeek пик | |
|---|---|---|---|---|
| Некэшированный вход | 0,15 | 0,075 | 0,22 | 0,44 |
| Вход из кэша | 0,03 | 0,015 | 0,007 | 0,014 |
| Выход | 0,50 | 0,25 | 0,66 | 1,32 |
Два «вторых столбца» — это принципиально разные вещи, и различие важнее, чем кажется.
$0,075 у GLM — акция. На странице Z.ai написано прямо: «GLM-5.3-Flash is available at a 50% discount (strikethrough prices are list prices). The promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time)». После этого цена возвращается к $0,15 — один раз и насовсем.
Внепиковая ставка DeepSeek — не акция, а постоянная конструкция. Пик определён как «01:00 - 04:00 and 06:00 - 10:00 UTC, Monday through Friday», всё остальное внепиковое, и «off-peak rates are half of the peak rates». Это 35 часов из 168, то есть примерно 79% недели идёт по цене вдвое ниже.
Сколько из этих 79% достанется вам, зависит от часового пояса. По Москве пик — это 04:00–07:00 и 09:00–13:00. Первое окно целиком закрывается до начала рабочего дня, второе бьёт по утру. У команды, чей трафик следует за московским рабочим днём, реальная доля внепикового времени будет заметно ниже 79%, но всё же лучше, чем, скажем, в Японии, где пик ложится ровно на рабочие часы.
Почему у вопроса «что дешевле» нет одного ответа?
Потому что вендоры выигрывают на противоположных строках счёта.
Сравниваем прайс GLM с внепиковой ставкой DeepSeek, чтобы ни одна сторона не получала временного преимущества:
| Строка | GLM прайс | DeepSeek вне пика | Кто дешевле |
|---|---|---|---|
| Некэшированный вход | $0,15 | $0,22 | GLM, в 1,47 раза |
| Выход | $0,50 | $0,66 | GLM, в 1,32 раза |
| Вход из кэша | $0,03 | $0,007 | DeepSeek, в 4,29 раза |
Кэш у DeepSeek радикально дешевле, а вывод дороже. Это не мелкие расхождения в одну сторону, а крупные расхождения в противоположные, и что перевесит — свойство вашей нагрузки, а не самих моделей.
Классификатор длинных документов, который переигрывает один и тот же контекст и выдаёт двадцать токенов, живёт почти целиком на строке кэша. Кодовый агент, возвращающий несколько тысяч токенов за ход, живёт на строке вывода. Те же две модели, противоположные выводы.
Какая доля попаданий в кэш нужна DeepSeek, чтобы выиграть?
Здесь есть точный ответ, потому что он зависит только от опубликованных цен.
Пусть h — доля входных токенов, попавших в кэш, а r — отношение объёма вывода к объёму входа. Внепиковый DeepSeek дешевле GLM по прайсу, когда:
0,22(1-h) + 0,007h + 0,66r < 0,15(1-h) + 0,03h + 0,50r
что сводится к: h > (0,07 + 0,16r) / 0,093
Подставляем:
| Вывод как доля входа | Нужная доля попаданий в кэш |
|---|---|
| Пренебрежимо мал | выше 75% |
| 5% | выше 84% |
| 10% | выше 92% |
| Выше 14,4% | недостижимо даже при 100% |
Как только вывод превышает примерно 14,4% объёма входа, кэш, который дешевле в 4,29 раза, уже не вытягивает строку вывода, которая дороже в 1,32 раза. Скидка действует только на вход, а на выходе аналогичного рычага нет.
Поэтому выбор начинается не с прайса, а с двух чисел из ваших собственных логов: доли попаданий в кэш и отношения выходных токенов к входным. Большинство диалоговых и генеративных нагрузок сидят заметно выше 14,4%, и на этом можно остановиться. По-настоящему на стороне DeepSeek оказываются задачи с длинным контекстом, высокой повторяемостью и коротким выводом — форма агентного цикла, который раз за разом переигрывает большой системный промпт ради небольшого вызова инструмента. Соседний случай мы считали в сравнении Gemini 3.1 Flash Lite и DeepSeek V4 Flash для агентных циклов.
Почему наш собственный шлюз выставляет GLM в лучшем свете, чем следует?
Потому что мы тарифицируем эти две модели по-разному, и вам стоит знать это до того, как вы примете решение по нашему прайсу.
На нашей странице DeepSeek V4 Flash указаны $0,44 за вход, $1,32 за выход и $0,014 за чтение кэша. Сравните эти три числа с таблицей выше: это в точности пиковые ставки DeepSeek. Запрос через наш шлюз оплачивается по пиковой цене круглосуточно и никогда не попадает во внепиковое окно половинной стоимости, которое покрывает 79% недели.
С GLM мы поступаем иначе. На странице GLM-5.3-Flash стоят $0,075, $0,25 и $0,015 с зачёркнутым прайсом рядом — это акция Z.ai, транслированная без изменений. Когда она закончится 2026-09-09, наша страница поднимется вслед за ней.
Следствие простое и не в нашу пользу: сравнение этих моделей по нашему собственному прайсу преувеличивает преимущество GLM. Если вы принимаете решение по цифрам шлюза, сначала разделите столбец DeepSeek пополам и посмотрите ещё раз.
Чем модели различаются помимо цены?
Тремя вещами, все задокументированы.
Потолок вывода, разница в 2,9 раза. У DeepSeek V4 Flash это 384K выходных токенов, у GLM-5.3-Flash — 131 072. Контекст у обоих 1M, так что разница не в том, сколько можно подать на вход, а в том, сколько может вернуться за один вызов. Генерация длинного отчёта или крупной пачки структурированных записей упрётся в 131K раньше, чем во что-либо ещё.
Протоколы и конкурентность. DeepSeek публикует эндпоинт в формате OpenAI по адресу https://api.deepseek.com и в формате Anthropic по https://api.deepseek.com/anthropic, документирует лимит конкурентности 2500 для уровня flash и по умолчанию включает режим рассуждений с возможностью его отключить. Если вы переносите инструментарий, написанный под форму Anthropic, второй эндпоинт экономит заметный объём работы.
Веса и архитектура. GLM-5.3-Flash — модель с открытыми весами: 320B всего параметров, 18B активных, 45 слоёв; Z.ai называет её первой открытой frontier-моделью с гибридом разреженного и линейного внимания. Что именно определяет каждое из этих чисел, разобрано в материале о трёх числах параметров GLM-5.3-Flash. Документация DeepSeek об открытости весов V4 Flash не говорит ничего, поэтому мы не утверждаем ни того, ни другого.
Как выбирать?
Четыре шага по убыванию денежного эффекта.
- Достаньте из логов два числа до того, как открывать прайс: долю попаданий в кэш на входе и объём вывода как долю от входа. Таблица выше после этого отвечает на вопрос напрямую.
- Если вывод превышает 14,4% от входа — берите GLM и не считайте дальше. Преимущество DeepSeek по кэшу математически не способно закрыть этот разрыв.
- Для задач с длинным контекстом, высокой повторяемостью и коротким выводом считайте DeepSeek напрямую, а не через шлюз. И вычислите свою реальную долю внепикового времени, а не берите 79% на веру: если трафик следует за рабочим днём, утреннее пиковое окно съест ощутимую часть.
- Впишите 2026-09-09 в календарь. В этот день удельная цена GLM возвращается к прайсу. По прайсу GLM всё ещё впереди на некэшированном входе и на выводе, так что большинство выводов устоят, но проверьте свой, а не наследуйте чужой.
Детали эндпоинтов старшей модели — в руководстве по GLM 5.3 API, а рычаги экономии на стороне DeepSeek — в материале о том, как платить меньше за DeepSeek V4 Flash.
Оба вендора опубликовали правила целиком, вплоть до часов пикового окна. Остаётся не гадать, кто дешевле, а измерить, как выглядит ваша собственная нагрузка.
Источники
Часто задаваемые вопросы
- Что дешевле: GLM-5.3-Flash или DeepSeek V4 Flash?
- Ни у одного из них нет единой цены, поэтому вопросу нужны три входных параметра. Ставка DeepSeek удваивается в часы пиковой нагрузки; текущая цена GLM — это скидка 50%, у которой есть дата окончания. По прайсу GLM против внепикового DeepSeek: GLM дешевле на некэшированном входе ($0,15 против $0,22) и на выходе ($0,50 против $0,66), а DeepSeek дешевле в 4,29 раза на попаданиях в кэш ($0,007 против $0,03).
- Когда у DeepSeek пиковые часы?
- На странице цен DeepSeek пик определён как 01:00–04:00 и 06:00–10:00 UTC с понедельника по пятницу, всё остальное время — внепиковое, и «off-peak rates are half of the peak rates». Это 35 часов из 168, то есть примерно 79% времени вы платите по сниженной ставке. По Москве пик приходится на 04:00–07:00 и 09:00–13:00, и первая половина окна закрывается до начала рабочего дня.
- Какая доля попаданий в кэш нужна, чтобы DeepSeek выиграл?
- Зависит от объёма вывода. Против прайса GLM при пренебрежимо малом выводе внепиковому DeepSeek нужна доля попаданий выше 75%. При выводе в 5% от объёма входа — выше 84%, при 10% — выше 92%, а как только вывод превышает примерно 14,4% от входа, не спасают и 100%. Кэш DeepSeek дешевле в 4,29 раза, но вывод дороже в 1,32 раза, и эти два эффекта гасят друг друга.
- Чем модели различаются помимо цены?
- Сильнее всего — потолком вывода: у DeepSeek V4 Flash это 384K токенов против 131 072 у GLM-5.3-Flash, разница в 2,9 раза при контекстном окне 1M у обоих. DeepSeek публикует эндпоинты в форматах OpenAI и Anthropic, документированный лимит конкурентности 2500 для уровня flash и по умолчанию включает режим рассуждений. GLM-5.3-Flash — модель с открытыми весами: 320B всего параметров, 18B активных, 45 слоёв.
- Меняет ли сравнение покупка через шлюз?
- Может менять, и здесь меняет. На странице Ofox для DeepSeek V4 Flash указаны $0,44 за вход, $1,32 за выход и $0,014 за чтение кэша — это в точности пиковые ставки DeepSeek, то есть через шлюз вы платите пик круглосуточно и не получаете внепиковую половинную цену. Скидку GLM Ofox транслирует как есть. Из-за этой асимметрии на нашем собственном прайсе GLM выглядит выгоднее, чем при честном сравнении.


