Скидки на LLM API: 13 моделей ниже прайса вендора

Тринадцать моделей из пяти серий тарифицируются ниже зачёркнутой цены. Сверили с прайсами вендоров: где скидка настоящая, а где это акция самого вендора.

Скидки на LLM API: 13 моделей ниже прайса вендора

Тринадцать моделей из пяти серий прямо сейчас тарифицируются на ofox ниже своей зачёркнутой цены. Страница best-value перечисляет их по размеру скидки, и на неё стоит потратить две минуты — но интересна там не процентовка.

Интересно, от чего каждый процент отсчитан. Три этих снижения означают три разные вещи, и только в одном случае шлюз выкладывает на стол собственную маржу.

Какие модели идут со скидкой

Пять серий: GPT, Gemini, GLM, Doubao и Seedance. Текстовые модели тарифицируются за миллион токенов, Seedance — за секунду вывода.

МодельВход / 1MВыход / 1MКешированный вход
openai/gpt-5.6-luna$0.20$1.20$0.02
openai/gpt-5.6-terra$2.00$12.00$0.20
openai/gpt-5.6-sol$2.50$15.00$0.25
google/gemini-3.7-flash$0.75$3.75$0.075
google/gemini-3.6-flash$0.75$3.75$0.075
z-ai/glm-5.2$0.98$3.08$0.182
z-ai/glm-5.3$1.26$3.96$0.234
volcengine/doubao-seed-2.1-pro$0.7072$3.536$0.1416
volcengine/doubao-seed-2.1-turbo$0.3536$1.7696$0.068

Четыре модели Seedance считаются по другому счётчику: seedance-2.0-mini от $0.02 за секунду вывода, seedance-2.0-fast — $0.042, seedance-2.0 — $0.063, а seedance-2.5 — от $0.11 на 480p, $0.48 на 1080p text-to-video и $0.568 на 1080p video-to-video. Последняя модель тарифицируется по разрешению и режиму, а не одним числом, поэтому страница скидок показывает только её значение для 1080p, а полная сетка лежит на странице модели. Счёт определяют длительность и разрешение, а не длина промпта — поэтому 30-секундный ролик стоит примерно в пять раз дороже 6-секундного при том же разрешении.

Действительно ли тариф со скидкой дешевле вендора

Иногда да, и честный ответ делится натрое. Каждый текстовый тариф из таблицы выше мы 2026-08-21 сверили со страницей цен самого вендора. Они распадаются на три группы, и понимание того, в какой группе модель, — это разница между реальной экономией и числом, которое просто выглядит как экономия.

Группа первая: ниже прайса вендора. GLM-5.2 здесь стоит $0.98 / $3.08 против собственных $1.40 / $4.40 у Z.ai, то есть на 30% дешевле, чем при прямом обращении к Z.ai. GLM-5.3 — $1.26 / $3.96 против того же прайса $1.40 / $4.40, то есть на 10% дешевле. Сюда же попадают обе модели Doubao: Seed 2.1 Pro тарифицируется по $0.7072 / $3.536, Turbo — по $0.3536 / $1.7696, против ¥6 / ¥30 за миллион, опубликованных ByteDance на запуске, что по курсу, зафиксированному в нашем руководстве по доступу к Seed 2.1, составляет примерно $0.88 / $4.41. Volcano Engine считает в юанях, так что этот пересчёт стоит воспринимать как приблизительный, а не как сравнение до цента. Самая крупная разница в этой группе — GPT-5.6 Sol: $2.50 / $15 против стандартного тарифа OpenAI $5 / $30. Это ровно половина, причём на том тарифе, который вы реально вызываете синхронно.

Группа вторая: совпадает с вендором в точности. GPT-5.6 Luna тарифицируется по $0.20 / $1.20 — это стандартный тариф OpenAI для этой модели до цента. GPT-5.6 Terra идёт по $2 / $12, тоже идентично. На токенах вы не экономите ничего по сравнению с прямым вызовом OpenAI, и в этом весь смысл: никакой наценки, один ключ, а резервная маршрутизация достаётся бесплатно, а не за премию.

Группа третья: акция самого вендора, переданная как есть. Gemini 3.7 Flash и 3.6 Flash обе стоят $0.75 / $3.75. У Google — столько же. Это вводная цена Google, напечатанная на странице прайса с датой окончания 2026-12-31, после которой обе модели возвращаются к $1.50 / $7.50 с 2027-01-01. Никто не делает вам скидку на Gemini. Шлюз без изменений передаёт собственное временное число Google — это правильное поведение, но означает оно вот что: экономия исчезнет в день, который контролирует Google, а не шлюз.

Если вы планируете бюджет за новый год, именно третью группу стоит просчитать дважды. Мы разобрали, с чем на самом деле сравнивается тариф Gemini 3.7 Flash, включая архивные страницы прайса, показывающие, что база сравнения сдвинулась в те же 48 часов, что и запуск.

Сколько GPT-5.6 стоит здесь против OpenAI

Из трёх тарифов по-настоящему вдвое дешевле только один, два других совпадают с источником.

МодельТариф здесьСтандартный тариф OpenAIРазница
GPT-5.6 Sol$2.50 / $15$5.00 / $30.00вдвое
GPT-5.6 Terra$2.00 / $12.00$2.00 / $12.00идентично
GPT-5.6 Luna$0.20 / $1.20$0.20 / $1.20идентично

Про строку Sol стоит знать вот что: $2.50 / $15 — это ещё и то, что OpenAI берёт за Sol на тарифах Batch и Flex. Те тарифы меняют задержку на цену: Batch возвращает результат асинхронно внутри окна, а не в самом вызове. Здесь вы получаете это число на обычном синхронном запросе, и в этом вся суть конкретно этой скидки.

Кешированный вход устроен так же: $0.25 за миллион на Sol, $0.20 на Terra, $0.02 на Luna. У долгоживущего агента, который на каждом шаге переигрывает один и тот же системный промпт, месячный счёт обычно определяет именно строка кешированного входа, а не заглавная цена входа.

Какие скидки следуют за акцией вендора

Gemini и Seedance, обе. У тарифа Google на Flash напечатана дата окончания. Скидки Seedance следуют промо-окнам BytePlus, у которых есть напечатанные даты начала и конца, а не бессрочный режим, и окно для 2.5 покрывает только вывод в 1080p.

Это важно для одного конкретного решения: зашивать ли цену в модель затрат жёстко. Тариф из первой группы — это коммерческая договорённость, которая двигается медленно. Тариф из третьей группы двигается тогда, когда двигается маркетинговый календарь вендора. Оба сегодня — настоящие деньги. Но только одно из этих чисел можно вписать в ячейку с подписью «следующий квартал».

Страница best-value говорит об этом своими словами, и это та фраза на ней, которую стоит прочитать дважды: акции следуют за изменениями вендора и могут закончиться в любой момент.

Как воспользоваться ценой со скидкой

Ничего делать не нужно. Нет поля для промокода, нет плана, на который надо переключиться, нет минимального пополнения. Цена на странице модели — это то, по чему тарифицируется запрос.

from openai import OpenAI

client = OpenAI(api_key="sk-...", base_url="https://api.ofox.io/v1")

r = client.chat.completions.create(
    model="z-ai/glm-5.2",              # $0.98 вход / $3.08 выход за 1M
    messages=[{"role": "user", "content": "Summarise this changelog"}],
)
print(r.usage)

Смена модели — это правка одной строки, и в этом практическая причина вообще интересоваться списком скидок: если задача классификации, которая сейчас крутится на фронтир-модели за $5, проходит вашу планку качества на GLM-5.2 за $0.98, миграция занимает одну строку, а экономия пятикратная. Подборщик моделей ранжирует каталог по типу задачи и бюджету, если хотите, чтобы сравнение сделали за вас, а наше сравнение цен на AI API охватывает более широкое поле, включая модели без скидки.

Ещё два материала, если кандидат у вас — конкретная серия: цены GLM 5.3 и ловушка reasoning_effort, где настройка effort по умолчанию тарифицируется в 35 раз дороже самой дешёвой, и руководство по доступу к Doubao Seed 2.1, если модели Volcengine нужны без регистрации в Volcengine.

Какую модель выбрать из списка

Если нужноВыбирайтеТариф
Самый дешёвый пригодный текст на объёмеGPT-5.6 Luna$0.20 / $1.20
Самый дешёвый с приёмом видео на входеDoubao Seed 2.1 Turbo$0.3536 / $1.7696
Фронтир-рассуждения за половину прайсаGPT-5.6 Sol$2.50 / $15
Длинный контекст и видео на входеGemini 3.7 Flash$0.75 / $3.75
Кодинг и агенты на семействе с открытыми весамиGLM-5.2$0.98 / $3.08
Генерация видео, дешевле всего за секундуSeedance 2.0 Miniот $0.02/с

Тарифы выше — это то, что консоль списывает сегодня. Проценты рядом с ними на странице — контекст того, как это число получилось, и весь тезис этого материала в том, что контекст стоит дороже процента.

References

Часто задаваемые вопросы

Какие LLM API идут со скидкой на ofox?
Тринадцать моделей из пяти серий: GPT (5.6 Luna, Sol, Terra), Gemini (3.7 Flash, 3.6 Flash), GLM (5.2, 5.3), Doubao (Seed 2.1 Pro, Seed 2.1 Turbo) и Seedance (2.0, 2.0 Fast, 2.0 Mini, 2.5). Актуальный список лежит на странице best-value, отсортирован по размеру скидки и меняется, когда вендоры меняют собственные цены.
Тариф со скидкой через шлюз действительно дешевле, чем напрямую у вендора?
Зависит от модели, и ответ делится на три группы. GLM-5.2 за $0.98 / $3.08 действительно ниже собственных $1.40 / $4.40 у Z.ai. GPT-5.6 Luna за $0.20 / $1.20 совпадает со стандартным тарифом OpenAI до цента: на токенах вы не экономите, но и наценки не платите. Gemini 3.7 Flash за $0.75 / $3.75 — это вводная цена самого Google, она истекает 2026-12-31 и вообще не является скидкой шлюза.
Сколько стоит GPT-5.6 через шлюз?
Sol — $2.50 на входе и $15 на выходе за миллион токенов, Terra — $2 и $12, Luna — $0.20 и $1.20. Собственный стандартный тариф OpenAI для тех же моделей: $5 / $30, $2 / $12 и $0.20 / $1.20. Только у Sol тариф шлюза вдвое ниже стандартного тарифа вендора, остальные два совпадают с ним.
Нужен ли промокод, чтобы получить цену со скидкой?
Нет. Цена на странице модели — это та цена, по которой вас тарифицируют. Нет поля для промокода, нет минимального пополнения и нет отдельного тарифного плана, который надо включать. Зачёркнутое число — это контекст, а не условие, которое нужно разблокировать.
Как долго действуют эти скидки?
Единой даты окончания нет, потому что тарифы следуют за ценами каждого вендора. Цена Google на Gemini 3.7 и 3.6 Flash датирована 2026-12-31 на странице прайса Google. Акции Seedance следуют окнам BytePlus. У тарифов GLM опубликованной даты окончания нет. Считайте любой из них действующим на сегодня и перепроверяйте перед тем, как закладывать в квартальный бюджет.
Какая модель со скидкой дешевле всего для больших объёмов текста?
GPT-5.6 Luna: $0.20 на входе и $1.20 на выходе за миллион токенов, кешированный вход — $0.02. Следом идёт Doubao Seed 2.1 Turbo с $0.3536 и $1.7696. Обе на порядок дешевле фронтир-уровня и обе сохраняют вызов инструментов и работу с изображениями.
Видеомодели тоже со скидкой?
Четыре модели Seedance — да, и они тарифицируются за секунду вывода, а не за токены: Seedance 2.0 Mini от $0.02/с, 2.0 Fast — $0.042/с, 2.0 — $0.063/с, 2.5 — от $0.11/с на 480p, $0.48/с на 1080p text-to-video и $0.568/с на 1080p video-to-video. Посекундная тарификация означает, что счёт определяют запрошенные разрешение и длительность, а не длина промпта.