Цены на LLM API: 6 затрат, которых нет в прайсе

Асимметрия кэша, тарификация по часам, обрывы по контексту, неучтённые токены рассуждения, комиссии платформ и математика подписок.

Цены на LLM API: 6 затрат, которых нет в прайсе

Кратко: число за миллион токенов на странице модели — это начало расчёта, а не ответ. Между ним и вашим счётом стоят шесть механизмов, и каждый способен сдвинуть сумму сильнее, чем смена вендора. Эта страница называет все шесть, ведёт к измерениям за каждым из них и собирает указатель актуальных страниц с ценами по каждой модели, которую мы отслеживаем.

Last updated 2026-08-31. Приведённые ниже множители прочитаны в тот же день из собственной документации вендоров по кэшированию и ценам.

Какие шесть затрат не показывает прайс?

1. Почему кэширование иногда делает счёт хуже?

На текущих флагманских моделях переоценены обе половины кэша, и скидкой является только одна. Anthropic указывает множители прямо:

5-minute cache write tokens are 1.25 times the base input tokens price · 1-hour cache write tokens are 2 times the base input tokens price · Cache read tokens are 0.1 times the base input tokens price

OpenAI пришёл к той же форме для GPT-5.6 и новее, где «cache writes cost 1.25× the standard, uncached input-token rate», а чтение стоит 0.1 от этой ставки. На более ранних моделях OpenAI платы за запись в кэш нет вовсе. Так что кэширование — это ставка на процент попаданий: записали и прочитали один раз — заплатили 1.35 обычной входной стоимости вместо 2; записали и ни разу не прочитали — просто отдали лишние 25%.

Реализации у двух вендоров различаются достаточно, чтобы влиять на архитектуру: в кэшировании промптов у Anthropic и OpenAI есть расчёт стоимости и три способа лечения промахов. Как выглядит реальный счёт при высоком проценте попаданий, разбирает арифметика попаданий в кэш LLM API на случае, где страница цен подразумевает $50, а счёт показывает $4. И ещё одна деталь, ломающая интуицию: DeepSeek сопоставляет целые префиксные единицы, а не префиксы побайтно, поэтому изменение одного символа в неудачном месте способно стоить вам всего попадания.

2. Почему одна и та же нагрузка стоит дороже в три часа дня, чем в три ночи?

DeepSeek перевёл всё семейство V4 на пиковую и непиковую тарификацию 2026-08-16 в 16:00 UTC. Одна и та же нагрузка, запущенная в разное время суток, даёт разные счета, а любая модель затрат, построенная до этой даты, ошибается на множитель, а не на проценты.

Окна и множитель по каждому тарифу — в повышении цен DeepSeek API. Сторона смягчения — в шести способах платить меньше на фоне роста цен.

3. Почему один лишний токен удваивает весь запрос?

Это удивляет людей сильнее всего. Grok 4.6 стоит $2 за миллион входных и $6 за миллион выходных токенов, пока промпт не достигнет 200K. За этой чертой по двойной ставке тарифицируется каждый токен запроса, а не только те, что выше порога. Промпт на 201K не чуть дороже, чем на 199K, — он дороже вдвое.

Арифметика и точка перехода — в обрыве на 200K и случаях, когда 4.5 всё ещё выигрывает.

4. Почему ваш калькулятор недосчитывает модели с рассуждением?

Если он считает prompt_tokens × input + completion_tokens × output, проверьте, входят ли токены рассуждения этой модели в completion_tokens. У Grok 4.6 не входят. На одной измеренной нагрузке по программированию эта формула недосчитала тарифицируемый вывод на 77%, а вызов целиком — примерно на 71%.

Сравнение стоимости Opus 5 и Grok 4.6 — та самая очная ставка, где это всплыло: счёт в 3.6 раза больше при 1.75 раза большем объёме кода, и баланс сходится только после корректного учёта токенов рассуждения.

5. Агрегаторы берут с токенов или с денег?

OpenRouter не добавляет наценку на токен поверх ставок провайдера. Он берёт 5.5% комиссии платформы при пополнении картой, 5% при оплате криптовалютой, плюс фиксированную составляющую за транзакцию, из-за которой мелкие пополнения выходят пропорционально хуже. Это затрата другой формы, чем наценка, и лечится она укрупнением пополнений, а не сменой модели.

Полная разбивка — в перечне всех комиссий OpenRouter.

6. Когда подписка хуже тарифицируемого ключа?

Фиксированная месячная плата превращает переменные затраты в постоянные, и в этом есть ценность. Одновременно она превращает проблему расходов в проблему доступности: когда окно исчерпано, вы не платите больше, вы останавливаетесь.

Grok Build за 30 долларов в месяц против примерно 1 доллара за миллион в API — подробное сравнение. Недельный лимит Codex и API с оплатой по факту, ограничивающий расходы — та же сделка с другой стороны: тарифицируемый ключ с жёстким потолком даёт и предсказуемость, и возможность продолжать работу.

Где лежит актуальная цена каждой модели?

Ставки двигаются ежемесячно, поэтому указатель ведёт на страницу, которую мы поддерживаем в актуальном состоянии для каждой модели, а не пересказывает числа, которые устареют.

ВендорСтраницаЧто она закрываетОбновлено
OpenAIGPT-5.6 Terra против GPT-5.5половина цены и держится ли качество кода2026-07-10
OpenAIРуководство по GPT-5.4 Pro APIцены и когда тариф Pro оправдан2026-04-28
AnthropicClaude Opus 5 APIвывод уровня Fable 5 за половину цены2026-07-26
AnthropicSonnet 5 против Opus 4.8на бумаге дешевле на 60% и где это работает2026-07-01
xAIЦены Grok 4.6 APIобрыв на 200K и когда 4.5 всё ещё выигрывает2026-08-19
xAIGrok Build против APIподписка против оплаты по факту2026-08-29
GoogleGemini 3.7 Flash APIставка $0.75 и параметр, который даёт 4002026-08-21
DeepSeekРуководство по ценам DeepSeek APIофициальные ставки за миллион2026-08-18
DeepSeekV4 Pro 0813цена, открытые веса, бенчмарки2026-08-17
DeepSeekРеальная стоимость за прайсомразрыв в 120 раз между попаданием и промахом2026-08-17
Z.aiGLM 5.3 APIцены, точки входа и reasoning_effort2026-08-19
AlibabaQwen 3.8 Maxцена, окно контекста, открытые веса2026-08-03
MoonshotKimi K3 против GLM-5.2 за прогонстоит ли фронтир 2.8 раза2026-07-17
MiniMaxЦены MiniMax M2.7 APIбесплатный тариф, настройка и место на рынке2026-08-17
АгрегаторыЦены OpenRouter по пунктамкаждая реальная статья расходов2026-08-31
ВидеоСтоимость пригодного клипа в видео-APIпочему цена за секунду — наименьшее слагаемое2026-08-26

Если нужна одна общая таблица по всем вендорам, а не страница на каждого, в сравнении цен на AI API двадцать три модели стоят рядом, с расчётами по кэшу и батчам. Прежде чем цитировать оттуда число, прочитайте строку с датой: текст заявляет проверку концом мая 2026, и с тех пор несколько ставок сдвинулись, сильнее всего у DeepSeek.

Ценообразование в видео устроено достаточно иначе, чтобы требовать отдельной карты. Структура по секундам и разрешениям — в руководстве по Seedance API.

Как платить меньше, не меняя модель?

Четыре пути, примерно в порядке отдачи на потраченный час.

  1. Маршрутизируйте по задаче. Гибридная маршрутизация в Claude Code снижает затраты примерно на 80%, отправляя дешёвые 90% ходов дешёвой модели. Снижение затрат на AI API на 60% — общий вариант.
  2. Пользуйтесь бесплатными тарифами, которые действительно работают. Рейтинг бесплатных тарифов LLM API для программирования отделяет те, где лимиты реальны, от тех, что кончаются на первом же цикле агента. По моделям: DeepSeek V4 Flash, GLM 5.2, Kimi K2.7 Code.
  3. Забирайте существующие скидки. LLM API дешевле прайса перечисляет 13 моделей, которые сейчас стоят ниже прайса.
  4. Ограничьте худший сценарий. Жёсткий лимит расходов превращает разогнавшийся цикл из счёта в ошибку, а ошибки дешевле. Если вы эти ошибки обрабатываете, коды ошибок LLM API объясняют, какие платёжные сбои приходят как 402, а какие как 429.

Источники

Часто задаваемые вопросы

Почему счёт выше, чем цена на странице модели?
Между этими двумя числами стоят шесть вещей: запись в кэш стоит от 1.25 до 2 обычных входных токенов, а чтение — 0.1; часть провайдеров теперь тарифицирует по времени суток; часть удваивает все токены при превышении порога контекста, а не только избыток; токены рассуждения могут не попадать в completion_tokens, который читает ваш калькулятор; агрегаторы берут комиссию с пополнений; у подписки и оплаты по факту разная арифметика. Каждый пункт весит больше, чем разница в прайсах двух вендоров.
Какой LLM API сейчас самый дешёвый?
Вопрос настолько нестабилен, что мы перестали отвечать на него одним названием. Ставки двигаются ежемесячно: в августе 2026 DeepSeek перевёл всё семейство V4 на пиковую и непиковую тарификацию, Grok 4.6 удваивает цену всех токенов выше 200K контекста, а скидочные кампании приходят и уходят. Выбирайте по форме нагрузки, а затем сверяйте актуальную ставку конкретной модели на странице самого вендора.
Действительно ли кэширование промптов снижает затраты?
Для подходящей нагрузки — существенно. Anthropic берёт за чтение из кэша 0.1 базового входа, а за запись 1.25 (5 минут) или 2 (1 час). OpenAI пришёл к тем же 1.25 за запись и 0.1 за чтение на GPT-5.6 и новее, а на более ранних моделях платы за запись нет вовсе. То есть запись, которую вы ни разу не прочитали, обходится в 25% сверху, а запись с одним чтением — в 1.35 вместо 2. Правила совпадения тоже различаются: DeepSeek сопоставляет целые префиксные единицы, а не префиксы побайтно.
Подписка за 30 долларов в месяц дешевле API?
Всё зависит от того, сколько токенов вы реально прогоняете, и точка перехода ниже, чем принято думать. Мы посчитали случай Grok: 30 долларов в месяц против примерно 1 доллара за миллион токенов в API. Подписка выигрывает при интенсивной интерактивной работе и проигрывает на автоматизированных или всплесковых нагрузках, где тарифицируемый ключ с лимитом расходов оказывается и дешевле, и предсказуемее.
Накручивают ли агрегаторы цену за токены?
OpenRouter не добавляет наценку на токен поверх ставок провайдера. Он берёт 5.5% комиссии платформы при пополнении картой — это другой механизм с другой арифметикой. При оплате криптовалютой комиссия падает до 5%, а фиксированная составляющая за транзакцию делает мелкие пополнения пропорционально дороже.