Цены на LLM API: 6 затрат, которых нет в прайсе
Асимметрия кэша, тарификация по часам, обрывы по контексту, неучтённые токены рассуждения, комиссии платформ и математика подписок.
Кратко: число за миллион токенов на странице модели — это начало расчёта, а не ответ. Между ним и вашим счётом стоят шесть механизмов, и каждый способен сдвинуть сумму сильнее, чем смена вендора. Эта страница называет все шесть, ведёт к измерениям за каждым из них и собирает указатель актуальных страниц с ценами по каждой модели, которую мы отслеживаем.
Last updated 2026-08-31. Приведённые ниже множители прочитаны в тот же день из собственной документации вендоров по кэшированию и ценам.
Какие шесть затрат не показывает прайс?
1. Почему кэширование иногда делает счёт хуже?
На текущих флагманских моделях переоценены обе половины кэша, и скидкой является только одна. Anthropic указывает множители прямо:
5-minute cache write tokens are 1.25 times the base input tokens price · 1-hour cache write tokens are 2 times the base input tokens price · Cache read tokens are 0.1 times the base input tokens price
OpenAI пришёл к той же форме для GPT-5.6 и новее, где «cache writes cost 1.25× the standard, uncached input-token rate», а чтение стоит 0.1 от этой ставки. На более ранних моделях OpenAI платы за запись в кэш нет вовсе. Так что кэширование — это ставка на процент попаданий: записали и прочитали один раз — заплатили 1.35 обычной входной стоимости вместо 2; записали и ни разу не прочитали — просто отдали лишние 25%.
Реализации у двух вендоров различаются достаточно, чтобы влиять на архитектуру: в кэшировании промптов у Anthropic и OpenAI есть расчёт стоимости и три способа лечения промахов. Как выглядит реальный счёт при высоком проценте попаданий, разбирает арифметика попаданий в кэш LLM API на случае, где страница цен подразумевает $50, а счёт показывает $4. И ещё одна деталь, ломающая интуицию: DeepSeek сопоставляет целые префиксные единицы, а не префиксы побайтно, поэтому изменение одного символа в неудачном месте способно стоить вам всего попадания.
2. Почему одна и та же нагрузка стоит дороже в три часа дня, чем в три ночи?
DeepSeek перевёл всё семейство V4 на пиковую и непиковую тарификацию 2026-08-16 в 16:00 UTC. Одна и та же нагрузка, запущенная в разное время суток, даёт разные счета, а любая модель затрат, построенная до этой даты, ошибается на множитель, а не на проценты.
Окна и множитель по каждому тарифу — в повышении цен DeepSeek API. Сторона смягчения — в шести способах платить меньше на фоне роста цен.
3. Почему один лишний токен удваивает весь запрос?
Это удивляет людей сильнее всего. Grok 4.6 стоит $2 за миллион входных и $6 за миллион выходных токенов, пока промпт не достигнет 200K. За этой чертой по двойной ставке тарифицируется каждый токен запроса, а не только те, что выше порога. Промпт на 201K не чуть дороже, чем на 199K, — он дороже вдвое.
Арифметика и точка перехода — в обрыве на 200K и случаях, когда 4.5 всё ещё выигрывает.
4. Почему ваш калькулятор недосчитывает модели с рассуждением?
Если он считает prompt_tokens × input + completion_tokens × output, проверьте, входят ли токены рассуждения этой модели в completion_tokens. У Grok 4.6 не входят. На одной измеренной нагрузке по программированию эта формула недосчитала тарифицируемый вывод на 77%, а вызов целиком — примерно на 71%.
Сравнение стоимости Opus 5 и Grok 4.6 — та самая очная ставка, где это всплыло: счёт в 3.6 раза больше при 1.75 раза большем объёме кода, и баланс сходится только после корректного учёта токенов рассуждения.
5. Агрегаторы берут с токенов или с денег?
OpenRouter не добавляет наценку на токен поверх ставок провайдера. Он берёт 5.5% комиссии платформы при пополнении картой, 5% при оплате криптовалютой, плюс фиксированную составляющую за транзакцию, из-за которой мелкие пополнения выходят пропорционально хуже. Это затрата другой формы, чем наценка, и лечится она укрупнением пополнений, а не сменой модели.
Полная разбивка — в перечне всех комиссий OpenRouter.
6. Когда подписка хуже тарифицируемого ключа?
Фиксированная месячная плата превращает переменные затраты в постоянные, и в этом есть ценность. Одновременно она превращает проблему расходов в проблему доступности: когда окно исчерпано, вы не платите больше, вы останавливаетесь.
Grok Build за 30 долларов в месяц против примерно 1 доллара за миллион в API — подробное сравнение. Недельный лимит Codex и API с оплатой по факту, ограничивающий расходы — та же сделка с другой стороны: тарифицируемый ключ с жёстким потолком даёт и предсказуемость, и возможность продолжать работу.
Где лежит актуальная цена каждой модели?
Ставки двигаются ежемесячно, поэтому указатель ведёт на страницу, которую мы поддерживаем в актуальном состоянии для каждой модели, а не пересказывает числа, которые устареют.
| Вендор | Страница | Что она закрывает | Обновлено |
|---|---|---|---|
| OpenAI | GPT-5.6 Terra против GPT-5.5 | половина цены и держится ли качество кода | 2026-07-10 |
| OpenAI | Руководство по GPT-5.4 Pro API | цены и когда тариф Pro оправдан | 2026-04-28 |
| Anthropic | Claude Opus 5 API | вывод уровня Fable 5 за половину цены | 2026-07-26 |
| Anthropic | Sonnet 5 против Opus 4.8 | на бумаге дешевле на 60% и где это работает | 2026-07-01 |
| xAI | Цены Grok 4.6 API | обрыв на 200K и когда 4.5 всё ещё выигрывает | 2026-08-19 |
| xAI | Grok Build против API | подписка против оплаты по факту | 2026-08-29 |
| Gemini 3.7 Flash API | ставка $0.75 и параметр, который даёт 400 | 2026-08-21 | |
| DeepSeek | Руководство по ценам DeepSeek API | официальные ставки за миллион | 2026-08-18 |
| DeepSeek | V4 Pro 0813 | цена, открытые веса, бенчмарки | 2026-08-17 |
| DeepSeek | Реальная стоимость за прайсом | разрыв в 120 раз между попаданием и промахом | 2026-08-17 |
| Z.ai | GLM 5.3 API | цены, точки входа и reasoning_effort | 2026-08-19 |
| Alibaba | Qwen 3.8 Max | цена, окно контекста, открытые веса | 2026-08-03 |
| Moonshot | Kimi K3 против GLM-5.2 за прогон | стоит ли фронтир 2.8 раза | 2026-07-17 |
| MiniMax | Цены MiniMax M2.7 API | бесплатный тариф, настройка и место на рынке | 2026-08-17 |
| Агрегаторы | Цены OpenRouter по пунктам | каждая реальная статья расходов | 2026-08-31 |
| Видео | Стоимость пригодного клипа в видео-API | почему цена за секунду — наименьшее слагаемое | 2026-08-26 |
Если нужна одна общая таблица по всем вендорам, а не страница на каждого, в сравнении цен на AI API двадцать три модели стоят рядом, с расчётами по кэшу и батчам. Прежде чем цитировать оттуда число, прочитайте строку с датой: текст заявляет проверку концом мая 2026, и с тех пор несколько ставок сдвинулись, сильнее всего у DeepSeek.
Ценообразование в видео устроено достаточно иначе, чтобы требовать отдельной карты. Структура по секундам и разрешениям — в руководстве по Seedance API.
Как платить меньше, не меняя модель?
Четыре пути, примерно в порядке отдачи на потраченный час.
- Маршрутизируйте по задаче. Гибридная маршрутизация в Claude Code снижает затраты примерно на 80%, отправляя дешёвые 90% ходов дешёвой модели. Снижение затрат на AI API на 60% — общий вариант.
- Пользуйтесь бесплатными тарифами, которые действительно работают. Рейтинг бесплатных тарифов LLM API для программирования отделяет те, где лимиты реальны, от тех, что кончаются на первом же цикле агента. По моделям: DeepSeek V4 Flash, GLM 5.2, Kimi K2.7 Code.
- Забирайте существующие скидки. LLM API дешевле прайса перечисляет 13 моделей, которые сейчас стоят ниже прайса.
- Ограничьте худший сценарий. Жёсткий лимит расходов превращает разогнавшийся цикл из счёта в ошибку, а ошибки дешевле. Если вы эти ошибки обрабатываете, коды ошибок LLM API объясняют, какие платёжные сбои приходят как 402, а какие как 429.
Источники
Часто задаваемые вопросы
- Почему счёт выше, чем цена на странице модели?
- Между этими двумя числами стоят шесть вещей: запись в кэш стоит от 1.25 до 2 обычных входных токенов, а чтение — 0.1; часть провайдеров теперь тарифицирует по времени суток; часть удваивает все токены при превышении порога контекста, а не только избыток; токены рассуждения могут не попадать в completion_tokens, который читает ваш калькулятор; агрегаторы берут комиссию с пополнений; у подписки и оплаты по факту разная арифметика. Каждый пункт весит больше, чем разница в прайсах двух вендоров.
- Какой LLM API сейчас самый дешёвый?
- Вопрос настолько нестабилен, что мы перестали отвечать на него одним названием. Ставки двигаются ежемесячно: в августе 2026 DeepSeek перевёл всё семейство V4 на пиковую и непиковую тарификацию, Grok 4.6 удваивает цену всех токенов выше 200K контекста, а скидочные кампании приходят и уходят. Выбирайте по форме нагрузки, а затем сверяйте актуальную ставку конкретной модели на странице самого вендора.
- Действительно ли кэширование промптов снижает затраты?
- Для подходящей нагрузки — существенно. Anthropic берёт за чтение из кэша 0.1 базового входа, а за запись 1.25 (5 минут) или 2 (1 час). OpenAI пришёл к тем же 1.25 за запись и 0.1 за чтение на GPT-5.6 и новее, а на более ранних моделях платы за запись нет вовсе. То есть запись, которую вы ни разу не прочитали, обходится в 25% сверху, а запись с одним чтением — в 1.35 вместо 2. Правила совпадения тоже различаются: DeepSeek сопоставляет целые префиксные единицы, а не префиксы побайтно.
- Подписка за 30 долларов в месяц дешевле API?
- Всё зависит от того, сколько токенов вы реально прогоняете, и точка перехода ниже, чем принято думать. Мы посчитали случай Grok: 30 долларов в месяц против примерно 1 доллара за миллион токенов в API. Подписка выигрывает при интенсивной интерактивной работе и проигрывает на автоматизированных или всплесковых нагрузках, где тарифицируемый ключ с лимитом расходов оказывается и дешевле, и предсказуемее.
- Накручивают ли агрегаторы цену за токены?
- OpenRouter не добавляет наценку на токен поверх ставок провайдера. Он берёт 5.5% комиссии платформы при пополнении картой — это другой механизм с другой арифметикой. При оплате криптовалютой комиссия падает до 5%, а фиксированная составляющая за транзакцию делает мелкие пополнения пропорционально дороже.


