Лимиты LLM API 2026: 5 провайдеров, 5 разных правил

Anthropic считает токены в минуту (10 млн, чтение кэша бесплатно), DeepSeek — только параллелизм (2500), OpenAI и Google убрали цифры в панель.

Лимиты LLM API 2026: 5 провайдеров, 5 разных правил

Коротко. Единой таблицы, ранжирующей лимиты LLM API, не существует: пять крупнейших провайдеров измеряют разные вещи. Anthropic ограничивает запросы, входные и выходные токены в минуту, причём чтение кэша не засчитывается. Moonshot и OpenAI поднимают потолок по мере ваших трат. DeepSeek полностью игнорирует скорость в минуту и ограничивает число одновременно выполняющихся запросов. Google и OpenAI убрали цифры по моделям из публичной документации в панель. Полезный вопрос не «у кого выше RPM», а какая конструкция лимитов совпадает с тем, как ваше приложение реально обращается к API, и как обойти тот лимит, который упрётся первым.

Лимит — не одно число, которое можно упорядочить. Anthropic считает токены в минуту, DeepSeek — запросы в полёте, OpenAI — сколько вы заплатили. Выстроить это в одну колонку — категориальная ошибка.

Сначала о том, какой лимит первым кусает какую нагрузку, чтобы вы могли перейти сразу к своему случаю.

Ваша нагрузкаЧто упрётся первымПодходящая конструкция
Много мелких быстрых вызовов (чат-интерфейс, автодополнение)RPM (запросы в минуту)Anthropic Scale, OpenAI Tier 4-5
Несколько вызовов с огромным контекстом (RAG, длинные документы)Входные токены в минуту (ITPM / TPM)Anthropic (чтение кэша не входит в ITPM)
Всплесковые параллельные агентыПараллелизмDeepSeek (ограничивает запросы в полёте, 2500 на Flash)
Ровный продакшен реального масштабаМесячный лимит расходовAnthropic Scale или OpenAI Tier 5 ($200 000)
Только начинаете, бюджет ограниченПотолок начального уровняMoonshot T0-T1, бесплатный Gemini

Та самая таблица, которую все хотят (и почему она не сходится)

Каждая статья «сравнение лимитов» обещает сетку, где можно пробежать глазами колонку и выбрать победителя. Сетка рассыпается при первом касании, потому что провайдеры расходятся уже в том, что такое лимит. Вот честная версия: те же пять колонок, заполненные тем фактом, что колонки не совпадают.

ПровайдерЧем задаётся уровеньЧто на самом деле ограничиваетсяСигнал 429Цифры по моделям публичны?
AnthropicИстория использования (Start / Build / Scale / Custom)RPM + входные токены/мин + выходные токены/мин, по классам моделей429 + retry-afterДа, полная таблица по уровням
Moonshot / KimiНакопленное пополнение ($1–$3000)Параллелизм + RPM + TPM + токены в сутки429Да, полная таблица T0-T5
DeepSeekБез уровней (на аккаунт)Только параллелизм (запросы в полёте)429Да, по моделям
OpenAIНакопленная оплата ($5–$1000)RPM + RPD + TPM + TPD + изображений в минуту429 + x-ratelimit-*Нет, перенесено в панель
Google GeminiБиллинг + расходы + времяRPM + TPM + RPD плюс 10-минутный шлюз по расходам429 RESOURCE_EXHAUSTEDНет, в панели AI Studio

Прочитайте любую строку поперёк — форма меняется. Трое показывают точные цифры по моделям, двое нет. Двое ограничивают токены, один — запросы в полёте, двое в основном — сколько денег прошло через аккаунт. Это несовпадение и есть главный вывод, а дальше в статье — что означает каждая ячейка, когда 429 прилетает именно вам.

Все цифры ниже взяты из официальной документации по лимитам каждого провайдера 22 июля 2026 года. Там, где провайдер больше не публикует значения по моделям, статья прямо об этом говорит вместо догадок.

Anthropic: три оси, и чтение кэша бесплатно

Anthropic самый прозрачный из пяти и самый многомерный. Каждый класс моделей ограничен сразу по трём осям: запросы в минуту (RPM), входные токены в минуту (ITPM) и выходные токены в минуту (OTPM). Превышение любой одной даёт 429 с заголовком retry-after, где указано, сколько именно ждать. Ведро пополняется непрерывно (token bucket), так что вы не ждёте фиксированного момента сброса.

Уровни: Start, Build, Scale и Custom. Купить уровень напрямую нельзя — организации поднимаются автоматически на основе истории использования и состояния аккаунта. У каждого уровня свой месячный лимит расходов:

УровеньМесячный лимит расходов
Start$500
Build$1000
Scale$200 000
CustomНет (согласуется с командой аккаунта)

Детали Anthropic публикует именно по моделям. Для Claude Opus 4.x, где 4.8, 4.7, 4.6 и 4.5 делят одно общее ведро:

УровеньRPMВходные токены/мин (ITPM)Выходные токены/мин (OTPM)
Start10002 000 000400 000
Build50005 000 0001 000 000
Scale10 00010 000 0002 000 000

Самое заметное, и причина, по которой потолок Anthropic выше, чем выглядит, — правило ITPM с учётом кэша. У большинства моделей Claude cache_read_input_tokens не засчитываются в ITPM. Записанные в кэш и обычные входные токены засчитываются, а прочитанные обратно из кэша свободны от лимита. Рабочий пример самой Anthropic: лимит 2 000 000 ITPM при 80% попаданий в кэш позволяет прокачивать около 10 000 000 входных токенов в минуту, потому что 8 млн кэшированных токенов в лимит не попадают. Claude Haiku 3.5 — единственное исключение, где чтение кэша всё ещё считается.

Если значительная доля вашего входа — стабильный system prompt или длинный документ, отправляемый при каждом вызове, это правило меняет вашу фактическую пропускную способность сильнее, чем повышение уровня. Денежную сторону мы разбирали в настройке кэширования промптов DeepSeek; сторона лимитов — тот же рычаг, направленный на пропускную способность, а не на счёт.

Две сноски, о которые команды спотыкаются: у Message Batches API свои отдельные лимиты, и у Managed Agents тоже (300 RPM на создание, 1200 RPM на чтение). Упереться в стену на пакетном трафике не означает, что исчерпан лимит Messages API.

Moonshot / Kimi: платите и поднимайтесь, четыре измерения сразу

Moonshot — самая явная в группе лестница «плати за уровень». Уровень определяется исключительно накопленным пополнением, от $1 до $3000, и каждый уровень двигает сразу четыре ручки: параллелизм, RPM, TPM и токены в сутки (TPD).

Уровни международной платформы (platform.kimi.ai), в долларах:

УровеньНакопленное пополнениеПараллелизмRPMTPMTPD
Tier 0$113500 0001 500 000
Tier 1$10502002 000 000Без лимита
Tier 2$201005003 000 000Без лимита
Tier 3$10020050003 000 000Без лимита
Tier 4$100040050004 000 000Без лимита
Tier 5$3000100010 0005 000 000Без лимита

Прежде чем сверять эти цифры с чем-либо ещё, стоит знать про ловушку: Moonshot держит две отдельные платформы с двумя отдельными шкалами. Международная (platform.kimi.ai, она же platform.moonshot.ai) считает в долларах и требует пополнения на $1 до первого вызова. Материковая (platform.moonshot.cn) имеет собственную шкалу в юанях, начинающуюся с ¥0 и идущую через ¥50 / ¥100 / ¥500 / ¥5000 / ¥20000. Это не курсовой пересчёт друг друга, и условия входа отличаются: одна ставит платёж на входе, другая нет. Проверьте принадлежность ключа, прежде чем полагаться на уровень.

Скачок с Tier 0 на Tier 1 стоит отметить особо: дополнительные $9 переводят вас с 3 RPM и одного параллельного запроса на 200 RPM и 50 параллельных, а суточный потолок токенов исчезает целиком. Tier 0 — это по сути порог «докажи, что ты настоящий», а не место, где что-то строят.

Чего в таблице уровней нет: отдельные модели могут быть ограничены по мощности поверх вашего уровня. Свежезапущенная модель вроде Kimi K3 способна вернуть 429 от исчерпания мощности апстрима, даже когда вы далеко от лимитов своего уровня, потому что ограничение — это общий запас провайдера по этой модели, а не скорость вашего аккаунта. В таком случае покупка более высокого уровня не помогает; решение — переход на другую модель, то есть паттерн маршрутизации ниже.

DeepSeek: никакого RPM, только параллелизм

DeepSeek — тот выброс, который ломает любую сравнительную сетку. Он не публикует ни RPM, ни TPM. Он ограничивает параллелизм — число запросов, которые могут выполняться одновременно, на уровне аккаунта:

МодельЛимит параллелизма
deepseek-v4-pro500
deepseek-v4-flash2500

Оставайтесь под лимитом — и можно слать запросы так быстро, как модель их возвращает. Перешагнёте — получите 429. Никакого минутного бюджета, под который надо подстраивать темп, и для параллельных нагрузок это честно проще: размер пула воркеров задаётся лимитом параллелизма, и про токены в минуту можно не думать.

DeepSeek иначе обрабатывает и перегрузку. Вместо отклонения запроса при занятых серверах он держит соединение, отправляя пустые строки для непотоковых вызовов и SSE-комментарии : keep-alive для потоковых, и закрывает соединение только если вывод не начался через 10 минут. Аккаунты с расширенными квотами могут использовать параметр user_id, чтобы изолировать параллелизм по конечным пользователям — это важно, если через один ключ вы мультиплексируете множество клиентов. Про бесплатные пути к DeepSeek подробнее — в разборе DeepSeek V4 Flash.

OpenAI: уровень по тратам, цифры за стеклом

OpenAI по-прежнему разделяет по накопленной оплате, шесть уровней:

УровеньУсловиеМесячный лимит использования
FreeРазрешённая география$100
Tier 1Оплачено $5$100
Tier 2Оплачено $50$500
Tier 3Оплачено $100$1000
Tier 4Оплачено $250$5000
Tier 5Оплачено $1000$200 000

Измерений много: RPM, RPD, TPM, TPD, изображений в минуту и минут аудио в минуту для части потоковых моделей. Пока вы внутри лимита, ответы несут x-ratelimit-limit-requests, x-ratelimit-remaining-requests и их токеновые аналоги, так что запас видно в реальном времени.

И вот что ломает сетку: документация OpenAI по лимитам больше не перечисляет конкретные RPM или TPM по моделям. Страница отправляет за реальными цифрами на страницу моделей или в дашборд аккаунта. Это не упущение, на которое стоит жаловаться, — это сама по себе информация. OpenAI решила, что лимиты по моделям меняются достаточно часто, чтобы статическая таблица вводила в заблуждение, поэтому цифры живут в панели, привязанной к вашему аккаунту и уровню. Любая статья, печатающая точные RPM модели OpenAI как нечто фиксированное, цитирует снимок, возможно уже устаревший.

Google Gemini: уровни, временные шлюзы и 10-минутное окно расходов

Уровни Gemini совмещают статус биллинга, объём трат и прошедшее время:

УровеньУсловиеЛимит расходов
FreeАктивный проект или пробный периодНет
Tier 1Привязан биллинг-аккаунт$250
Tier 2Оплачено $100 + 3 дня с первого платежа$2000
Tier 3Оплачено $1000 + 30 дней с первого платежа$20 000 – $100 000+

Требования в три и тридцать дней необычны: даже заплатив, нельзя пропустить период ожидания и попасть на Tier 2 или Tier 3. Gemini добавляет поверх обычных RPM / TPM / RPD ещё и контроль по расходам в скользящем 10-минутном окне ($10 для Tier 1, $200 для Tier 2 и 3), так что внезапный всплеск трат придушит вас, даже когда с минутной скоростью токенов всё в порядке. При превышении приходит 429 RESOURCE_EXHAUSTED.

Как и OpenAI, Gemini держит цифры RPM / TPM / RPD по моделям вне статической документации, внутри AI Studio, где видно ваши действующие лимиты. И вся эта страница относится только к Gemini Developer API, но не к Vertex AI, у которого своя система квот.

Почему единицы не сходятся (та часть, которую никто не сводит в таблицу)

Отойдите на шаг — и несовместимость окажется главным сюжетом. Вот что покупает одна единица запаса у каждого провайдера и где эта единица жмёт.

ЕдиницаКто используетЧто даёт одна единица запасаГде жмёт
RPM (запросы/мин)Все пятеро, как одна из осейN вызовов в минуту независимо от размераМного мелких вызовов
Входные токены/мин (ITPM / TPM)Anthropic, Moonshot, OpenAI, GoogleN входных токенов в минутуБольшой контекст, RAG
Выходные токены/мин (OTPM)AnthropicN сгенерированных токенов в минутуДлинная генерация
Параллелизм (в полёте)DeepSeek, MoonshotN запросов одновременно, любого размераПараллельный веер
Месячный лимит расходовВсе пятероЖёсткий долларовый потолок в месяцУстойчивый масштаб
10-минутные скользящие расходыGoogleДоллары за скользящие 10 минутРваные траты

Команда, отправляющая тысячи крошечных классификационных вызовов, первой упрётся в RPM, и ITPM её не волнует вообще. Команда, вставляющая документ на 200 тысяч токенов в каждый запрос, упрётся в стены по токенам в минуту, пока её RPM болтается около нуля. Команда с пятьюдесятью параллельными агентами упрётся в параллелизм. Эти три команды не могут пользоваться одной рекомендацией «где лимиты лучше», потому что их ограничивают три разные единицы, и никакой единый рейтинг не обслужит всех троих.

Разобранный пример делает ловушку осязаемой. Допустим, у вас 50 воркеров, каждый шлёт RAG-запрос на 30 000 токенов. На deepseek-v4-pro это 50 запросов в полёте против лимита 500, то есть десятикратный запас, и 429 вы не увидите никогда. Перенесите ровно ту же нагрузку к провайдеру с лимитом 2 000 000 входных токенов в минуту — и если эти 50 запросов попадут в одну минуту, получится 1 500 000 входных токенов одним всплеском плюс всё остальное, что вы отправляете. Вы внезапно на 75% лимита, который на DeepSeek даже не отслеживали, и небольшой рост трафика переваливает через край. Тот же параллелизм, тот же размер запроса, совершенно другая стена.

Именно поэтому миграция между провайдерами застаёт врасплох. Лимит, за которым вы никогда не следили, становится тем, который кусает, и код, месяцами работавший чисто, начинает выдавать 429 в день переключения.

Какой лимит укусит первым (рамка принятия решения)

Прежде чем поднимать уровень или что-то перестраивать, выясните, в какую стену вы на самом деле упираетесь.

Блок-схема «В какую стену вы упёрлись»: 429 проходит проверку на всплесковый шум и расходится на три исхода — поднять уровень, если 429 сгруппированы на одной оси; включить кэш вместо повышения уровня, если это ITPM и вход повторяется; обойти, если лимит структурный для нагрузки. Внизу таблица соответствия осей и провайдеров

  • Когда достаточно поднять уровень. Ваши 429 сгруппированы на одной оси (скажем, RPM), вы на низком уровне, и потолок следующего перекрывает пик с запасом. Заплатить — самое дешёвое решение. Это обычный случай для Moonshot и OpenAI, где уровень является ручкой расходов.
  • Когда кэшировать вместо повышения. Вы на Anthropic, упираетесь в ITPM, и значительная доля входа повторяется между вызовами. Включение кэширования промптов поднимает фактическую пропускную способность без смены уровня, потому что чтение кэша не засчитывается в ITPM. Попробуйте это до заявки на повышение лимита.
  • Когда обходить. Лимит структурен для вашей нагрузки: вы стабильно насыщаете предел параллелизма, либо модель возвращает 429 из-за мощности апстрима, что не лечится никаким уровнем. Решение — переключение на сопоставимую модель другого провайдера, чтобы придушивание превращалось в переход, а не в ошибку. Здесь окупаются разбор ошибок AI API и мультимодельный роутер.
  • Когда остановиться. Если доля 429 ниже примерно 1% и всё решается одним повтором, у вас не проблема с лимитами, а обычный всплесковый шум. Добавьте откат с джиттером и живите дальше. Не перестраивайте архитектуру под стену, которой едва касаетесь.

Как читать 429 (в какую стену вы упёрлись)

429 не самоочевиден, и провайдеры сообщают о том, в какую стену вы попали, по-разному. Прочитать ответ до повтора дешевле, чем пережидать лимит, который вы не нарушали.

ПровайдерЧто читатьЧто это говорит
Anthropicretry-after + anthropic-ratelimit-requests-remaining / -input-tokens-remaining / -output-tokens-remainingТочно какая ось обнулилась (запросы, входные или выходные токены) и сколько секунд ждать
OpenAIx-ratelimit-remaining-requests / x-ratelimit-remaining-tokensЧто кончилось в этом окне — запросы или токены
DeepSeek429, retry-after в документации не описанПревышен лимит параллелизма; уменьшайте число запросов в полёте, а не просто ждите
Google Gemini429 RESOURCE_EXHAUSTEDПроверьте, минутный это лимит или 10-минутный шлюз по расходам
Moonshot / Kimi429Проверьте, какую ось уровня вы перешли: параллелизм, RPM или TPM

Практическое различие проходит между лимитами «подожди» и лимитами «сбавь». Anthropic, OpenAI и Google дают минутный бюджет, поэтому retry-after или заголовок остатка около нуля означают: отступите на несколько секунд, и ведро пополнится. Лимит параллелизма DeepSeek — это лимит «сбавь»: ожидание ничего не даёт, если вы держите то же число запросов в полёте, потому что стена — это параллелизм, а не время. Повтор 429 по параллелизму без сокращения пула воркеров просто снова бьётся в ту же стену. Перепутаете различие — и ваша логика отката будет спать там, где надо сбрасывать нагрузку, или сбрасывать нагрузку там, где хватило бы секунды ожидания.

Один эндпоинт, пять сводов правил

Заставить исчезнуть ITPM Anthropic или лимит параллелизма DeepSeek нельзя. Можно другое: перестать делать лимит любого одного провайдера единой точкой отказа. Когда пятеро применяют пять разных правил, практическая защита — поставить их за один эндпоинт и автоматически переводить придушенный запрос к другому провайдеру. Шлюз вроде ofox выставляет их все на одном OpenAI-совместимом API с одним ключом, так что «упёрлись в лимит провайдера A» становится «ответил провайдер B», а не проваленным вызовом.

Паттерн — короткий цикл «повтори, потом прыгни». 429 от любого провайдера запускает пару повторов с джиттером, затем переключение на следующую модель в межпровайдерской цепочке.

import time, random, openai

CHAIN = [
    "anthropic/claude-opus-4.8",
    "deepseek/deepseek-v4-pro",
    "moonshotai/kimi-k3",
]

def ask(prompt, retries=2):
    for model in CHAIN:
        for attempt in range(retries):
            try:
                r = client.chat.completions.create(
                    model=model,
                    messages=[{"role": "user", "content": prompt}])
                return model, r.choices[0].message.content
            except openai.RateLimitError:
                time.sleep((2 ** attempt) + random.random())
        # этот провайдер всё ещё душит — идём к следующему
    raise RuntimeError("все провайдеры в цепочке придушены")

Возвращайте имя модели вместе с результатом. Когда позже вы будете выяснять, почему одна партия ответов отличается по характеру, знание источника каждого ответа сэкономит много времени.

Границу стоит проговорить: шлюз не поднимает ничей потолок. Он меняет то, что происходит после удара в стену. Если весь ваш трафик идёт к одному провайдеру и вы стабильно насыщаете одну из его осей, вам нужен более высокий уровень или меньше трафика, а не шлюз.

Источники, проверенные для этой статьи