Лучшие поставщики LLM API 2026: 4 типа и цена каждого

Четыре способа купить одни и те же токены. Claude Opus 5 стоит $5/$25 на трёх из них, gpt-oss-120B идёт по $0.15/M, комиссии за пополнение до 5.5%.

Лучшие поставщики LLM API 2026: 4 типа и цена каждого

TL;DR: В 2026 году есть четыре способа покупать LLM-токены, и они конкурируют не по одной оси. Нативные API продают каноническую цену и возможности с нулевого дня. Хостеры открытых весов продают дешёвые токены, начиная с $0.05/M на gpt-oss-20B у Together. Роутеры продают один ключ для множества вендоров, обычно по прайс-листу, а затраты перенесены в платёжные комиссии, 5.5% на пополнение картой у OpenRouter. Облачные платформы продают закупку и берут за неё плату: региональные эндпоинты в партнёрских облаках идут на 10% дороже глобальных, а приоритетный уровень Vertex это 1.8x стандартного. Один и тот же вызов Claude Opus 5 стоит $5/$25 за 1M токенов на трёх из четырёх. Реально различается всё вокруг токена.

TL;DR: У какого типа стоит покупать?

Ваша ситуацияПокупать уПочему
Вам нужна модель на неделе её выходаНативный APIПартнёрские облака и роутеры отстают по новым SKU и по новым возможностям
Ваш счёт в основном формирует одна модель открытых весовХостер открытых весовБессерверная оплата за токен, затем выделенные GPU, когда вы их насытите
Вы вызываете четырёх вендоров и хотите один счётРоутерОдин ключ, один баланс, один формат провода, если хотите
Финансы уже одобрили облачное обязательствоОблачная платформаРасходы попадают в счёт, который существует, и это часто весь аргумент
Вам нужны первые токены за доли секунды на маленькой моделиХостер открытых весовGroq публикует 560 tok/s на своей llama-3.1-8b-instant и 1000 tok/s на своей openai/gpt-oss-20b, по своим ценам
Вам нужен запасной маршрут без второго контрактаРоутерПереключение при отказе это продукт, а не возможность, которую вы строите
Ваши данные должны оставаться в одном юридическом регионеОблачная платформа или нативная резидентностьОбе предлагают это, обе берут около 10% за это
Вы ещё выбираете, какую модель использоватьРоутерЗамена ID модели дешевле замены интеграции

Есть два повода дальше не читать. Если вы тратите менее примерно $200 в месяц на токены, покупайте напрямую у той лаборатории, которая делает нравящуюся вам модель, и вернитесь к этому, когда цифры станут интересными; любая оптимизация ниже стоит меньше, чем полдня, которые вы бы на неё потратили. Если вы уже гоняете продакшн-трафик более чем через двух вендоров, переходите к таблице скрытых затрат, потому что именно туда уходят ваши деньги.

Четыре канала разной ширины сходятся в один более широкий канал, вырезанные из уложенных слоёв кремовой и угольно-серой бумаги с одним оранжевым слоем

Четыре типа, бок о бок

Полезное различие не в бренде. Оно в том, кто запускает GPU, кто устанавливает цену и кто выставляет счёт.

Нативный APIХостер открытых весовРоутер / агрегаторОблачная платформа
ПримерыOpenAI, Anthropic, Google, DeepSeekTogether, Fireworks, GroqOpenRouter, ofoxBedrock, Vertex AI, Microsoft Foundry
Выполняет инференсДаДаНетДа, либо перепродаёт лабораторию
Каталог моделейМодели одной лабораторииТолько открытые весаМного лабораторий, 100+ IDПартнёрский список облака
Устанавливает ценуДа, это прайсДа, конкурентноВ основном копирует прайсПрайс плюс платформенные надбавки
Новая модель в первый деньДаДля открытых весов даОбычно в течение днейЧасто недели
АутентификацияBearer-токенBearer-токенBearer-токенIAM-роли, SigV4, сервисные аккаунты
БиллингКарта или счёт, по лабораторииКарта, по хостеруОдин предоплаченный балансВаш существующий облачный счёт
Переключение между вендорамиСтроите самиСтроите самиВстроеноВ рамках каталога одного облака
Силён вНовейшие возможности, самые высокие потолкиСтоимость за токенШирота и стоимость переключенияЗакупка и комплаенс

Всё, что ниже, это та же таблица подробно, с числами, которые я смог проверить.

Тип 1: Нативные API

Покупка у лаборатории, обучившей модель, это вариант по умолчанию, и для большинства команд он остаётся правильным ответом дольше, чем подсказывает интернет.

Вы получаете три вещи, которые больше нигде надёжно не дают. Новые модели в день релиза. Возможности, существующие только у первоисточника, вроде fast mode у Anthropic, о котором документация по ценам утверждает, что он доступен только в Claude API и не на платформах, управляемых партнёрами. И самые высокие опубликованные потолки лимитов, потому что любой другой маршрут покупает мощности там же, где покупали бы вы.

Вот что три крупные лаборатории реально берут, за 1M токенов, проверено 2026-08-02.

МодельВходКешированный входВыход
Claude Fable 5$10$1$50
Claude Opus 5$5$0.50$25
Claude Sonnet 5$2 (до Aug 31, затем $3)$0.20$10 (затем $15)
Claude Haiku 4.5$1$0.10$5
gpt-5.6-sol$5$0.50$30
gpt-5.6-terra$2$0.20$12
gpt-5.6-luna$0.20$0.02$1.20
gpt-5.5$5$0.50$30
Gemini 3.6 Flash$1.50$0.15$7.50
Gemini 3.5 Flash-Lite$0.30$0.03$2.50

Две оговорки, прежде чем вы используете эти числа. OpenAI публикует отдельные колонки для короткого и длинного контекста, и цифры выше это уровень короткого контекста. Длинный контекст не является равномерным множителем: gpt-5.6-luna идёт с $0.20/$1.20 до $0.40/$1.80, так что вход удваивается, а выход растёт наполовину. Цифры Gemini это уровень Global у Vertex, и несколько моделей в этой линейке оценивают неглобальные эндпоинты на 10% дороже, Gemini 3.5 Flash за $1.65/$9.90 против $1.50/$9.00.

Две вещи в этой таблице стоят больше, чем заголовочные цены. Каждая из этих лабораторий даёт скидку на пакетную обработку 50% и на вход, и на выход, и это самый крупный рычаг из доступных, если хоть какая-то часть вашей нагрузки может подождать. И кешированный вход идёт по десятой части свежего входа у всех трёх, так что агент со стабильным системным промптом платит долю того, что предполагает прайс. Мы разобрали эту математику подробно в Anthropic vs OpenAI prompt caching.

Цена нативного пути административная, и она тихо накапливается. Четыре лаборатории означают четыре ключа, четыре панели, четыре биллинговых отношения и четыре разных свода правил по лимитам, у которых нет общей терминологии. Мы сравнили пять таких сводов бок о бок в LLM API rate limits compared, и они расходятся почти во всём, включая то, что такое «запрос».

Идите нативным путём, если вы стандартизированы на одной лаборатории, если вам нужен доступ в день релиза, или если ваш объём достаточно велик, чтобы вы захотели прямой коммерческий разговор с кем-то. Он перестаёт быть комфортным в тот момент, когда вы ещё оцениваете модели, когда вам нужно куда переключиться в тот день, когда у одной лаборатории неудачный день, или когда у вас четыре ключа, а финансовый отдел начал о них спрашивать.

Тип 2: Хостеры инференса открытых весов

Эта категория существует потому, что часть весов моделей публична, а значит цену задаёт экономика GPU, а не тот, кто владеет моделью. Конкуренция здесь реальная, и цены это показывают.

МодельХостерВход /1MВыход /1M
gpt-oss-20BTogether$0.05$0.20
gpt-oss-20BGroq (openai/gpt-oss-20b)$0.075$0.30
LFM2.5-8B-A1BTogether$0.03$0.12
gpt-oss-120BTogether$0.15$0.60
gpt-oss-120BGroq (openai/gpt-oss-120b)$0.15$0.60
Qwen3.5-397B-A17BTogether$0.60$3.60
Llama 3.3 70BTogether$1.04$1.04
Llama 3.3 70BGroq (llama-3.3-70b-versatile)$0.59$0.79
DeepSeek V4 FlashDeepSeek (нативно)$0.14$0.28

Цены как опубликованы на странице цен каждого вендора, проверено 2026-08-02.

Читайте эту таблицу парами строк, потому что дублирующиеся имена моделей это и есть суть. Одни и те же опубликованные веса, и сколько вы платите, зависит от того, на чьём кластере они запущены. Together дешевле на gpt-oss-20B, $0.05/$0.20 против $0.075/$0.30. Groq дешевле на Llama 3.3 70B, $0.59/$0.79 против плоских $1.04/$1.04. Они на равных на gpt-oss-120B. Никто не выигрывает категорию, и это то, что вы получаете на рынке, где продукт коммодитизирован, а дифференциация в планировании. Это также означает, что пропускная способность и цена не идут вместе: 1000 tok/s у Groq относятся к gpt-oss-20B у Groq по цене Groq, а не к более дешёвому листингу тех же весов у Together.

Две структурные вещи отделяют эту категорию от остальных.

Первая в том, что вы можете выйти за пределы оплаты за токен. Together публикует выделенные инстансы H100 по $5.49/час по запросу и GPU-кластеры по $3.99 за GPU-час, падающие до $3.19 при резервировании. Fireworks указывает GPU по запросу по $7.00/час за H100 или H200, $10.00 за B200 и $12.00 за B300. Это даёт вам точку безубыточности, которую можно посчитать: один H100 по $5.49/час это около $4,000 в месяц, так что как только ваш бессерверный счёт на модели класса 20B перешагнёт это и ваш трафик станет стабильным, а не рваным, выделенные начинают выигрывать. Рваный трафик держит вас на бессерверном дольше, чем подсказывает арифметика, потому что вы платите и за простаивающие часы.

Вторая это ловушка, которую стоит назвать. Доступность модели у этих хостеров не является обещанием. Документация моделей Groq делит каталог на production и preview, и формулировка про preview необычно прямая: эти модели «intended for evaluation purposes only and should not be used in production environments as they may be discontinued at short notice». На момент проверки 2026-08-02 этот список включал qwen/qwen3.6-27b. Если вы прибиваете ID preview-модели в продакшене, вы приняли зависимость, которую вендор письменно просил не принимать.

Эта категория заслуживает своего места на большом объёме против публичных весов, на задачах с маленькими моделями, критичных к задержке, и на всём, что вы, возможно, захотите однажды забрать внутрь и хостить у себя с теми же выходами. Это неправильное место, если вам нужна фронтир-модель с закрытыми весами, или если вам нужно, чтобы один конкретный ID модели всё ещё существовал в следующем квартале.

Тип 3: Роутеры и агрегаторы

Роутер не выполняет инференс. Он принимает ваш запрос, решает, какому апстриму его отдать, пересылает его и возвращает вам нормализованный ответ. Вы покупаете отсутствие работы по интеграции: один ключ, один баланс, один формат провода и запасной путь, который вам не пришлось строить.

Вопрос по ценам, который люди задают об этой категории, в том, есть ли наценка, и ответ для двух крупнейших интереснее, чем «да» или «нет».

OpenRouter прямо заявляет, что не делает наценку на инференс: «We pass through the pricing of the underlying providers; there is no markup on inference pricing (however we do charge a fee when purchasing credits).» Доход перемещается на уровень оплаты. Его FAQ ставит комиссию по карте на «a 5.5% ($0.80 minimum) fee when you purchase credits», крипту на 5%, а маршрутизацию через собственный ключ на «5% of what the same model and provider would normally cost on OpenRouter», как только вы перейдёте первый 1M BYOK-запросов в месяц. При месячных тратах на токены в $600 комиссия по карте составляет около $33. При $10,000 это $550. Мы расписали каждую комиссию в OpenRouter pricing: the hidden 5.5% fee и отдельно посмотрели на продакшн-надёжность в Is OpenRouter reliable?.

Поскольку ofox тоже в этой категории, честно проверить наш собственный прайс-лист тем же способом. Каждая страница модели, которую я вытянул 2026-08-02, против опубликованного прайса вендора:

ID моделиУказано у ofoxПрайс вендораСовпадает
anthropic/claude-opus-5$5 / $25$5 / $25Да
anthropic/claude-sonnet-5$2 / $10$2 / $10Да
openai/gpt-5.5$5 / $30$5 / $30Да
google/gemini-3.6-flash$1.50 / $7.50$1.50 / $7.50Да
deepseek/deepseek-v4-flash$0.14 / $0.28$0.14 / $0.28Да
openai/gpt-5.6-luna$1 / $6$0.20 / $1.20Нет, 5x выше

Пять из шести по прайсу, одна существенно выше. Строка Luna это не ошибка округления: OpenAI снизил прайс этой модели на 80% 2026-07-30, а листинг всё ещё показывал уровень до снижения три дня спустя. Урок применим к каждому роутеру, включая этот. Прайс-лист шлюза это снимок, а прайсы вендоров меняются без предупреждения, так что проверяйте страницу модели для точного ID модели в тот день, когда планируете её вызывать, а не экстраполируйте из чьей-то репутации дешёвого. То же наблюдение мы отметили в DeepSeek V4 Flash vs Gemini 3.6 Flash.

Другое, что стоит проверить перед выбором роутера, это какие форматы провода он поддерживает, потому что ваш инструментарий не имеет права голоса. Claude Code хочет формат Anthropic Messages. Codex CLI хочет OpenAI. Роутер, отдающий только один из них, ставит слой трансляции на ваш путь. ofox документирует три базовых URL, по одному на протокол: https://api.ofox.io/v1 для OpenAI Chat Completions, https://api.ofox.io/anthropic для Messages, https://api.ofox.io/gemini для Gemini. Его /v1/models вернул 122 model IDs по 12 provider prefixes, когда я вызвал его 2026-08-02.

Роутер окупается, пока вы ещё выбираете модели, как только вы вызываете более двух вендоров, когда вам нужно переключение при отказе, которое вам не пришлось строить, или когда один предоплаченный баланс легче защитить, чем четыре отношения с картой на файле. Это неправильный уровень, если вам нужен совершенно новый SKU в первый день, если вам нужна фирменная возможность только у первоисточника, или если вы напрямую договорились об объёмной скидке с лабораторией. В последнем случае идти через кого-то ещё строго хуже.

В этой категории больше двух продуктов. Мы проранжировали семь из них, с заметками по миграции, в 7 best OpenRouter alternatives, а общий фреймворк выбора в гайде по шлюзам LLM API.

Тип 4: Облачные платформы

Amazon Bedrock, Google Vertex AI и Microsoft Foundry продают другой продукт, чем все выше, и делать вид, что нет, это как команды разочаровываются в них. Они продают закупку. Модель это строка в счёте, который ваша компания уже платит, внутри аккаунта, который ваша команда безопасности уже проверила, списываемая против обязательства, которое вы, возможно, уже подписали. Для достаточно крупной организации это стоит реальных денег, а цена токена почти нерелевантна.

Надбавки реальны и они задокументированы.

НадбавкаГдеРазмер
Региональный или мультирегиональный эндпоинтBedrock, Google Cloud10% над глобальными эндпоинтами. Документация Anthropic ограничивает это Claude Sonnet 4.5, Haiku 4.5, Opus 4.5 «and all future models», так что Opus 5 и Sonnet 5 включены
Приоритетный уровень сервисаVertex AI1.8x стандартного. Google не печатает множитель, но каждая строка Gemini делится ровно на него: 3.6 Flash идёт с $1.50/$7.50 до $2.70/$13.50
Инференс-география только для СШАClaude API, Claude Platform на AWS, Foundry1.1x на всех категориях токенов, Claude 4.6 и позднее
Провижн-пропускная способностьBedrockЗа единицу модели в час, с ставками без обязательств, на 1 месяц и на 6 месяцев. В таблице Provisioned Throughput раздела Cohere, Cohere Command идёт по $49.50, $39.60 и $23.77 соответственно
Уровень Batch / FlexBedrock, Vertex AIСкидка, а не надбавка: 50% от стандарта

Механика биллинга тоже различается, способами, важными для того, кто сверяет счёт. Claude Platform на AWS и Claude в Microsoft Foundry оба выставляют счёт в Claude Consumption Units по фиксированной $0.01 за CCU, с почасовым замером и месячным счётом. Документация Anthropic описывает это как «Arrears only (postpaid); no prepaid credits», и ваш облачный счёт показывает одну строку CCU, а не разбивку по моделям. Если ваше распределение затрат зависит от того, чтобы видеть, какая модель сколько потратила, эта сверка происходит в консоли вендора, а не в Cost Explorer.

Bedrock также назначает цены по регионам, с отдельными таблицами для US East, Frankfurt, Sydney и других, и делит инференс на уровни Standard, Flex, Priority и Reserved. Провижн-пропускная способность указывается за единицу модели в час, а не за токен, и для моделей Anthropic страница вообще не публикует ставку: она говорит вам обратиться в свою аккаунт-команду, что является справедливым итогом всей категории. Vertex назначает кешированный вход по 10% от стандарта, тот же коэффициент, что и у первоисточника.

Покупайте здесь, когда у вас есть законтрактованные расходы на выработку, когда закупка воспринимает нового вендора как проект на квартал, или когда комплаенс становится легче в тот момент, когда трафик остаётся внутри аккаунта, которым вы уже владеете. Покупайте в другом месте, когда хотите новейшую модель, самую низкую цену, или API-ключ вместо IAM-роли. Аутентификация в этой категории это реальная работа: подписание SigV4 или учётные данные сервисного аккаунта вместо bearer-токена, день инженерии в первый раз и немного больше каждый раз, когда новому сервису нужен доступ.

Математика цен: одна и та же нагрузка, четырьмя способами

Прайс-листы не отвечают на вопрос, который люди на самом деле задают, а именно что говорит счёт. Три нагрузки, которые я вижу постоянно, по проверенным выше ставкам.

Нагрузка A. Клиентский ассистент на фронтир-модели. 20M входных и 5M выходных токенов в месяц на Claude Opus 5.

МаршрутРасчётВ месяц
Anthropic напрямую, глобальный эндпоинт20 × $5 + 5 × $25$225
Роутер по прайсуТе же ставки$225
Партнёрское облако, региональный эндпоинт$225 × 1.10$247.50
Anthropic Batch API, если работа может подождать20 × $2.50 + 5 × $12.50$112.50

Тип, у которого вы покупаете, двигает этот счёт на 10%. То, можно ли работу пакетировать, двигает его на 50%. Этот порядок держится для большинства команд, и поэтому «какой провайдер дешевле» это неправильный первый вопрос.

Нагрузка B. Бэкенд агента на объёме. 200M входных и 50M выходных токенов в месяц, дешёвый уровень.

МаршрутРасчётВ месяц
DeepSeek V4 Flash, нативные ставки200 × $0.14 + 50 × $0.28$42
gpt-oss-120B на Together200 × $0.15 + 50 × $0.60$60
gpt-5.6-luna, прайс OpenAI200 × $0.20 + 50 × $1.20$100
gpt-5.6-luna, через листинг всё ещё на уровне до снижения200 × $1 + 50 × $6$500
Gemini 3.6 Flash200 × $1.50 + 50 × $7.50$675

Разброс внутри одного уровня качества это 16x, и одна его строка это не что иное, как устаревший прайс-лист. Именно здесь проверка конкретной страницы модели окупается за полдня.

Нагрузка C. Офлайн-классификация. 500M входных и 20M выходных токенов в месяц на Claude Haiku 4.5.

МаршрутРасчётВ месяц
Claude Haiku 4.5, Batch API со скидкой 50%500 × $0.50 + 20 × $2.50$300
Claude Haiku 4.5, стандартные ставки500 × $1 + 20 × $5$600
Gemini 3.6 Flash на Vertex, стандартный уровень500 × $1.50 + 20 × $7.50$900
Gemini 3.6 Flash на Vertex, приоритетный уровень500 × $2.70 + 20 × $13.50$1,620

Первые две строки это один и тот же запрос к одной и той же модели, различающийся вдвое, разделённый только тем, готовы ли вы были подождать. Добавьте выбор модели и уровня, и разброс на одной ничем не примечательной нагрузке идёт от $300 до $1,620. Почти никто из тех, кто мог бы гонять нагрузку C в пакетном режиме, этого не делает.

Столбчатая диаграмма месячной стоимости одной и той же нагрузки 200M входных и 50M выходных токенов по пяти маршрутам: DeepSeek V4 Flash $42, gpt-oss-120B у Together $60, gpt-5.6-luna у OpenAI $100, устаревший листинг той же модели Luna у шлюза $500 и Gemini 3.6 Flash $675

Затраты, которых нет на странице цен

У каждой категории есть одна статья расходов, невидимая, пока не придёт.

ТипНевидимая затратаКак это выглядит
НативныйИнтеграция, умноженная на число вендоровЧетыре SDK, четыре политики повторов, четыре свода правил по лимитам без общей терминологии
НативныйИзменения токенизатораДокументация Anthropic отмечает, что Claude 4.7 и позднее используют токенизатор, производящий примерно на 30% больше токенов на тот же текст, так что обновление модели по той же цене всё равно может повысить ваш счёт
Хостер открытых весовПростаивающие часы GPUВыделенная мощность выставляет счёт и за впадину, и за пик; рваный трафик сжигает точку безубыточности
Хостер открытых весовОтток каталогаID preview-модели может быть отозван в короткий срок, по собственному предупреждению вендора
РоутерПлатёжные комиссии5.5% на пополнение картой у OpenRouter, плюс 5% за BYOK свыше 1M запросов в месяц
РоутерОтставание прайс-листаСтрока Luna выше: 5x над прайсом три дня после снижения вендором
ОблакоИнженерия аутентификацииIAM-роли и подписание запросов вместо bearer-токена, по разу на сервис
ОблакоСложение надбавокРегиональный 1.10 × приоритетный 1.8 складываются, прежде чем вы заметите
Все четыреОтказ от пакетирования50% оставлено на столе на каждой нагрузке, которая могла бы подождать час

Строка про токенизатор это та, которую никто не планирует. Обновление модели при идентичной цене за токен всё равно может повысить ваш счёт, если новый токенизатор плотнее, и никакая таблица сравнения цен вам этого не покажет.

Когда нужны два типа, и когда одного достаточно

Одного типа достаточно, когда ваш трафик идёт на одной или двух моделях, час простоя это раздражение, а не инцидент, и ваши месячные траты достаточно малы, чтобы разница в 10% не стоила интеграции. Это описывает большинство команд дольше, чем они ожидают.

Второй тип нужен, как только становится верным одно из трёх. Сбой модели обходится вам дороже, чем стоило бы построить запасной вариант, и в этом случае роутер это самый дешёвый второй маршрут, потому что переключение при отказе это то, что он продаёт. Ваш финансовый процесс не может переварить ещё одного вендора, и в этом случае облачная платформа решает проблему, которую никакая ценовая оптимизация не решит. Или ваш объём на одной конкретной модели достаточно велик, чтобы выделенное развёртывание обыгрывало оплату за токен, что ставит вас на хостера открытых весов независимо от того, что ещё вы гоняете.

Пара, которая появляется чаще всего, это нативный ключ плюс роутер. Нативный ключ несёт основной трафик и даёт вам модели в день релиза и самый высокий потолок лимитов. Роутер это аварийный выход, уже интегрированный, держащий небольшой баланс, в одной строке ID модели от того, чтобы взять на себя работу.

Чего вам делать не стоит, так это покупать второго вендора того же типа и называть это резервированием. Два роутера, направленные на один и тот же апстрим-провайдер, отказывают вместе.

Смена типов без переписывания клиента

Выбор типа обратим, потому что три из четырёх категорий говорят на формате OpenAI Chat Completions. Нативный OpenAI, большинство хостеров открытых весов и большинство роутеров принимают одно и то же тело запроса, так что базовый URL и строка модели это единственное, что меняется.

Python

import os
from openai import OpenAI

ROUTES = [
    ("https://api.openai.com/v1",  "gpt-5.6-luna"),
    ("https://api.ofox.io/v1",     "deepseek/deepseek-v4-flash"),
    ("https://api.ofox.io/v1",     "anthropic/claude-opus-5"),
]

for base_url, model in ROUTES:
    client = OpenAI(base_url=base_url, api_key=os.environ["API_KEY"])
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": "Summarize this in one line."}],
    )
    print(model, r.usage.total_tokens, r.choices[0].message.content[:80])

Node

import OpenAI from "openai";

const routes = [
  ["https://api.openai.com/v1", "gpt-5.6-luna"],
  ["https://api.ofox.io/v1", "deepseek/deepseek-v4-flash"],
  ["https://api.ofox.io/v1", "anthropic/claude-opus-5"],
];

for (const [baseURL, model] of routes) {
  const client = new OpenAI({ baseURL, apiKey: process.env.API_KEY });
  const r = await client.chat.completions.create({
    model,
    messages: [{ role: "user", content: "Summarize this in one line." }],
  });
  console.log(model, r.usage.total_tokens, r.choices[0].message.content.slice(0, 80));
}

Прогоните этот цикл на своих собственных промптах, прежде чем зафиксировать тип. Число токенов различается между моделями сильнее, чем цены, и модель, которая в 3x дешевле за токен, но тратит в 4x больше выходных токенов, не дешевле. В каталоге моделей ofox есть текущие ставки по каждой модели, если вам нужны сегодняшние числа, а не числа этой статьи.

Облачные платформы это категория, которая не вписывается в этот паттерн, и это честная причина, почему с ними больше работы. Bedrock и Vertex хотят подписанные запросы и платформенные SDK, так что переход на них или с них это миграция, а не две отредактированные строки.

Источники, проверенные для этого обновления

  • Цены на модели Anthropic, пакетирование, кеширование, партнёрские облака и биллинг CCU: platform.claude.com/docs/en/about-claude/pricing (проверено 2026-08-02)
  • Прайс-лист GPT-5.x у OpenAI и скидка на пакетирование: developers.openai.com/api/docs/pricing (проверено 2026-08-02)
  • Цены Vertex AI Gemini, таблицы стандартного и приоритетного уровня, глобальные против неглобальных ставок, скидка на пакетирование: cloud.google.com/vertex-ai/generative-ai/pricing, что теперь перенаправляет на страницу цен Agent Platform (проверено 2026-08-02)
  • Уровни цен Amazon Bedrock, скидка на пакетирование, обязательства по провижн-пропускной способности, таблицы по регионам: aws.amazon.com/bedrock/pricing (проверено 2026-08-02)
  • Структура комиссий OpenRouter, все цитаты: openrouter.ai/docs/faq (проверено 2026-08-02)
  • Бессерверные, выделенные и кластерные цены Together: together.ai/pricing (проверено 2026-08-02)
  • Цены на GPU по запросу у Fireworks: fireworks.ai/pricing (проверено 2026-08-02)
  • Политика production против preview у Groq, цены за токен и цифры пропускной способности: console.groq.com/docs/models (проверено 2026-08-02)
  • Цены по каждой модели и размер каталога ofox: страницы моделей под ofox.ai/ru/models/, плюс живой вызов GET /v1/models; базовые URL протоколов из ofox.ai/llms-full.txt (проверено 2026-08-02)

Часто задаваемые вопросы

Какой поставщик LLM API лучший?
Единственного лучшего нет, потому что четыре типа продают разное. Нативные API (OpenAI, Anthropic, Google) продают каноническую цену и доступ к новым возможностям с нулевого дня. Хостеры открытых весов (Together, Fireworks, Groq) продают дешёвые токены на моделях, которыми никто не владеет эксклюзивно. Роутеры продают один ключ и один счёт для множества вендоров. Облачные платформы (Bedrock, Vertex, Microsoft Foundry) продают закупку, так что ваши расходы на LLM попадают в счёт, который финансовый отдел уже одобрил. Сначала выберите тип, затем вендора внутри него. Большинство команд, проработавших год, оказываются на двух типах, а не на одном.
OpenRouter дешевле, чем работать напрямую?
Не по инференсу. Собственный FAQ OpenRouter гласит, что 'there is no markup on inference pricing (however we do charge a fee when purchasing credits)' и что вы 'pay the same rate as you would directly with the provider.' Затраты проявляются при пополнении баланса: 'a 5.5% ($0.80 minimum) fee when you purchase credits' и 5% на крипту. При месячных тратах в $600 это примерно $33. Маршрутизация через собственный ключ несёт отдельную комиссию 5%, как только вы перейдёте порог в 1M BYOK-запросов в месяц. Так что строка по токенам одна и та же, а строка по оплате нет.
Какой самый дешёвый LLM API в 2026?
Для текстовых задач это уровень открытых весов. На момент проверки 2026-08-02 DeepSeek V4 Flash указан по $0.14 на вход / $0.28 на выход за 1M токенов, а Together предоставляет gpt-oss-120B за $0.15 / $0.60 и gpt-oss-20B за $0.05 / $0.20. Фронтир-модели стоят в 20x до 100x дороже: Claude Opus 5 стоит $5 / $25, а GPT-5.5 стоит $5 / $30. Самый дешёвый ценник не всегда означает самый дешёвый счёт, потому что многословные рассуждающие модели тратят больше выходных токенов на ту же задачу.
Использовать Amazon Bedrock или Anthropic API напрямую?
Используйте Bedrock, когда решающий фактор это закупка: у вас есть законтрактованные расходы на AWS, которые нужно выработать, вам нужно, чтобы списание попало в существующий счёт, или ваша проверка безопасности проходит легче, если трафик не покидает аккаунт, которым вы уже владеете. Используйте Anthropic API напрямую, когда хотите самую низкую цену и новые возможности первыми. Документация по ценам Anthropic отмечает, что региональные и мультирегиональные эндпоинты в партнёрских облаках несут наценку 10% относительно глобальных эндпоинтов, и что некоторые фирменные возможности, среди них fast mode, вообще недоступны на платформах, управляемых партнёрами.
Добавляют ли шлюзы LLM API наценку?
Одни добавляют, другие нет, и честный ответ в том, что нужно проверять конкретную модель, а не верить общим утверждениям. При выборочной проверке шести страниц моделей 2026-08-02 ofox точно совпал с прайс-листом вендора на пяти из них (Claude Opus 5 за $5/$25, Claude Sonnet 5 за $2/$10, GPT-5.5 за $5/$30, Gemini 3.6 Flash за $1.50/$7.50, DeepSeek V4 Flash за $0.14/$0.28) и был выше прайса на шестой: GPT-5.6 Luna показал $1/$6 против $0.20/$1.20 у OpenAI после снижения цены. Прайс-листы шлюзов это снимки, и снижение цены вендором в середине цикла может доходить до них не сразу.
В чём разница между шлюзом LLM API и провайдером инференса?
Провайдер инференса владеет GPU или арендует их и запускает веса модели. Together, Fireworks, Groq и нативные лаборатории это провайдеры инференса. Шлюз вообще не выполняет инференс; он принимает ваш запрос, выбирает провайдера, пересылает его и нормализует ответ. Именно поэтому шлюз может перечислять 100+ моделей, которые он не хостит, и именно поэтому сбой шлюза это другой режим отказа, чем сбой модели. Некоторые продукты делают и то, и другое, так что читайте страницу модели, а не маркетинговую страницу.
Можно ли использовать один API-ключ для OpenAI, Claude и Gemini?
Да, это и есть основной продукт, который продаёт роутер. Три формата провода разные, так что интересный вопрос в том, какие из них поддерживает конкретный роутер. ofox документирует один базовый URL на протокол: https://api.ofox.io/v1 для формата OpenAI Chat Completions, https://api.ofox.io/anthropic для формата Messages API и https://api.ofox.io/gemini для формата Gemini. Это важно, потому что инструменты вроде Claude Code и Codex CLI говорят каждый на своём формате и не пойдут на компромисс.
Нужен ли мне более одного поставщика LLM API?
Второй маршрут нужен, как только сбой модели обходится вам дороже, чем работа по интеграции. Ниже этой черты одного провайдера и политики повторов достаточно. Выше неё самый дешёвый второй маршрут это обычно другой тип, а не второй вендор того же типа, потому что вы страхуетесь именно от коррелированного отказа. Нативный ключ плюс роутер это распространённая пара: нативный ключ даёт вам новейшие возможности и самый высокий потолок лимитов, а роутер даёт вам куда переключиться при отказе без нового контракта.