Цены Grok 4.6 API: обрыв на 200K и когда выигрывает 4.5

Grok 4.6 стоит $2 за вход и $6 за выход, но как только промпт достигает 200K, все токены удваиваются. Плюс замеренная фиксированная надбавка на каждый запрос.

Цены Grok 4.6 API: обрыв на 200K и когда выигрывает 4.5

Grok 4.6 стоит $2.00 за миллион входных токенов и $6.00 за выход, то есть ровно столько же, сколько Grok 4.5. Две карточки моделей совпадают во всём остальном, вплоть до лимитов скорости. Отличается одно число — кэшированный ввод — и дороже оказалась более новая модель.

Число покрупнее вообще не является различием между моделями: на 200 000 токенах промпта все ставки удваиваются, и удваиваются для всего запроса.

ID моделей:     grok-4.6 / grok-4.5  (в шлюзах x-ai/grok-4.6)
Контекст:       500K у обеих
До 200K:        $2.00 вход / $6.00 выход    у обеих моделей
                кэш $0.50 у 4.6, $0.30 у 4.5
200K и выше:    $4.00 вход / $12.00 выход   у обеих моделей
                кэш $1.00 у 4.6, $0.60 у 4.5
Порог:          применяется ко ВСЕМ токенам запроса, не к превышению
Замеры:         фиксированная надбавка 206 токенов у 4.6, 494 у 4.5
Равновесие:     ~575 кэшированных токенов; ниже — 4.6 дешевле за вызов
Снимок:         2026-08-19

Сколько стоит API Grok 4.6?

$2.00 вход, $0.50 кэшированный ввод, $6.00 выход за миллион токенов — пока промпт не достиг 200K. Прямо из списка моделей xAI, чей сайт документации теперь называет себя SpaceXAI:

МодельКонтекстВходКэш. вводВыход
grok-4.6, промпт меньше 200K500K$2.00$0.50$6.00
grok-4.6, промпт 200K и выше500K$4.00$1.00$12.00
grok-4.5, промпт меньше 200K500K$2.00$0.30$6.00
grok-4.5, промпт 200K и выше500K$4.00$0.60$12.00
grok-4.31M$1.25$0.20$2.50

grok-4.3 в этой таблице не случайно. Она дешевле любого из флагманов 4.x на 38% по входу и на 58% по выходу, а контекст у неё 1M вместо 500K. Если вашей нагрузке не нужна самая новая модель, ступень ниже — это не мелкая экономия.

Шлюзы передают заявленную ставку без изменений. OpenRouter и ofox оба показывают x-ai/grok-4.6 по $2.00 и $6.00 при контексте 500 000. Чего не показывает ни один каталог — второй строки. Списки моделей в шлюзах обычно несут одну пару цен на модель, поэтому удвоение выше 200K невидимо до счёта. Читайте это в таблице xAI, а не в поле каталога.

Что происходит, когда промпт переходит 200K?

Весь запрос пересчитывается, а не только превышение. Формулировка xAI однозначна: запросы, промпт которых достигает порога, тарифицируются по высокой ставке для всех токенов запроса.

Два запроса, отличающиеся на 2 000 токенов, у обоих 2 000 токенов вывода:

Размер промптаСтоимость входаСтоимость выходаИтого
199 000 токенов$0.398$0.012$0.410
201 000 токенов$0.804$0.024$0.828

Промпт больше на 1%, счёт больше на 102%. Плавного склона здесь нет, и частичного зачёта для токенов ниже линии тоже.

Практическое следствие: 200K — жёсткий потолок для работы, чувствительной к цене, а не мягкий, даже при окне контекста в 500K. Всё, что выходит за 40% окна, уже на дорогой ставке.

Две вещи делают эту линию проще для пересечения, чем кажется. Во-первых, порог считает промпт, поэтому длинный диалог подходит к нему по одному ходу и переступает его, хотя ни одно отдельное сообщение не было большим. Во-вторых, в промпте лежит не только ваш промпт, и это тема следующего раздела.

Если вы гоняете батчи, решение — резать до линии, а не после. Два запроса по 150K стоят $0.60 по входу; один запрос на 300K за те же токены стоит $1.20.

В чём разница между Grok 4.6 и Grok 4.5?

В одном числе на опубликованных карточках. Мы вытащили обе карточки и разложили каждое поле рядом:

ПолеGrok 4.6Grok 4.5
Окно контекста500 000500 000
Модальноститекст, изображение → тексттекст, изображение → текст
Function callingДаДа
Structured outputsДаДа
ReasoningДаДа
Запросов в секунду150150
Токенов в минуту50 000 00050 000 000
Регионыus-east-1, us-west-2us-east-1, us-west-2
Вход / выход$2.00 / $6.00$2.00 / $6.00
Кэшированный ввод$0.50$0.30
Псевдонимыне указаныgrok-4.5-latest, grok-build-latest

Кэшированный ввод у более новой модели дороже на 67%. Это направление, обратное обычному, и это всё опубликованное основание для того, чтобы держать 4.5 под рукой.

На строку с псевдонимами стоит взглянуть дважды, если вы пользуетесь Grok Build: grok-build-latest указывает на Grok 4.5, а не на 4.6. Если вы предполагали, что ступень Build следует за флагманом, — она не следует. Где подписка выигрывает у оплаты по факту, разобрано в нашем сравнении Grok Build и стоимости API.

Почему один и тот же промпт дороже на Grok 4.5?

Потому что с каждым запросом едет фиксированный блок входных токенов, и на 4.5 он больше чем в два раза крупнее.

19 августа 2026 года мы отправили четырём моделям через OpenAI-совместимый шлюз идентичные тела из 1, 50 и 200 повторяющихся слов и построили прямую. Все модели посчитали тело ровно по 1.00 токена на слово. Не совпали свободные члены:

МодельФиксированная надбавкаИз них помечено как кэш
x-ai/grok-4.6206 токенов128
x-ai/grok-4.5494 токена384
x-ai/grok-4.34 токенанет
z-ai/glm-5.312 токеновнет

Четыре и двенадцать — это обычный шаблон чата. Двести шесть и четыреста девяносто четыре — это преамбула. Добавление своего сообщения system увеличило оба числа ровно на размер этого сообщения, 7 токенов, так что блок лежит под тем, что вы отправляете, а не заменяется им.

Второго маршрута для проверки у нас не было, поэтому источник считаем неподтверждённым: надбавка едет вместе с моделью, а не с маршрутом, поскольку у 4.3 и у модели не от xAI на том же эндпоинте её нет, но подтвердить происхождение из апстрима можно только прямым ключом. В любом случае она попадает в ваш счёт, так что её надо считать.

По опубликованным ставкам, до того как вы отправили хотя бы один свой токен:

Grok 4.6Grok 4.5
Кэшированная часть128 × $0.50/M = $0.000064384 × $0.30/M = $0.000115
Некэшированная часть78 × $2.00/M = $0.000156110 × $2.00/M = $0.000220
За запрос$0.000220$0.000335
За 1M запросов$220$335

Более дешёвый кэш у 4.5 реален, но на коротких вызовах крупная преамбула съедает его с запасом.

Она съедает и ваш запас по длине. На 4.5 вы доходите до обрыва в 200K на 494 токена раньше, чем показывает ваш собственный подсчёт, а на 4.6 — на 206 токенов раньше. Если вы планируете промпт ровно в 199 800 токенов, вы уже за чертой.

Что дешевле для вашей нагрузки?

Около 575 кэшированных токенов ответ меняется.

Арифметика достаточно простая, чтобы проверить вручную. Grok 4.5 экономит $0.20 на миллион кэшированных токенов, то есть $0.0000002 на токен. И теряет $0.000115 на запрос из-за большей преамбулы. Делим одно на другое и получаем 575 токенов.

  • Кэшированная преамбула меньше ~575 токенов: Grok 4.6 дешевле за вызов
  • Больше ~575 токенов: дешевле Grok 4.5, и разрыв растёт линейно
  • Кэшированный system-промпт и схема инструментов на 100K токенов экономят на 4.5 $0.02 за запрос, это примерно в 170 раз больше штрафа за преамбулу

Порог 200K эту линию не сдвигает. Выше него все ставки у обеих моделей удваиваются, преимущество кэша удваивается до $0.40 за миллион, штраф за преамбулу тоже удваивается, поэтому точка равновесия остаётся около 575 токенов.

Это про вход. По выходу модели действительно расходятся, и логика кэша здесь не работает вообще. Мы прогнали один и тот же промпт генерации кода по 8 раз на каждой:

Grok 4.6Grok 4.5
completion_tokens, медиана216225
reasoning_tokens, медиана72330
Тарифицируемый выход, медиана948263
Задержка, медиана15.8 с5.0 с
Стоимость 1 000 задач, всё включено$6.18$2.64

Последняя строка — единственная в таблице, которая не относится к выходу, поэтому вот её база. Это выход по $6.00 за миллион плюс весь вход по $2.00 за миллион, причём во вход входит фиксированная надбавка из предыдущего раздела: 244 входных токена у 4.6 и 532 у 4.5. Только выход дал бы $5.69 и $1.58. На этих конкретных прогонах мы не фиксировали попадания в кэш, поэтому вход посчитан целиком по некэшированной ставке, и итоговая цифра — верхняя оценка; если преамбула отдавалась из кэша, получается ближе к $5.98 и $1.99. Порядок при этом не меняется.

Все 16 ответов содержали определение функции и docstring — это структурная проверка, а не суждение о качестве; код мы не оценивали. Не вызывают сомнений траты: на этой задаче Grok 4.6 списал в 3.6 раза больше выходных токенов и занял в 3.2 раза больше реального времени, при том что работу выполнили обе модели.

Обратите внимание на имена полей. На этих моделях completion_tokens не включает reasoning-токены: рядом с ответом на 216 completion-токенов стояли 723 reasoning-токена, а total_tokens был суммой prompt, completion и reasoning. Любая оценка стоимости, построенная на prompt_tokens × вход + completion_tokens × выход, недосчитывает на этой нагрузке 77% выхода и около 71% всего вызова. Ошибка одного этого поля больше любой ценовой разницы на этой странице.

Коротко: 4.5 — для длинных кэшированных преамбул и для коротких детерминированных задач, где вы не хотите платить за размышления; 4.6 — когда дополнительные рассуждения и есть цель.

Как вызвать Grok 4.6?

Совместимо с OpenAI, так что это базовый URL и строка модели.

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.io/v1")

r = client.chat.completions.create(
    model="x-ai/grok-4.6",          # x-ai/grok-4.5 для более дешёвого кэша
    messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
)
u = r.usage
billed_output = u.completion_tokens + u.completion_tokens_details.reasoning_tokens
print(u.prompt_tokens, billed_output)

Три вещи, на которых спотыкаются на входе:

  • В шлюзах у ID есть пространство имён. Напрямую к xAI работает grok-4.6; в OpenRouter и ofox это x-ai/grok-4.6. Дефис важен.
  • logprobs падает молча. xAI документирует его как неподдерживаемый в grok-4.20 и новее и говорит, что поле игнорируется. Мы отправили logprobs: true с top_logprobs: 3 обеим моделям: HTTP 200, без ошибки и без объекта logprobs в ответе. Ничто не сообщает, что оно не сработало.
  • Обе модели только в us-east-1 и us-west-2. Если у вас требования к размещению данных вне США, эта пара не подходит независимо от цены.

Скидка 15% на пополнение до 2026-08-31 в ofox ставит x-ai/grok-4.6 и x-ai/grok-4.5 на один ключ и один эндпоинт рядом примерно с 130 другими моделями, что и делает A/B выше заменой одной строки. Актуальные каталожные характеристики — на страницах моделей Grok 4.6 и Grok 4.5.

Лимиты скорости у разных провайдеров сведены в нашем сравнении rate limits у LLM API. Старую линейку Grok и настройку ключа от начала до конца по-прежнему покрывает гайд по ценам и доступу к Grok API.

Источники

Часто задаваемые вопросы

Сколько стоит API Grok 4.6?
$2.00 за миллион входных токенов, $0.50 за кэшированный ввод и $6.00 за выход, пока промпт остаётся меньше 200 000 токенов. При 200 000 и больше ставки становятся $4.00, $1.00 и $12.00, причём высокая ставка применяется ко всем токенам запроса, а не только к превышению.
В чём разница между Grok 4.6 и Grok 4.5?
В опубликованных карточках моделей — одно число. Обе имеют 500K контекста, текст и изображение на входе и текст на выходе, function calling, structured outputs и reasoning, 150 запросов в секунду, 50M токенов в минуту, доступны в us-east-1 и us-west-2, и стоят одинаково: $2.00 вход и $6.00 выход. Единственное указанное отличие — кэшированный ввод: $0.50 у 4.6 против $0.30 у 4.5.
Grok 4.5 дешевле, чем 4.6?
Зависит от того, какая доля промпта кэширована. Чтение из кэша у 4.5 дешевле на 40%, но в наших замерах у 4.5 больше фиксированная надбавка на каждый запрос: около 494 входных токенов против 206 у 4.6. Точка равновесия — примерно 575 кэшированных токенов: ниже неё дешевле 4.6, выше — 4.5.
На пороге 200K по высокой ставке считаются только токены сверх порога?
Нет. Документация xAI прямо говорит, что запросы, промпт которых достигает порога, тарифицируются по высокой ставке для всех токенов запроса. Переход с промпта в 199K на 201K примерно удваивает счёт, а не добавляет 1%.
Какой ID модели у Grok 4.6?
grok-4.6 в собственном API xAI. В шлюзах идентификатор с пространством имён: x-ai/grok-4.6 и в OpenRouter, и в ofox. У Grok 4.5 дополнительно есть псевдонимы grok-4.5-latest и grok-build-latest, то есть grok-build-latest указывает на 4.5, а не на 4.6.
Поддерживает ли Grok 4.6 logprobs?
Нет. xAI документирует logprobs и top_logprobs как неподдерживаемые в grok-4.20 и новее и указывает, что поля молча игнорируются. Мы это проверили: запрос возвращает HTTP 200 без ошибки и без объекта logprobs в ответе, так что зависящий от них конвейер ломается тихо, а не громко.
Сколько токенов на самом деле тратит Grok 4.6?
Больше, чем показывает поле completion. На небольшой задаче генерации кода за 8 прогонов Grok 4.6 отчитался медианой 216 completion-токенов плюс 723 reasoning-токена, а Grok 4.5 — 225 и 30. Reasoning-токены считаются отдельно от completion_tokens, но входят в total_tokens.