Qwen3.8-Max-0902: та же цена, на 38 входных токенов больше за вызов

Снапшот 0902 тарифицируется так же, как августовская сборка, по $2/$6 за миллион, но мы измерили фиксированные +38 токенов промпта на каждом вызове. Во что это обходится и когда закреплять версию.

Qwen3.8-Max-0902: та же цена, на 38 входных токенов больше за вызов

Снапшот 0902 у Qwen3.8-Max стоит ровно столько же, сколько предыдущая сборка: $2.00 за миллион входных токенов и $6.00 за миллион выходных. При этом он тратит на 38 входных токенов больше на каждом запросе. Мы измерили этот разрыв на трёх промптах и получили 38 токенов каждый раз, без разброса. Всё изложенное ниже — из живого каталога Ofox и живых вызовов API 4 сентября 2026 года.

Что мы измерили

Один и тот же промпт, одни и те же параметры, две строки модели. Единственное различие — какой снапшот отвечает.

Промптqwen3.8-maxqwen3.8-max-0902Разница
Reply with exactly: ok2866+38
What is 2+2?3068+38
Rewrite this GROUP BY as a window function.3371+38

Это usage.prompt_tokens из /v1/chat/completions, тело запроса одинаковое во всём, кроме строки модели. Постоянное смещение на трёх промптах разной длины означает фиксированные накладные расходы, добавляемые в начало каждого вызова, а не изменение токенизатора, которое масштабировалось бы с длиной входа.

При $2.00 за миллион входных токенов 38 токенов стоят $0.000076 за запрос. Это ничто на горстке вызовов и реальные деньги на объёме:

ЗапросовДополнительных входных токеновДополнительная стоимость
10 000380 000$0.76
1 000 00038 000 000$76
10 000 000380 000 000$760

Честный итог такой: цена за токен не изменилась, изменился пол на каждом вызове, и важно это или нет — функция от количества ваших запросов, а не от объёма токенов. Сильнее всего это чувствуют высокочастотные нагрузки с короткими промптами, потому что 38 токенов поверх промпта в 28 токенов больше чем удваивают входную часть.

Прейскурант идентичен

Ставка за 1M токеновqwen3.8-maxqwen3.8-max-0902
Вход$2.00$2.00
Выход$6.00$6.00
Чтение кеша$0.25$0.25
Запись в кеш$2.50$2.50
Веб-поиск$0.01 за вызов$0.01 за вызов

Прочитано из объекта pricing в живом ответе /v1/models 4 сентября 2026 года. Совпадает каждое поле. Снапшот, который улучшает возможности, не поднимая ставку, — это хороший случай; как эти ставки соотносятся с предыдущим поколением флагманов и с прямым обращением к QwenCloud, разобрано в руководстве по ценам и доступу Qwen3.8 Max.

Что, по словам Alibaba, изменилось

Программирование, способность агентов к совместной работе и понимание изображений. Описание в каталоге для снапшота от 2026-09-02 указывает на существенно усиленные способности к кодированию и агентской кооперации с оптимизированным пониманием изображений, явно сохраняя контекст в 1M, режим глубоких рассуждений и приём изображений и видео из предыдущей сборки.

Чего в этом описании нет, так это цифр бенчмарков, поэтому сверить пока не с чем. Считайте заявление о возможностях словами вендора, а измерение в 38 токенов — той частью, которую можно проверить независимо, потому что её действительно можно.

Строке с контекстным окном нужна оговорка

Обе сборки — модели с контекстом 1M, но каталог сообщает о них по-разному. Недатированная сборка сообщает context_length: 1131072; снапшот 0902 сообщает 1000000. Оба описания говорят про 1M, и оба сообщают одинаковый максимум ответа в 131 072 токена.

Это выглядит как урезание возможностей и почти наверняка им не является. 1 131 072 — это 1 048 576 плюс 82 496, что читается скорее как потолок входа с некоторым запасом, чем как круглая заявленная величина; 1 000 000 — как раз круглое маркетинговое число. Безопасное прочтение: изменилось соглашение об отчётности, а не модель. Небезопасное — заключить из меньшего числа, что Alibaba сократила окно, и затем проектировать под ограничение, которого может не существовать.

Если ваша нагрузка действительно подходит к миллиону токенов контекста, измерьте реальный потолок на том снапшоте, который собираетесь выпускать, а не доверяйте ни одному из чисел в каталоге. Всё ниже 1 000 000 токенов безопасно на обеих.

Всё остальное совпадает

АтрибутОбе сборки
Максимум токенов ответа131 072
Входные модальноститекст, изображения
Выходные модальноститекст
Эндпоинты/v1/chat/completions, /v1/responses
Параметрыtemperature, top_p, max_tokens, stop, tools, tool_choice, response_format, reasoning
Токенизаторqwen

Список параметров совпадает побайтово, и именно поэтому миграция сводится к смене одной строки:

- "model": "bailian/qwen3.8-max"
+ "model": "bailian/qwen3.8-max-0902"

Ловушка, о которой стоит знать: пустой content

Обе сборки — модели с рассуждением, и это порождает результат, который выглядит как сбой, но им не является:

{"usage": {"prompt_tokens": 66, "completion_tokens": 20,
           "completion_tokens_details": {"reasoning_tokens": 20}}}

Двадцать токенов ответа, все они — токены рассуждения, а content вернулся пустой строкой. Ничего не сломалось. При max_tokens, равном 20, на модели с рассуждением бюджет был потрачен на размышление до того, как был выдан хоть один видимый символ, и ответ обрезался по потолку.

Чинится это повышением max_tokens, а не повтором запроса и не сменой модели. Практическое правило: на модели с рассуждением max_tokens должен покрывать и рассуждение, и ответ, а рассуждение тарифицируется по выходной ставке независимо от того, видите вы его или нет. Планирование max_tokens как длины ответа — это то, из-за чего рабочая модель выглядит сломанной.

Закрепить дату или следовать за указателем

bailian/qwen3.8-max-0902 заморожен. bailian/qwen3.8-max — нет.

Закрепляйте датированную строку, когда:

  • Вывод должен быть воспроизводимым, например в рамках процесса ревью или согласования.
  • Большая библиотека промптов проверена под одну сборку, и повторная валидация дорога.
  • Вы хотите сами управлять моментом, когда поведение изменится, а не обнаруживать это в продакшене.

Используйте недатированную строку, когда:

  • Вы предпочитаете следовать текущей рекомендации Alibaba без передеплоя.
  • Ваши промпты достаточно устойчивы, чтобы смена снапшота не была риском регресса.

Компромисс обычный, и цена есть у обеих сторон: закрепление означает, что улучшения перестают до вас доходить, пока вы не предпримете действие, а следование за указателем означает, что модель под вашим продуктом может измениться без всякого релиза с вашей стороны. Что бы вы ни выбрали, выбирайте осознанно, потому что вариант по умолчанию «та строка, которую я когда-то набрал» — это ровно тот путь, которым закреплённая навсегда модель тихо устаревает.

Где эта модель находится

На фоне более широкого поля Qwen3.8 Max по $2.00 / $6.00 — цена флагманского уровня. Вопрос более дешёвой альтернативы разобран в Qwen3.8 Max против DeepSeek V4 Flash, а запуск модели как бэкенда для программирования — в руководстве по настройке Codex CLI, и это как раз та нагрузка, которую снапшот 0902 заявляет как наиболее улучшенную.

Источники

Цены, длины контекста, параметры и модальности прочитаны из живого эндпоинта Ofox /v1/models 4 сентября 2026 года. Разница в 38 токенов измерена тремя живыми вызовами /v1/chat/completions на каждую модель в тот же день, с идентичными телами запросов во всём, кроме строки модели.

Часто задаваемые вопросы

Qwen3.8-Max-0902 дороже предыдущего снапшота?
Не за токен. Обе сборки тарифицируются по $2.00 за миллион входных токенов и $6.00 за миллион выходных на Ofox, с идентичными ставками за чтение кеша, запись в кеш и веб-поиск. За вызов — немного дороже: мы измерили, что снапшот 0902 потребляет ровно на 38 токенов промпта больше, чем недатированная сборка, на трёх разных промптах, то есть примерно $0.000076 за запрос по входной ставке.
Что изменилось в снапшоте 0902 у Qwen3.8-Max?
Описание в каталоге Alibaba для снапшота от 2026-09-02 указывает на существенно улучшенные способности к программированию и совместной работе агентов плюс оптимизированное понимание изображений, при сохранении контекста в 1M, глубоких рассуждений и приёма изображений и видео из предыдущей сборки. Цены, список параметров и эндпоинты не изменились.
Закреплять qwen3.8-max-0902 или использовать недатированную строку модели?
Закрепляйте датированную строку, когда нужен воспроизводимый вывод, например в рамках процесса согласования или когда библиотека промптов проверена под одну сборку. Используйте недатированную bailian/qwen3.8-max, когда хотите следовать текущей рекомендации Alibaba без передеплоя. Недатированная строка не заморожена и рано или поздно перейдёт на более новый снапшот.
У снапшота 0902 по-прежнему контекст в 1M?
Да. Ofox сообщает 1 000 000 токенов контекста у снапшота 0902 против 1 131 072 у недатированной сборки, и оба описания говорят про 1M. Разница в том, как сообщается потолок, а не в урезании возможностей, и обе принимают максимум 131 072 токена в ответе.
Какие идентификаторы у двух сборок Qwen3.8-Max?
bailian/qwen3.8-max для недатированной сборки и bailian/qwen3.8-max-0902 для сентябрьского снапшота, который также отзывается на алиас qwen3.8-max-2026-09-02. Обе находятся на /v1/chat/completions и /v1/responses и принимают один и тот же набор параметров.
Почему мой ответ приходит с пустым content?
Потому что рассуждение израсходовало ваш бюджет токенов до того, как был выдан хоть какой-то видимый ответ. Обе сборки — модели с рассуждением, и при низком max_tokens объект usage показывает, что completion_tokens полностью потрачены как reasoning_tokens, а content пуст. Поднимите max_tokens, а не считайте, что модель сломалась.