Qwen 3.8 Flash API: $0.15/$0.47 и токены рассуждений, за которые вы платите
У Qwen 3.8 Flash самая низкая цена вывода в классе Flash — $0.47 за миллион. Это ещё и модель с рассуждениями: маленький max_tokens вернёт пустой ответ, за который вы всё равно заплатите.
Qwen 3.8 Flash стоит $0.15 за миллион входных токенов и $0.47 за выходные — самая низкая цена вывода в классе Flash. Это ещё и модель с рассуждениями, и вот на чём люди спотыкаются: задайте маленький max_tokens — и получите пустую строку, заплатив за токены, которых так и не увидели.
ID модели: bailian/qwen3.8-flash (псевдоним: qwen3.8-flash)
Цена: $0.15 вход / $0.47 выход за 1 млн
Контекст: 1 131 072 токена
Макс. вывод: 131 072 токена
Модальность: текст + изображение → текст
Эндпоинты: /v1/chat/completions, /v1/responses
Параметры: temperature, top_p, max_tokens, stop, tools,
tool_choice, response_format, reasoning
Считано с живого эндпоинта Ofox /v1/models 6 сентября 2026 года. Поведение ниже измерено на том же эндпоинте в тот же день.
Пустой ответ, на который натыкаются первым
Мы отправили max_tokens: 30 и получили пустую строку. Не ошибку — успешный ответ, за который выставлен счёт:
{"content": "",
"usage": {"prompt_tokens": 66, "completion_tokens": 30,
"completion_tokens_details": {"reasoning_tokens": 30}}}
Тридцать токенов ответа, все до одного — токены рассуждений, видимого текста нет. Модель израсходовала весь бюджет на размышления, не выдав ни единого символа ответа.
Два способа это исправить, оба измерены на одном и том же запросе:
| Конфигурация | completion_tokens | reasoning_tokens | content |
|---|---|---|---|
max_tokens: 30 | 30 | 30 | "" — пусто |
max_tokens: 800 | 27 | 23 | "ok" |
max_tokens: 50, effort: none | 1 | — | "ok" |
Поднять лимит работает, потому что модели требовалось всего 27 токенов, а ограничение в 30 обрывало её на середине размышления.
Отключить рассуждения работает лучше. Для настолько тривиального запроса effort: none дал тот же ответ за 1 токен вместо 27 — разница в 27 раз. На потоке коротких ответов это разница между $0.47 за миллион и малой долей от этой суммы.
Практическое правило для любой модели с рассуждениями: max_tokens должен покрывать и рассуждения, и сам ответ, а рассуждения тарифицируются по цене вывода независимо от того, видите вы их или нет. Планировать max_tokens как длину ответа — верный способ заставить работающую модель выглядеть сломанной.
Где $0.47 находится внутри класса Flash
Все тарифы из живого каталога Ofox, 6 сентября 2026 года:
| Модель | Вход / 1 млн | Выход / 1 млн | Контекст | Макс. вывод |
|---|---|---|---|---|
bailian/qwen3.8-flash | $0.15 | $0.47 | 1 131 072 | 131 072 |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1 048 576 | 131 072 |
deepseek/deepseek-v4-flash-0731 | $0.44 | $1.32 | 1 000 000 | 384 000 |
openai/gpt-5.6-luna | $1.00 | $6.00 | 1 050 000 | 128 000 |
google/gemini-3.8-flash | $1.50 | $7.50 | 1 000 000 | 65 536 |
Qwen 3.8 Flash и GLM-5.3 Flash фактически идут вровень — одинаковая цена входа и три цента разницы на выводе. Между этими двумя цена не решает ничего, и стоит прогнать обе на своей реальной задаче.
С остальным классом разрыв большой. Вывод Qwen 3.8 Flash в 2,8 раза дешевле, чем у DeepSeek V4 Flash, и в 16 раз дешевле, чем у Gemini 3.8 Flash.
Чего этот разрыв не показывает:
- У DeepSeek V4 Flash есть независимая оценка, у Qwen 3.8 Flash — нет. У DeepSeek V4 Flash 0731 88,80% на vals.ai SWE-Bench Verified — выше, чем у Claude Opus 4.8, — а Qwen 3.8 Flash в этом рейтинге вообще отсутствует. Вы платите меньше за модель, за которой стоит меньше публичных свидетельств. Возможно, это нормально, но знать об этом стоит.
- DeepSeek V4 Flash допускает ответ до 384 000 токенов против 131 072 у Qwen. Если вы генерируете очень длинные одиночные выводы, этот потолок важнее тарифа.
Во что это обходится на практике
При $0.15 / $0.47, с учётом оговорки про рассуждения выше:
| Нагрузка | Токены | Стоимость |
|---|---|---|
10 тыс. коротких классификаций (200 вход / 20 выход, effort: none) | 2 млн вход / 0,2 млн выход | $0.39 |
| 10 тыс. коротких классификаций (200 вход / 300 выход, рассуждения включены) | 2 млн вход / 3 млн выход | $1.71 |
| Документ на 1 млн токенов, один проход | 1 млн вход / 5 тыс. выход | $0.15 |
Первые две строки — одна и та же работа. Разница только в том, включены ли рассуждения: примерно 4,3 раза на нагрузке такой формы. Это то число, которое стоит усвоить, прежде чем выбирать эту модель для высоконагруженного конвейера.
Как вызывать
curl -X POST https://api.ofox.io/v1/chat/completions \
-H "Authorization: Bearer $OFOX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bailian/qwen3.8-flash",
"messages": [{"role": "user", "content": "Classify the sentiment: ..."}],
"reasoning": {"effort": "none"},
"max_tokens": 50
}'
На первых вызовах читайте usage.completion_tokens_details.reasoning_tokens. Если на задачах, не требующих обдумывания, это большая доля от completion_tokens, то effort: none — это деньги, лежащие под ногами.
Модель принимает не только текст, но и изображения, так что она закрывает и дешёвую работу со зрением — подписи, извлечение в духе OCR, классификацию скриншотов — по тарифу заметно ниже, чем у перечисленных выше Flash-моделей с поддержкой зрения.
Когда её не стоит брать
- Вам нужен независимый бенчмарк как обоснование выбора. Qwen 3.8 Flash нет ни в vals.ai SWE-Bench, ни в индексе Artificial Analysis. У DeepSeek V4 Flash при $0.44 / $1.32 есть опубликованные 88,80%.
- Вы генерируете очень длинные одиночные ответы. Потолок в 131 072 токена — треть от DeepSeek V4 Flash.
- Задача действительно сложная. Это модель класса Flash. Если результат решает точность на сложных рассуждениях, сравнение флагманов объясняет, что вы получаете за дополнительные деньги.
- Вы уже на GLM-5.3 Flash. Три цента за миллион вывода — не повод для миграции.
Читайте также
- Цены и доступ Qwen 3.8 Max — флагман того же семейства за $2.00 / $6.00.
- Qwen 3.8 Max против DeepSeek V4 Flash — тот же вопрос «дешёвая или флагман» классом выше.
- Qwen 3.8 27B локально — если дешёвый Qwen нужен вам потому, что на самом деле вы хотите развернуть его у себя.
Источники
- https://ofox.io/models/bailian/qwen3.8-flash
- https://ofox.io/models/deepseek/deepseek-v4-flash-0731
- https://ofox.io/models/z-ai/glm-5.3-flash
Цены, длины контекста, потолки ответа, поддерживаемые параметры и эндпоинты считаны с живого эндпоинта Ofox /v1/models 6 сентября 2026 года. Поведение токенов рассуждений получено из трёх живых вызовов /v1/chat/completions к bailian/qwen3.8-flash в тот же день: запрос одинаковый, менялись только max_tokens и reasoning.effort. Это малая выборка на одном маршруте за один день, а не спецификация — измерьте на своей нагрузке, прежде чем рассчитывать под неё конвейер. Показатель SWE-Bench для DeepSeek V4 Flash взят с vals.ai, рейтинг обновлён 2026-08-26.
Часто задаваемые вопросы
- Сколько стоит Qwen 3.8 Flash?
- $0.15 за миллион входных токенов и $0.47 за миллион выходных в Ofox под идентификатором bailian/qwen3.8-flash — значения считаны из живого каталога 6 сентября 2026 года. Это самая низкая цена вывода в классе Flash: у GLM-5.3 Flash $0.50, у DeepSeek V4 Flash 0731 $1.32, у GPT-5.6 Luna $6.00, у Gemini 3.8 Flash $7.50.
- Почему Qwen 3.8 Flash возвращает пустой content?
- Потому что это модель с рассуждениями, и заданный вами лимит токенов был израсходован на рассуждения до того, как появился хоть какой-то видимый текст. Мы отправили max_tokens 30 и получили content в виде пустой строки при completion_tokens 30, целиком ушедших в reasoning_tokens. Поднимите лимит или задайте reasoning effort равным none. Это не сбой, и за эти токены вы платите.
- Как отключить токены рассуждений у Qwen 3.8 Flash?
- Передайте reasoning с effort равным none. На том же коротком запросе это снизило completion_tokens с 27 до 1 — двадцатисемикратная разница на тривиальном вызове. Для классификации, извлечения, маршрутизации и другой работы с коротким выводом, где обдумывание не нужно, это главный рычаг экономии на этой модели.
- Какое контекстное окно у Qwen 3.8 Flash?
- 1 131 072 токена контекста при максимальном ответе в 131 072 токена — по данным живого каталога Ofox. Модель принимает текст и изображения, возвращает текст и доступна и на /v1/chat/completions, и на /v1/responses.
- Qwen 3.8 Flash дешевле, чем DeepSeek V4 Flash?
- Да, примерно в 2,8 раза по выводу. Qwen 3.8 Flash — $0.15 / $0.47 против $0.44 / $1.32 у DeepSeek V4 Flash 0731. Но у DeepSeek V4 Flash есть опубликованные 88,80% на vals.ai SWE-Bench Verified, а Qwen 3.8 Flash в этом рейтинге нет вовсе, так что более низкая цена идёт без сопоставимой независимой оценки.
- Какой идентификатор модели у Qwen 3.8 Flash?
- bailian/qwen3.8-flash в Ofox, с псевдонимом qwen3.8-flash. Поддерживаются temperature, top_p, max_tokens, stop, tools, tool_choice, response_format и reasoning.


