Qwen 3.8 Flash API:$0.15/$0.47,以及那些照样收费的推理 token
Qwen 3.8 Flash 每百万输出 $0.47,是 Flash 档最低。它同时是推理模型,max_tokens 给小了会返回空内容,而这部分你照样付钱。
Qwen 3.8 Flash 每百万输入 token $0.15、输出 $0.47——是 Flash 档里最低的输出价。 它同时也是推理模型,这才是坑人的地方:max_tokens 给小了,你会拿回一个空字符串,而那些没看见的 token 照样算钱。
模型 ID: bailian/qwen3.8-flash (别名:qwen3.8-flash)
价格: 每百万输入 $0.15 / 输出 $0.47
上下文: 1,131,072 token
最大输出: 131,072 token
模态: 文本 + 图片 → 文本
端点: /v1/chat/completions、/v1/responses
参数: temperature、top_p、max_tokens、stop、tools、
tool_choice、response_format、reasoning
读取自 2026 年 9 月 6 日的实时 Ofox /v1/models 端点。下面的行为也是同一天在该端点上实测的。
第一个撞上的坑:空响应
我们传 max_tokens: 30,拿回来一个空字符串。 不是报错——是一次成功的、计了费的响应:
{"content": "",
"usage": {"prompt_tokens": 66, "completion_tokens": 30,
"completion_tokens_details": {"reasoning_tokens": 30}}}
30 个补全 token,全是推理 token,可见内容一个字没有。模型在吐出第一个字符之前就把预算想光了。
两条修法,都在同一个 prompt 上实测过:
| 配置 | completion_tokens | reasoning_tokens | content |
|---|---|---|---|
max_tokens: 30 | 30 | 30 | "" 空 |
max_tokens: 800 | 27 | 23 | "ok" |
max_tokens: 50,effort: none | 1 | — | "ok" |
调高上限有效,因为模型总共只需要 27 个 token,30 的上限把它拦在了半路。
关掉推理更有效。 对这么简单的一个 prompt,effort: none 用 1 个 token 而不是 27 个给出了同样的答案——27 倍的差距。上了量的短输出任务上,这就是每百万 $0.47 和它的一个零头之间的区别。
任何推理模型上都通用的一条:max_tokens 必须同时覆盖推理和答案,而推理不管你看不看得见都按输出价计费。 把 max_tokens 当成答案长度来估,正是一个好模型看起来坏掉的原因。
$0.47 在 Flash 档里的位置
全部费率来自 2026 年 9 月 6 日的实时 Ofox 目录:
| 模型 | 输入 / 百万 | 输出 / 百万 | 上下文 | 最大输出 |
|---|---|---|---|---|
bailian/qwen3.8-flash | $0.15 | $0.47 | 1,131,072 | 131,072 |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1,048,576 | 131,072 |
deepseek/deepseek-v4-flash-0731 | $0.44 | $1.32 | 1,000,000 | 384,000 |
openai/gpt-5.6-luna | $1.00 | $6.00 | 1,050,000 | 128,000 |
google/gemini-3.8-flash | $1.50 | $7.50 | 1,000,000 | 65,536 |
Qwen 3.8 Flash 和 GLM-5.3 Flash 基本打平——输入价一样,输出差三分钱。在这两个之间,价格不是决定因素,应该拿你自己的任务各跑一遍。
跟档里其余几个比,差距就很大了。 Qwen 3.8 Flash 的输出比 DeepSeek V4 Flash 便宜 2.8 倍,比 Gemini 3.8 Flash 便宜 16 倍。
这个差距没告诉你的两件事:
- DeepSeek V4 Flash 有独立分数,Qwen 3.8 Flash 没有。 DeepSeek V4 Flash 0731 在 vals.ai SWE-Bench Verified 上是 88.80%,高于 Claude Opus 4.8;而 Qwen 3.8 Flash 根本不在那个榜上。你花更少的钱,买的是一个公开证据更少的模型——这可能完全没问题,但值得知道。
- DeepSeek V4 Flash 允许 384,000 token 的补全,Qwen 是 131,072。如果你要生成很长的单次输出,这个上限比费率更要紧。
实际花多少
按 $0.15 / $0.47,把上面那条推理注意事项算进去:
| 负载 | token | 成本 |
|---|---|---|
1 万次短分类(输入 200 / 输出 20,effort: none) | 输入 2M / 输出 0.2M | $0.39 |
| 1 万次短分类(输入 200 / 输出 300,开推理) | 输入 2M / 输出 3M | $1.71 |
| 100 万 token 文档,单次通过 | 输入 1M / 输出 5K | $0.15 |
前两行是同一个任务,区别只在推不推理——在这种形态的负载上大约 4.3 倍。这是你在把这个模型选进高频管线之前该记住的数字。
怎么调
curl -X POST https://api.ofox.io/v1/chat/completions \
-H "Authorization: Bearer $OFOX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bailian/qwen3.8-flash",
"messages": [{"role": "user", "content": "Classify the sentiment: ..."}],
"reasoning": {"effort": "none"},
"max_tokens": 50
}'
头几次调用读一下 usage.completion_tokens_details.reasoning_tokens。如果在不需要斟酌的任务上它占了 completion_tokens 很大一块,那 effort: none 就是白捡的钱。
这个模型除了文本还接受图片输入,所以廉价视觉任务也覆盖得到——打标、类 OCR 的抽取、截图分类——费率远低于上面那些支持视觉的 Flash 模型。
什么时候别用它
- 你需要一个独立 benchmark 来支撑选型。 Qwen 3.8 Flash 不在 vals.ai SWE-Bench 也不在 Artificial Analysis 指数上。DeepSeek V4 Flash 是 $0.44 / $1.32,有公开的 88.80%。
- 你要生成很长的单次响应。 131,072 的补全上限只有 DeepSeek V4 Flash 的三分之一。
- 任务本身确实难。 这是 Flash 档的模型。如果复杂推理的准确率决定你的结果,前沿模型对比讲了多花的钱买到什么。
- 你已经在用 GLM-5.3 Flash。 每百万输出差三分钱,不构成迁移理由。
相关
- Qwen 3.8 Max 价格与接入——同系列的旗舰,$2.00 / $6.00。
- Qwen 3.8 Max vs DeepSeek V4 Flash——上一档里同样的「便宜 vs 旗舰」问题。
- Qwen 3.8 27B 本地运行——如果你想要便宜 Qwen 的理由其实是想自部署。
来源
- https://ofox.io/models/bailian/qwen3.8-flash
- https://ofox.io/models/deepseek/deepseek-v4-flash-0731
- https://ofox.io/models/z-ai/glm-5.3-flash
价格、上下文长度、补全上限、支持的参数与端点读取自 2026 年 9 月 6 日的实时 Ofox /v1/models 端点。推理 token 的行为来自同一天对 bailian/qwen3.8-flash 的三次实时 /v1/chat/completions 调用,prompt 相同,只改 max_tokens 和 reasoning.effort。这是一天之内、单条线路上的小样本,不是规格——把管线规模定下来之前请在你自己的负载上量一遍。DeepSeek V4 Flash 的 SWE-Bench 数字来自 vals.ai,榜单更新于 2026-08-26。
常见问题
- Qwen 3.8 Flash 多少钱?
- Ofox 上模型 ID 为 bailian/qwen3.8-flash,每百万输入 token $0.15、输出 $0.47,读取自 2026 年 9 月 6 日的实时目录。这个输出价是 Flash 档里最低的——GLM-5.3 Flash 是 $0.50,DeepSeek V4 Flash 0731 是 $1.32,GPT-5.6 Luna 是 $6.00,Gemini 3.8 Flash 是 $7.50。
- 为什么 Qwen 3.8 Flash 返回空内容?
- 因为它是推理模型,你给的 token 上限在产出任何可见文字之前就被推理吃光了。我们传 max_tokens 30,拿回的 content 是空字符串,而 completion_tokens 是 30,全部计入 reasoning_tokens。把上限调高,或者把 reasoning effort 设成 none。这不是失败,而且这些 token 照样计费。
- 怎么让 Qwen 3.8 Flash 不用推理 token?
- 传 reasoning,effort 设为 none。在同一个短 prompt 上,我们实测把 completion_tokens 从 27 降到了 1——一次简单调用上 27 倍的差距。分类、抽取、路由这类不需要斟酌的短输出任务,这是这个模型上最大的一个成本杠杆。
- Qwen 3.8 Flash 的上下文窗口有多大?
- 按实时 Ofox 目录,上下文 1,131,072 token,最大补全 131,072 token。它接受文本和图片输入、输出文本,在 /v1/chat/completions 和 /v1/responses 上都可用。
- Qwen 3.8 Flash 比 DeepSeek V4 Flash 便宜吗?
- 便宜,输出上大约便宜 2.8 倍。Qwen 3.8 Flash 是 $0.15 / $0.47,DeepSeek V4 Flash 0731 是 $0.44 / $1.32。但 DeepSeek V4 Flash 在 vals.ai SWE-Bench Verified 上有 88.80% 的公开成绩,而 Qwen 3.8 Flash 不在那个榜上,所以便宜的代价是没有可比的独立分数。
- Qwen 3.8 Flash 的模型 ID 是什么?
- Ofox 上是 bailian/qwen3.8-flash,别名 qwen3.8-flash。支持 temperature、top_p、max_tokens、stop、tools、tool_choice、response_format 和 reasoning。


