Qwen 3.8 Flash API:$0.15/$0.47 と、しっかり課金される推論トークン
Qwen 3.8 Flash の出力単価は 100 万トークンあたり $0.47 で、Flash 帯では最安。同時に推論モデルでもあり、max_tokens を小さくすると中身が空のまま課金される。
Qwen 3.8 Flash は入力 100 万トークンあたり $0.15、出力 $0.47——Flash 帯で最安の出力単価だ。 同時に推論モデルでもあり、そこが引っかかるところで、max_tokens を小さく指定すると空文字列が返ってきて、見ていないトークンの分だけ請求される。
モデル ID: bailian/qwen3.8-flash (エイリアス:qwen3.8-flash)
価格: 100 万あたり 入力 $0.15 / 出力 $0.47
コンテキスト:1,131,072 トークン
最大出力: 131,072 トークン
モダリティ: テキスト + 画像 → テキスト
エンドポイント:/v1/chat/completions、/v1/responses
パラメータ: temperature、top_p、max_tokens、stop、tools、
tool_choice、response_format、reasoning
2026 年 9 月 6 日にライブの Ofox /v1/models エンドポイントから取得。以下の挙動も同日、同エンドポイントに対して計測したもの。
最初にぶつかる空レスポンス
max_tokens: 30 を送ったら空文字列が返ってきた。 エラーではない——成功した、課金済みのレスポンスだ:
{"content": "",
"usage": {"prompt_tokens": 66, "completion_tokens": 30,
"completion_tokens_details": {"reasoning_tokens": 30}}}
補完トークン 30、その全部が推論トークン、目に見えるものはゼロ。モデルは回答を一文字も出す前に、予算を全部考えることに使い切った。
直し方は二つ、どちらも同じプロンプトで計測した:
| 設定 | completion_tokens | reasoning_tokens | content |
|---|---|---|---|
max_tokens: 30 | 30 | 30 | "" 空 |
max_tokens: 800 | 27 | 23 | "ok" |
max_tokens: 50、effort: none | 1 | — | "ok" |
上限を上げれば効く。 モデルが必要としたのは合計 27 トークンで、30 という上限が思考の途中で打ち切っていたからだ。
推論を切るほうがもっと効く。 これくらい単純なプロンプトなら、effort: none は同じ答えを 27 トークンではなく 1 トークンで出した——27 倍の差だ。短い出力を大量に回す仕事では、これは 100 万あたり $0.47 と、そのごく一部との差になる。
推論モデル全般に通じる実務ルール:max_tokens は推論と回答の両方をカバーしなければならず、推論は見えていようがいまいが出力単価で課金される。 max_tokens を回答の長さのつもりで見積もると、正常なモデルが壊れて見える。
$0.47 は Flash 帯のどこか
料金はすべて 2026 年 9 月 6 日のライブ Ofox カタログから:
| モデル | 入力 / 100万 | 出力 / 100万 | コンテキスト | 最大出力 |
|---|---|---|---|---|
bailian/qwen3.8-flash | $0.15 | $0.47 | 1,131,072 | 131,072 |
z-ai/glm-5.3-flash | $0.15 | $0.50 | 1,048,576 | 131,072 |
deepseek/deepseek-v4-flash-0731 | $0.44 | $1.32 | 1,000,000 | 384,000 |
openai/gpt-5.6-luna | $1.00 | $6.00 | 1,050,000 | 128,000 |
google/gemini-3.8-flash | $1.50 | $7.50 | 1,000,000 | 65,536 |
Qwen 3.8 Flash と GLM-5.3 Flash は事実上互角で、入力単価は同じ、出力は 3 セント差。この二つの間では価格は決め手にならないので、実際のタスクで両方試すべきだ。
帯の残りとの差は大きい。 Qwen 3.8 Flash の出力は DeepSeek V4 Flash より 2.8 倍、Gemini 3.8 Flash より 16 倍安い。
その差が教えてくれないことが二つある:
- DeepSeek V4 Flash には独立スコアがあり、Qwen 3.8 Flash にはない。 DeepSeek V4 Flash 0731 は vals.ai SWE-Bench Verified で 88.80%——Claude Opus 4.8 より上——なのに対し、Qwen 3.8 Flash はそのリーダーボードに載っていない。安く済む代わりに、裏づけとなる公開証拠が少ないモデルを選んでいることになる。それ自体は問題ないかもしれないが、知っておく価値はある。
- DeepSeek V4 Flash は 384,000 トークンの補完を許すのに対し、Qwen は 131,072。非常に長い単発出力を作るなら、単価よりこの上限のほうが効いてくる。
実際いくらかかるか
$0.15 / $0.47 で、上の推論の注意点を織り込むと:
| ワークロード | トークン | コスト |
|---|---|---|
短い分類 1 万件(入力 200 / 出力 20、effort: none) | 入力 2M / 出力 0.2M | $0.39 |
| 短い分類 1 万件(入力 200 / 出力 300、推論オン) | 入力 2M / 出力 3M | $1.71 |
| 100 万トークンの文書、1 パス | 入力 1M / 出力 5K | $0.15 |
上の 2 行は同じ仕事だ。違いは推論が入るかどうかだけで、この形の作業ではおよそ 4.3 倍。高頻度のパイプラインにこのモデルを選ぶ前に、頭に入れておくべき数字はこれになる。
呼び方
curl -X POST https://api.ofox.io/v1/chat/completions \
-H "Authorization: Bearer $OFOX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bailian/qwen3.8-flash",
"messages": [{"role": "user", "content": "Classify the sentiment: ..."}],
"reasoning": {"effort": "none"},
"max_tokens": 50
}'
最初の数回は usage.completion_tokens_details.reasoning_tokens を読んでおくこと。熟考の要らない仕事でこれが completion_tokens の大きな割合を占めているなら、effort: none はタダで手に入る節約だ。
このモデルはテキストに加えて画像入力も受けるので、安価な視覚タスク——キャプション付け、OCR 寄りの抽出、スクリーンショットの分類——もカバーできる。しかも上に挙げた視覚対応の Flash モデルよりずっと安い単価で。
使わないほうがいい場面
- 選定の根拠に独立ベンチマークが要る場合。 Qwen 3.8 Flash は vals.ai SWE-Bench にも Artificial Analysis の指数にも載っていない。DeepSeek V4 Flash は $0.44 / $1.32 で 88.80% の公開スコアがある。
- 非常に長い単発レスポンスを生成する場合。 131,072 トークンという補完上限は DeepSeek V4 Flash の 3 分の 1 だ。
- 仕事そのものが本当に難しい場合。 これは Flash 帯のモデルだ。複雑な推論の精度が結果を左右するなら、フロンティアモデルの比較で追加コストが何を買うかを扱っている。
- すでに GLM-5.3 Flash を使っている場合。 100 万あたり 3 セントは乗り換える理由にならない。
関連記事
- Qwen 3.8 Max の価格とアクセス——同じファミリーのフラッグシップ、$2.00 / $6.00。
- Qwen 3.8 Max vs DeepSeek V4 Flash——一つ上の帯における同じ「安いほう対フラッグシップ」の問題。
- Qwen 3.8 27B をローカルで動かす——安い Qwen が欲しい理由が、実は自前ホスティングだった場合に。
出典
- https://ofox.io/models/bailian/qwen3.8-flash
- https://ofox.io/models/deepseek/deepseek-v4-flash-0731
- https://ofox.io/models/z-ai/glm-5.3-flash
価格、コンテキスト長、補完上限、対応パラメータ、エンドポイントは 2026 年 9 月 6 日にライブの Ofox /v1/models エンドポイントから取得した。推論トークンの挙動は同日、bailian/qwen3.8-flash に対する 3 回のライブ /v1/chat/completions 呼び出しによるもので、プロンプトは同一、max_tokens と reasoning.effort だけを変えている。1 日・1 経路の小さなサンプルであって仕様ではないので、パイプラインの規模を決める前に自分のワークロードで測ってほしい。DeepSeek V4 Flash の SWE-Bench の数字は vals.ai のもので、リーダーボードの更新は 2026-08-26。
よくある質問
- Qwen 3.8 Flash の料金は?
- Ofox では bailian/qwen3.8-flash として、入力 100 万トークンあたり $0.15、出力 $0.47。2026 年 9 月 6 日にライブカタログから取得した値です。この出力単価は Flash 帯で最安で、GLM-5.3 Flash が $0.50、DeepSeek V4 Flash 0731 が $1.32、GPT-5.6 Luna が $6.00、Gemini 3.8 Flash が $7.50 という並びになります。
- Qwen 3.8 Flash が空の content を返すのはなぜ?
- 推論モデルなので、目に見えるテキストが出る前に指定したトークン上限が推論で使い切られるからです。max_tokens 30 を送ったところ content は空文字列、completion_tokens は 30 で、その全部が reasoning_tokens でした。上限を上げるか、reasoning の effort を none にしてください。これは失敗ではなく、そのトークンにも課金されます。
- Qwen 3.8 Flash で推論トークンを使わせないようにするには?
- reasoning を渡し、effort を none にします。同じ短いプロンプトで completion_tokens が 27 から 1 まで下がりました——単純な呼び出しで 27 倍の差です。分類・抽出・振り分けのように熟考が要らない短い出力の仕事では、このモデルで最も効くコスト削減レバーです。
- Qwen 3.8 Flash のコンテキストウィンドウは?
- ライブの Ofox カタログによると、コンテキスト 1,131,072 トークン、最大補完 131,072 トークン。テキストと画像を入力に取りテキストを返し、/v1/chat/completions と /v1/responses の両方で使えます。
- Qwen 3.8 Flash は DeepSeek V4 Flash より安い?
- 安く、出力ではおよそ 2.8 倍の差があります。Qwen 3.8 Flash が $0.15 / $0.47、DeepSeek V4 Flash 0731 が $0.44 / $1.32。ただし DeepSeek V4 Flash には vals.ai SWE-Bench Verified で 88.80% という公開スコアがあり、Qwen 3.8 Flash はそのリーダーボードに載っていません。安い分、比較できる独立スコアはないということです。
- Qwen 3.8 Flash のモデル ID は?
- Ofox では bailian/qwen3.8-flash、エイリアスは qwen3.8-flash。temperature、top_p、max_tokens、stop、tools、tool_choice、response_format、reasoning に対応しています。


