GLM-5.3-Flash 対 DeepSeek V4 Flash:どちらにも「ひとつの価格」がない

DeepSeek は週の21%で単価が倍になり、GLM の割引は9月9日に切れる。勝者はキャッシュヒット率と、呼び出す時刻で決まる。

GLM-5.3-Flash 対 DeepSeek V4 Flash:どちらにも「ひとつの価格」がない

どちらも Flash を名乗り、そしてどちらも表計算のセルに入れられる価格を持っていない。 DeepSeek V4 Flash は時刻で課金し、週の21%は単価が倍になる。GLM-5.3-Flash の安い数字は期限付きの販促価格だ。だから「どちらが安いか」は、いつ呼ぶのか、キャッシュヒット率はいくつか、出力をどれだけ生成するのか、この3つを言うまで答えが出ない。

幸いなのは、3つとも公開された価格表から計算できることだ。ベンチマークは要らない。

以下の数値は DeepSeek の価格ドキュメントZ.ai の価格ページから 2026-08-28 に直接確認したものです。開示:Ofox は両モデルを再販しており、当社に不利な事実を第4節に置いています。

2つの価格表は実際どうなっているのか?

4つある。各社が2つずつ公開しているからだ。100万トークンあたり米ドル。

GLM 定価GLM 割引DeepSeek 閑散DeepSeek 繁忙
キャッシュ未命中の入力0.150.0750.220.44
キャッシュ命中の入力0.030.0150.0070.014
出力0.500.250.661.32

2つある「第2列」は性質がまったく違い、その違いは見た目以上に効く。

GLM の $0.075 は販促だ。Z.ai のページにこう書かれている。「GLM-5.3-Flash is available at a 50% discount (strikethrough prices are list prices). The promotion ends at 24:00 on September 9, 2026 (UTC+8, Singapore time)」。終了後は $0.15 に戻り、それきりだ。

DeepSeek の閑散価格は販促ではなく恒常的な構造だ。繁忙時間帯は「01:00 - 04:00 and 06:00 - 10:00 UTC, Monday through Friday」と定義され、それ以外はすべて閑散、そして「off-peak rates are half of the peak rates」。168時間中35時間なので、週のおよそ79%は半額のほうで動く

その79%をどれだけ享受できるかは時間帯次第だ。日本時間に直すと繁忙帯は 10:00–13:00 と 15:00–19:00。営業時間の中心を二度にわたって貫いている。トラフィックが日本の業務時間に沿う組織なら、実際の閑散比率は79%を大きく下回る。米国東部だと同じ窓が 21:00–00:00 と 02:00–06:00 に落ち、ほぼ業務時間外になる。同じ価格表でも、置かれた時間帯で請求額が実質的に変わる。

なぜ「どちらが安いか」に単一の答えがないのか?

2社が課金行の逆側で勝っているからだ。

どちらにも一時的な有利を与えないよう、GLM の定価と DeepSeek の閑散価格で並べる。

課金行GLM 定価DeepSeek 閑散安いほう
キャッシュ未命中の入力$0.15$0.22GLM、1.47倍
出力$0.50$0.66GLM、1.32倍
キャッシュ命中の入力$0.03$0.007DeepSeek、4.29倍

DeepSeek はキャッシュが桁違いに安く、出力が高い。 同じ方向を向いた小さな差ではなく、逆方向を向いた大きな差であり、どちらが支配するかはモデルの性質ではなく自分のワークロードの性質で決まる。

同じコンテキストを繰り返し流して20トークンだけ返す長文分類は、ほぼ全額がキャッシュ行に乗る。1ターンで数千トークンを返すコーディングエージェントは出力行に乗る。同じ2モデルで、結論が反対になる。

DeepSeek が勝つのに必要なキャッシュヒット率は?

これは正確に出せる。公開価格だけで決まるからだ。

入力トークンのうちキャッシュに命中する割合を h、入力に対する出力トークンの比を r とする。閑散時間帯の DeepSeek が GLM 定価より安くなる条件は次のとおり。

0.22(1-h) + 0.007h + 0.66r  <  0.15(1-h) + 0.03h + 0.50r

整理すると:   h > (0.07 + 0.16r) / 0.093

代入するとこうなる。

入力に対する出力の割合DeepSeek に必要なヒット率
無視できる75%超
5%84%超
10%92%超
14.4%超100%でも到達不能

出力が入力量の約14.4%を超えた時点で、4.29倍安いキャッシュでも1.32倍高い出力行を取り返せなくなる。 割引が効くのは入力側だけで、出力側に同等のレバーが存在しないからだ。

したがって選定は価格表からではなく、自分のログから取る2つの数字から始まる。キャッシュヒット率と、出力トークン対入力トークンの比。対話系や文章生成系の多くはこの14.4%をはるかに超えるので、そこで読むのをやめてよい。本当に DeepSeek 側に落ちるのは、長いコンテキスト・高い再送率・短い出力という形——大きなシステムプロンプトを繰り返し流して小さなツール呼び出しを返すエージェントループそのものだ。近い事例はエージェントループ向け Gemini 3.1 Flash Lite 対 DeepSeek V4 Flashで計算している。

なぜ当社のゲートウェイは GLM を実際より良く見せるのか?

2つのモデルを同じ方式で値付けしていないからで、当社の価格表で判断する前に知っておくべきことだ。

当社の DeepSeek V4 Flash モデルページには入力 $0.44、出力 $1.32、キャッシュ読み取り $0.014 と出ている。この3つを上の表と突き合わせてほしい。DeepSeek の繁忙時間帯価格と完全に一致する。 ゲートウェイ経由のリクエストは24時間ずっと繁忙価格で決済され、週の79%を占める半額の窓には一度も入らない。

GLM は扱いが違う。GLM-5.3-Flash ページは $0.075、$0.25、$0.015 を定価の取り消し線付きで並べており、Z.ai の販促をそのまま通したものだ。2026-09-09 に販促が終われば、当社ページもそれに従って上がる。

帰結は単純で、当社に不利だ。この2モデルを当社の価格表で比べると、GLM の優位が実際より大きく見える。 ゲートウェイの数字で判断するなら、まず DeepSeek の列を半分にしてから見直してほしい。

価格以外の違いは?

3つ、いずれも各社のドキュメントにある。

出力上限が2.9倍違う。 DeepSeek V4 Flash は出力384Kトークン、GLM-5.3-Flash は131,072。コンテキストは双方1Mなので、差は入れられる量ではなく一度の呼び出しで返せる量にある。長い報告書や大量の構造化レコードを生成する用途は、他の何より先に131Kの壁に当たる。

プロトコルと同時実行数。 DeepSeek は https://api.deepseek.com に OpenAI 形式、https://api.deepseek.com/anthropic に Anthropic 形式のエンドポイントを公開し、flash 階層の同時実行上限2500を明記、既定で思考モード、非思考モードへの切り替えも可能としている。Anthropic の形に合わせて書いたツールチェーンを移すなら、この2つ目のエンドポイントは実作業を確実に減らす。

ウェイトとアーキテクチャ。 GLM-5.3-Flash はオープンウェイトで、総パラメータ320B・活性18B・45層。Z.ai はこれを、疎注意と線形注意のハイブリッドを採用した初のオープンソース frontier モデルと説明している。3つの数字がそれぞれ何を決めるのかはGLM-5.3-Flash のパラメータ数の記事で分解した。DeepSeek の API ドキュメントは V4 Flash のウェイト公開について何も述べていないため、当方はどちらとも主張しない。

どう選ぶか?

節約効果の大きい順に4段階。

  1. 価格表を開く前に、ログから2つの数字を取る。 入力のキャッシュヒット率と、入力に対する出力トークンの割合。この2つが出れば上の交差表がそのまま答えになる。
  2. 出力が入力の14.4%を超えるなら GLM を選んで終わり。 DeepSeek のキャッシュ優位では数学的にこの差を埋められないので、これ以上モデル化する余地がない。
  3. 長コンテキスト・高再送・短出力の用途は、ゲートウェイ経由ではなく DeepSeek 直接で見積もる。 そして79%をそのまま使わず、自分の閑散比率を計算すること。日本時間では繁忙帯が営業時間のど真ん中に来るため、ここは特に効く。
  4. 2026-09-09 をカレンダーに入れる。 その日 GLM の単価は定価に戻る。定価でもキャッシュ未命中の入力と出力では GLM が先行するので多くの結論は残るが、他人の結論を引き継がず自分で確かめてほしい。

上位モデルのエンドポイント詳細は GLM 5.3 API ガイド、DeepSeek 側のコスト削減レバーは DeepSeek V4 Flash で支払いを減らすにある。

両社ともルールを、繁忙帯の時刻まで含めて全部公開している。残っている仕事はどちらが安いかを当てることではなく、自分のワークロードがどんな形をしているかを測ることだ。

参考

よくある質問

GLM-5.3-Flash と DeepSeek V4 Flash はどちらが安いですか?
どちらにも単一の価格が存在しないため、この問いには3つの入力が要ります。DeepSeek は繁忙時間帯に単価が倍になり、GLM の現在価格は期限付きの50%割引です。GLM の定価と DeepSeek の閑散時間帯を比べると、キャッシュ未命中の入力($0.15 対 $0.22)と出力($0.50 対 $0.66)では GLM が安く、キャッシュ命中では DeepSeek が4.29倍安い($0.007 対 $0.03)です。
DeepSeek の繁忙時間帯はいつですか?
DeepSeek の価格ページでは繁忙時間帯を月曜から金曜の UTC 01:00–04:00 と 06:00–10:00 と定義し、それ以外はすべて閑散時間帯、そして「off-peak rates are half of the peak rates」と明記しています。168時間中35時間、つまり約79%の時間は割引後の単価です。日本時間では 10:00–13:00 と 15:00–19:00 にあたり、営業時間のど真ん中に重なります。
DeepSeek が勝つにはキャッシュヒット率がどれくらい必要ですか?
出力量によります。GLM 定価との比較で、出力が無視できる場合は閑散時間帯の DeepSeek に75%超のヒット率が必要です。出力が入力量の5%なら84%超、10%なら92%超、そして出力が入力の約14.4%を超えると100%でも届きません。DeepSeek のキャッシュは4.29倍安い一方で出力は1.32倍高く、両者が相殺します。
価格以外の違いは何ですか?
差が最も大きいのは出力上限です。DeepSeek V4 Flash は384Kトークン、GLM-5.3-Flash は131,072で2.9倍の差があり、コンテキストはどちらも1Mです。DeepSeek は OpenAI 形式と Anthropic 形式の両エンドポイント、flash 階層の同時実行上限2500を公開し、既定で思考モードです。GLM-5.3-Flash はオープンウェイトで、総パラメータ320B、活性18B、45層です。
ゲートウェイ経由だと比較は変わりますか?
変わりますし、ここでは実際に変わります。Ofox の DeepSeek V4 Flash ページは入力 $0.44、出力 $1.32、キャッシュ読み取り $0.014 で、これは DeepSeek の繁忙時間帯価格と完全に一致します。つまりゲートウェイ経由では24時間ずっと繁忙時間帯価格を払い、週の79%を占める半額の窓を得られません。GLM 側は Z.ai の割引をそのまま通しています。