DeepSeek V4 Flash vs Gemini 3.6 Flash: スコアは同点、価格は10倍差

Artificial Analysisで両者とも50点。DeepSeekは$0.14/M、Geminiは$1.50/M、だがトークン消費は210M対59M。10倍差の行方を追う。

真鍮の天秤が完全に水平に釣り合い、左の皿には銅貨が3枚、右の皿にははるかに高く積み上がった銅貨の山が載っている

料金アップデート(2026-08-17):DeepSeek は 2026-08-16 16:00 UTC に V4 シリーズ全体をピーク/オフピーク課金へ移行しました。本記事で引用している DeepSeek の料金は変更前のスナップショットです。最新の料金、各ティアの値上げ倍率、ピーク時間帯は DeepSeek API 値上げ:新料金とピーク時間(英語) を参照してください。 要約: DeepSeek V4 Flash 0731 と Gemini 3.6 Flash はどちらも Artificial Analysis Intelligence Index v4.1 で50点に着地し、GPT-5.6 Luna が51点で1ポイント先行します。3つの定価は1桁以上の幅にわたります。興味深いのは、値札を比べるのをやめて、同じ評価ワークロードに対する請求書を比べ始めたときに何が起きるかです。Artificial Analysis は各モデルの実行に支払った額を公開しています。DeepSeek で $72.02、Luna で $190.87、Gemini で $726.70。出力価格の値札上の差は27倍です。実際の請求書での差は10.1倍で、その理由は DeepSeek がその実行で出力トークンを210M消費したのに対し Gemini は59Mだったからです。どちらの数字も、ワークロードがテキストなら DeepSeek を買えと言っています。しかしどちらも、画像を送るパイプラインとの接触には耐えられません。

要約: どれを選ぶべきか?

あなたの状況選ぶべきもの理由
テキスト専用、大量、コストが制約DeepSeek V4 Flash 0731トークンあたりが約10倍安く、さらに98%のキャッシュ割引
画像、音声、動画、PDF を含む何かGemini 3.6 FlashDeepSeek 0731 はテキスト専用。より安い回避策は存在しない
レイテンシがユーザーに見えるインタラクティブな UXGemini 3.6 Flash毎秒約220出力トークン、AA の実行では3つの中で最も低い TTFT
単一の長い生成(ファイル全体、長いレポート)DeepSeek V4 Flash 0731出力上限384K 対 Gemini の64K
1つのモデルで最高のインデックススコアとビジョンが欲しいGPT-5.6 Lunaインデックス51、ビジョン、2026-07-30 の80%値下げ
積極的にキャッシュできる範囲限定のエージェントループDeepSeek V4 Flash 0731キャッシュ読み取りが $0.0028/M、3つの中で圧倒的に最安
今日、再現可能な第三者のレイテンシ数値が必要Gemini 3.6 Flash または GPT-5.6 Lunaスナップショット時点で AA は 0731 ビルドの速度や TTFT データを持っていなかった

ここで読むのをやめる方法が2つあります。ワークロードがテキスト以外の入力を送るなら、2行目で決着がつき、この記事の残りは背景説明です。ワークロードがテキストで、月に約20M トークン未満で動くなら、上記の最安と最高価格の選択肢の年間差はエンジニアリング1日分より小さいので、レイテンシで選んで先へ進んでください。以下はすべて、請求額が議論するに足るほど大きい場合のために書かれています。

スコアボード: DeepSeek V4 Flash 0731 と Gemini 3.6 Flash は Artificial Analysis Intelligence Index v4.1 でともに50点、GPT-5.6 Luna は51点。一方で100万トークンあたりの定価は $0.14/$0.28、$1.50/$7.50、$0.20/$1.20

7月31日に実際に変わったこと

DeepSeek は 2026-07-31 に V4 Flash の新ビルドを出荷しましたが、モデル自体は変えていません。同じ 284B 総パラメータ、同じ 13B アクティブ、同じ 1M コンテキスト、同じ $0.14 / $0.28 の価格。API のモデル名も変わっておらず deepseek-v4-flash で、ビルドは DeepSeek のドキュメントでモデルバージョン DeepSeek-V4-Flash-0731 として識別されます。変わったのはポストトレーニングです。

計測された効果は「ポストトレーニングのみ」が通常示唆するものより大きいです。Artificial Analysis Intelligence Index v4.1 では、スコアが40から50に上がりました。AA のエージェント評価 GDPval-AA v2 は 1189 Elo から 1559 に動きました。Terminal-Bench 2.1 は17ポイント上昇して79%に達しました。AA はまた、0731 ビルドを DeepSeek 自身のフラッグシップである DeepSeek V4 Pro より6ポイント上に位置づけており、これは Pro が難しいケースを扱うという前提でルーティングルールを書いた人にとっては厄介な結果です。

私たちもその一人でした。5月のDeepSeek V4 Pro vs Flash ルーティングガイドでは、マルチファイル作業と長いエージェントループは Pro に属すると結論づけていました。0731 ビルドについてはその結論はもはや成り立たず、正直に言えば、いまや Flash がデフォルトで、Pro は正当化して使う例外です。

ウェイトの公開は誰の予想よりも速かったです。AA のローンチ報道は完全なウェイトが「数週間以内に」公開予定と説明し、二次的な報道の多くも今なおそれを繰り返しています。2026-08-01 に確認すると、Hugging Face の deepseek-ai/DeepSeek-V4-Flash-0731 はすでにモデルを MIT ライセンス、ゲートなしで48個の safetensors シャードとして保持していました。どこかで 0731 は API 専用だと読んだなら、それは約1日だけ本当でした。

数字が始まる前に述べておくべき注意点が1つあります。Intelligence Index はローリング式のリーダーボードであり、以下のすべては 2026-08-01 のスナップショットです。順位を持続する事実として扱い、絶対スコアは特定の日に取った測定値として扱ってください。

簡易スペック比較

DeepSeek V4 Flash 0731Gemini 3.6 FlashGPT-5.6 Luna
ofox モデル IDdeepseek/deepseek-v4-flash-0731google/gemini-3.6-flashopenai/gpt-5.6-luna
AA Intelligence Index v4.1505051 🏆
リリース2026-07-31(0731 ビルド)2026-07-212026-07-09
入力価格(ベンダー定価)$0.14/M 🏆$1.50/M$0.20/M
出力価格(ベンダー定価)$0.28/M 🏆$7.50/M$1.20/M
キャッシュ入力$0.0028/M 🏆$0.15/M$0.02/M
コンテキストウィンドウ1M1M (1,048,576)1M
最大出力384K 🏆64K (65,536)128K
入力モダリティテキストテキスト、画像、動画、音声、PDF 🏆テキスト、画像
出力速度(AA)スナップショット時点で未公開219.6 tok/s 🏆172.1 tok/s
最初のトークンまでの時間(AA)スナップショット時点で未公開15.11s 🏆121.89s
オープンウェイトあり、Hugging Face で MIT 🏆なしなし
ワイヤープロトコルOpenAI, Anthropic, ResponsesOpenAI, GeminiOpenAI, Anthropic, Responses

2行は見直す価値があります。最大出力は本当の分かれ目です。384K 対 64K は、長いファイルを1回の呼び出しで生成するか、継続ループを構築するかの違いです。そして空欄のレイテンシセルは書式設定のミスではありません。AA の 0731 ビルド向けプロバイダーページは、2026-08-01 のスナップショット時点で速度や最初のトークンまでの時間のデータを掲載していなかったので、このビルドについて毎秒トークン数の数値を提示する人は別のものを引用しています。

ベンチマークの全体像: 3つのモデルを1ポイントが分ける

以下は 0731 ビルドの AA サブスコア詳細で、AA が公開している場合は4月ビルドとの差分を併記しています。

評価DeepSeek V4 Flash 07314月ビルドとの変化
Intelligence Index v4.150+10
GDPval-AA v2 (Elo)1559+370
Terminal-Bench 2.179%+17
GPQA Diamond91%+1
AA-LCR66%+3
SciCode50%+5
Humanity’s Last Exam37%+5
τ³-Bench Banking31%+8
CritPt17%+9
AA-Omniscience Index-16+7

Omniscience の行は皆が読み飛ばすものです。AA は、この改善が知識の増加ではなく幻覚の減少によるもので、正確さは横ばいだったと報告しています。本番トラフィックに向けようとしているモデルにとって、「間違えることが減る」は「より多く知っている」よりも有用な改善であり、単一の総合スコアが隠しがちなものです。

出典に関する注記が2つあります。このリリースには複数組の数字が出回っているからです。

DeepSeek 自身のリリース資料は Terminal-Bench 2.1 を82.7、DeepSWE を54.4、Cybergym を76.7 と報告しています。Artificial Analysis は Terminal-Bench 2.1 を79%と報告しています。どちらも正しくあり得ます。ハーネス、足場、努力設定が異なるうえ、スナップショット時点で DeepSWE と Cybergym の数値の第三者による再現はありませんでした。私たちは通して AA の数字を使っています。ここにある3つのモデルすべてで同じ方法で計測された唯一のものだからです。どこかで82.7が引用されているのを見たら、それはベンダーのハーネスであって、矛盾ではありません。

もう1つ。ほとんどのカタログページ(私たちのものも含む)で DeepSeek V4 Flash に付いている LMArena スコアは、Overall 1438、順位は70番台で、更新は 2026-07-12 です。これは 0731 ビルドより19日前のものです。それは4月のモデルを計測しています。新ビルドの Arena スコアには新しい投票が必要で、それまでは比較ページで「DeepSeek V4 Flash」の隣にある数字は、AA で10ポイント低いスコアだったモデルを説明しています。

冗長さの税金: 値札の差が請求書の差でない理由

この2つのモデルの比較はどれも $0.14 対 $1.50 を筆頭に持ってきて、そこで止まります。その比率は本物ですが、同時にこの記事で最も信頼できない数字でもあります。仕事ではなくトークンに値付けしているからです。

Artificial Analysis はより良いものを公開しています。各モデルを同じ Intelligence Index スイートに通すために実際に支払った額を、請求書ごと公開しているのです。

Artificial Analysis が各モデルを Intelligence Index に通すために支払った額の棒グラフ。DeepSeek V4 Flash 0731 は出力トークン210Mで $72.02、GPT-5.6 Luna は130Mで $190.87、Gemini 3.6 Flash は59Mで $726.70

モデルインデックス実行の出力トークンAA の実行総コスト
DeepSeek V4 Flash 0731210M$72.02
GPT-5.6 Luna130M$190.87
Gemini 3.6 Flash59M$726.70

同じ評価、3つの実際の請求書。Gemini は DeepSeek の10.1倍、Luna は2.7倍のコストです。出力価格の値札上の比率である27倍と4.3倍に対して、DeepSeek の紙の上の優位のおよそ60%が価格表と請求書の間のどこかで消えています。

その行き先はトークンです。DeepSeek はそのスイートで出力トークンを210M消費したのに対し Gemini は59Mで、AA はこれを他と比べて非常に冗長だと注記しています。出力部分だけを定価で計算すると、DeepSeek が $58.80、Luna が $156.00、Gemini が $442.50 で、その部分では7.5倍の差になります。2つの請求書の形はそれに応じて異なります。出力は DeepSeek の実行コストの約82%、Gemini の約61%を占めます。これは同じスコアに達するのに3.5倍多く書くモデルの特徴です。AA はモデルごとの入力トークン数を公開していないので、残りは公開された数値からこれ以上分解できません。

どの数字を前提に計画するかはトラフィックによります。ほぼプロンプト主体のワークロードは入力比率の10.7倍に沿います。ほぼ生成主体のワークロードは冗長さによって7.5倍へ圧縮されます。AA のエンドツーエンドの数値10.1倍はその中間にあり、スイート自体が混合物なので、予算レビューで擁護しなければならないものには27倍より10倍がデフォルトとして適しています。

トークン数について注意が2つあります。それらは AA の最大努力と高努力の構成から得たもので、各モデルの範囲の高価な側であって、典型的な本番設定ではありません。そして冗長さはワークロード依存です。難しい推論問題ばかりのスイートは簡潔に推論するモデルを有利に見せますし、あなたの抽出パイプラインはそのスイートではありません。

210M についての脚注を1つ。AA の数字が2つ出回っているからです。モデルページはインデックス実行の出力トークンを210Mと報告し、AA のローンチ記事は約206Mと報告しています。加えてより興味深い事実として、これは前の V4 Flash ビルドが消費した(約234M)より12%少ない出力トークンです。つまり 0731 は同世代の他モデルより冗長であると同時に、自身の前身より冗長ではありません。私たちは通して210Mを使っています。モデルページの数値がここにある3つのモデルすべてで同じ方法で公開されているからです。

とはいえ梃子は本物で、それはフラグ1つです。DeepSeek のドキュメントには deepseek-v4-flash が非思考モードと思考モードの両方に対応し、思考モードがデフォルトであると記載されており、推論トークンは出力として課金されます。範囲が限定された作業では、思考をオフにするところで冗長さの税金が消えます。

自分のトラフィックで計測する

AA の比率は出発点の見積もりであって、あなたの数字ではありません。あなた自身の数字を得るには、実際のプロンプトのサンプルに対して1回実行すれば済みます。OpenAI 互換のレスポンスにはどれも必要なトークン数が含まれているからです。

import collections
from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")

costs = {  # input, output, per 1M tokens
    "deepseek/deepseek-v4-flash-0731": (0.14, 0.28),
    "google/gemini-3.6-flash": (1.50, 7.50),
    "openai/gpt-5.6-luna": (0.20, 1.20),
}
totals = collections.defaultdict(float)

for prompt in load_your_real_prompts():        # 50 is enough to see the shape
    for model, (pin, pout) in costs.items():
        u = client.chat.completions.create(
            model=model, messages=[{"role": "user", "content": prompt}]
        ).usage
        totals[model] += (u.prompt_tokens * pin + u.completion_tokens * pout) / 1e6

for model, spend in sorted(totals.items(), key=lambda kv: kv[1]):
    print(f"{model:32} ${spend:.4f} over the sample")

代表的なプロンプト50件を3つすべてで実行しても数セント程度で、どんなリーダーボードよりも多くを教えてくれます。注意点が2つあります。DeepSeek については思考オンとオフで2回実行してください。そのフラグはモデルの選択よりも出力の列を大きく動かします。そして最も難しいケースではなく実際のトラフィック分布からサンプリングしてください。難しい推論問題で計測した冗長さの比率は、2行の分類が並ぶキューには転移しないからです。

価格計算: 2つの実際の月額請求

以下の価格はすべてベンダー定価、スナップショットは 2026-08-01、100万トークンあたりです。

シナリオ A、抽出パイプライン。 月あたり入力トークン200M、出力トークン10M、キャッシュなし、短い構造化出力。

モデル入力コスト出力コスト月額合計
DeepSeek V4 Flash 0731$28.00$2.80$30.80
GPT-5.6 Luna$40.00$12.00$52.00
Gemini 3.6 Flash$300.00$75.00$375.00

入力が支配的なので、このシナリオは入力価格の比率に近く沿います。Gemini は DeepSeek の12倍、Luna は1.7倍のコストです。7月30日の値下げがここで Luna の位置をどれだけ変えたかに注目してください。旧価格の $1 / $6 では同じワークロードが月 $260 でした。

シナリオ B、コーディングエージェントループ。 月あたりキャッシュヒット率70%で入力トークン100M、出力トークン40M。

モデルキャッシュ入力新規入力出力月額合計
DeepSeek V4 Flash 0731$0.20$4.20$11.20$15.60
GPT-5.6 Luna$1.40$6.00$48.00$55.40
Gemini 3.6 Flash$10.50$45.00$300.00$355.50

その表はトークンを一定に保っており、暗黙のうちに3つのモデルすべてが同じ仕事をするのに同じ量を書くと仮定しています。実際はそうではありません。代わりに仕事を一定に保ち、インデックス実行の冗長さ比率で出力をスケールすると、同じエージェントループについてより公平な絵が得られます。

モデル同等の仕事の出力トークン月額合計
DeepSeek V4 Flash 0731142M$44.16
GPT-5.6 Luna88M$113.00
Gemini 3.6 Flash40M(基準)$355.50

DeepSeek は23倍安いから8倍安いへと変わります。判断は変わりません。スライドに載せる数字は変わるべきです。

特に DeepSeek についてのこの計算のより深いバージョン、キャッシュミスが実際の請求に何をするかも含めて、についてはV4 Pro コスト内訳DeepSeek V4 API 価格ガイドをご覧ください。

請求を動かす2つの価格の詳細

DeepSeek はまもなくピーク時価格を導入しようとしています。 その価格ドキュメントには脚注があります。API はピーク/オフピークの方針を採用し、ピーク時価格はすべての課金項目に適用される通常価格の2倍となり、発効日は公式発表待ちです。ピークの時間帯は北京時間 UTC+8 の 09:00 to 12:00 と 14:00 to 18:00 です。

無害だと決めつける前に、自分の時計に変換してください。それらの時間帯は US Eastern の 21:00 to 00:00 と 02:00 to 06:00 に当たり、これは米国日中のワークロードにとっては真夜中です。そして Central European の 03:00 to 06:00 と 08:00 to 12:00 に当たり、これはヨーロッパのチームの午前中全体を食い潰します。ヨーロッパで運用していて DeepSeek がこれを有効にすれば、労働日の前半で $0.14 が $0.28 になります。それでも Gemini より下ですが、予算に組み込んだ数字ではありません。

購入する経路はベンダーの定価と異なる場合があります。 OpenAI は 2026-07-30 に GPT-5.6 Luna を80%引き下げ、$1 / $6 から $0.20 / $1.20 にしました。Azure 経由で Luna を提供するリストは 2026-08-01 のスナップショット時点で動いておらず、私たちのものも含まれます。そこでは openai/gpt-5.6-luna は $1 / $6 の定価を表示する Azure 経路です。同じモデル ID、5倍の差、純粋にどのアップストリームに着地するかだけによるものです。

モデルスナップショット時の経路入力出力キャッシュ入力
DeepSeek V4 Flash 0731DeepSeek ファーストパーティ$0.14$0.28$0.0028
DeepSeek V4 Flash 0731Aliyun BaiLian$0.14$0.28$0.028
DeepSeek V4 Flash 0731Azure$0.19$0.51$0.19
Gemini 3.6 FlashGoogle / Vertex$1.50$7.50$0.15
Gemini 3.6 FlashGoogle バッチまたはフレックス$0.75$3.75$0.075
GPT-5.6 LunaOpenAI ファーストパーティ$0.20$1.20$0.02
GPT-5.6 LunaAzure$1.00$6.00$0.10

その表に脚注が2つあります。私たちの Luna リストはスナップショット時点で20%のプロモーションを実施しており、Azure 経路は実質 $0.80 / $4.80 になりますが、それでも OpenAI の定価の4倍です。そしてキャッシュ読み取りの列は独自の注目に値します。Azure の DeepSeek 経路では、キャッシュ読み取りは新規入力と同じコストで、これはこのモデルが持つ単一で最大のコスト優位を消し去ります。

その表が教える一般則: モデル名ではなく経路を確認せよ。ラボが発表した値下げはそのラボ自身の API には即座に届きますが、他の全員にはそれぞれのスケジュールで届きます。上の7行のうち2行は、非常に異なる金額の同じモデルです。

テキスト専用が実際にあなたに要求するコスト

この比較で最も安いモデルは見ることができません。DeepSeek V4 Flash 0731 はテキストを受け取り、関数を呼び出し、JSON を返し、OpenAI と Anthropic の両方のワイヤーフォーマットを話します。そしてそれが全リストです。Gemini 3.6 Flash はテキスト、画像、動画、音声、PDF を受け取ります。GPT-5.6 Luna はテキストと画像を受け取ります。

これはプロンプトエンジニアリングやより大きな予算で埋められる品質のギャップではありません。もしパイプラインが壊れた UI のスクリーンショット、スキャンした請求書、動画のフレームを送るなら、DeepSeek の呼び出しはより高い価格で優雅に失敗するのではありません。構造的に失敗します。上のすべてのコスト表はその種の仕事には無関係になります。だからこそモダリティの行はスペック表の一番下に埋もれさせるのではなく上部近くに置いてあります。

よくある解決策はトラフィックを分割することです。マルチモーダルのリクエストは Gemini へ、それ以外はすべて DeepSeek へ、前段にルーターを1つ。それは1つのモデルを選ぶより手間がかかりますが、90%のリクエストがテキストのパイプラインでは、たいてい最初の月で元が取れます。

DeepSeek V4 Flash 0731 を選ぶべきとき

請求が実際の費用項目になる、大量のテキスト専用ワークロード。キャッシュヒット率の高いものは不釣り合いに恩恵を受けます。$0.0028/M のキャッシュ読み取りは新規入力からの98%割引、50倍の削減だからです。単一の長い生成にも有利です。最大出力384K は Gemini の上限の6倍です。また3つの中で公開ウェイトを持つ唯一のもので、Hugging Face で MIT ライセンスなので、API でプロトタイプを作ってから後でセルフホストする計画なら、これが道筋のあるモデルです。

範囲が限定された作業では思考をオフにしてください。それが上の $15.60 と $44.16 の行の違いです。

Gemini 3.6 Flash を選ぶべきとき

テキスト以外のモダリティが関わるときは常に。それは価格が会話に入る前に決着をつけます。レイテンシがユーザーに見えるときも。毎秒219.6出力トークンは、スナップショット時点で AA の速度ランキングで185モデル中3位に位置づけ、最初のトークンまで15.11秒は推論モデルとしては速いです。そして依存しようとしているものを第三者に計測してもらいたいときも。AA は Gemini については速度とレイテンシを公開していましたが、0731 ビルドについては公開していなかったからです。

バッチ層は過小評価されています。遅延を許容できる仕事に対して $0.75 / $3.75 なら、Gemini の DeepSeek との実効的な距離は半分になります。

GPT-5.6 Luna を選ぶべきとき

3つの中で最高のインデックススコアとビジョンを同じモデルで欲しいとき。そして80%の値下げによって、その組み合わせが3週間前には無理だった形で手頃になりました。$0.20 / $1.20 の Luna は、価格では Gemini よりも DeepSeek に近く、しかも両者より1ポイント高いスコアです。

先に確認すべきことが2つあります。AA が計測した最初のトークンまで121.89秒は最大努力の構成で、最大努力はインタラクティブな設定ではありません。UI で Luna を使うなら、より低い努力レベルを使ってください。そしてゲートウェイがどの経路に載せているかを確認してください。引き下げ前の Azure 層は OpenAI の定価の5倍だからです。私たちのGPT-5.6 層ガイドは、Sol、Terra、Luna がどう仕事を分担するかを扱っています。

3つのどれも正解でないとき

ワークロードが小さいなら、これはどれも問題になりません。月に数百万トークンなら、ここでの最安と最高価格の選択肢の差はエンジニアリング1時間に対する丸め誤差なので、能力で選んで先へ進むべきです。

ゼロを追うなら、ホスト型 API は間違った道具です。このモデルファミリーの無料およびセルフホストの道筋は、実際の上限が付いた別の作業で、DeepSeek V4 Flash 無料: 4つのゼロコストの道筋で扱っています。それらの道筋は 0731 に先行するビルドに対して検証されているので、頼る前に上限を再確認してください。セルフホストの道筋はそれ以降変わっています。0731 のウェイトはいまや Hugging Face で MIT の下にあるので、ライセンス不要の選択肢は4月のビルドではなく現行のビルドに適用されます。

そして仕事が2桁台のツール呼び出しを伴う深いマルチステップのエージェント作業なら、これら3つのフラッシュ層モデルはどれも明らかな適合ではありません。それはフロンティア層の領域で、正直な答えは誰かのインデックスではなく自分のトレースでベンチマークすることです。以前のGemini Flash Lite vs DeepSeek V4 Flash エージェントループ比較は、ツール呼び出しの信頼性が深さにおいて計算をどう変えるかを説明しています。

ofox で3つすべてを試す: 1つのループで A/B

3つすべてが1つの OpenAI 互換エンドポイントで動くので、比較は3つの統合ではなく文字列の入れ替えです。モデル ID は deepseek/deepseek-v4-flash-0731google/gemini-3.6-flashopenai/gpt-5.6-luna です。

Python

from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")

MODELS = [
    "deepseek/deepseek-v4-flash-0731",
    "google/gemini-3.6-flash",
    "openai/gpt-5.6-luna",
]

prompt = "Refactor this function to remove the nested loop. Return only code."

for model in MODELS:
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    u = r.usage
    print(f"{model:32} in={u.prompt_tokens:6} out={u.completion_tokens:6}")

レイテンシだけでなく completion_tokens も記録してください。その列こそ、自分のトラフィックで冗長さの差が現れる場所であり、値札が教えてくれない数字です。

Node

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.ofox.io/v1",
  apiKey: process.env.OFOX_API_KEY,
});

const models = [
  "deepseek/deepseek-v4-flash-0731",
  "google/gemini-3.6-flash",
  "openai/gpt-5.6-luna",
];

for (const model of models) {
  const r = await client.chat.completions.create({
    model,
    messages: [{ role: "user", content: "Summarize this changelog in 3 bullets." }],
  });
  console.log(model, r.usage.prompt_tokens, r.usage.completion_tokens);
}

DeepSeek が実行できない呼び出し

同じクライアント、同じエンドポイント、すべてを変える1つのコンテンツブロック。これを google/gemini-3.6-flashopenai/gpt-5.6-luna に送れば答えが返ります。deepseek/deepseek-v4-flash-0731 に送れば、どんな価格でも動きません。

import base64

img = base64.b64encode(open("screenshot.png", "rb").read()).decode()

r = client.chat.completions.create(
    model="google/gemini-3.6-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Which element is misaligned?"},
            {"type": "image_url",
             "image_url": {"url": f"data:image/png;base64,{img}"}},
        ],
    }],
)
print(r.choices[0].message.content)

代替案

3つのどれも合わないなら、確認する価値のある近隣モデルは同じエンドポイントにあります。定価 $0.435 / $0.87 の DeepSeek V4 Pro(ofox のリストは $0.45 / $0.88 に丸めています)は、いまや AA のインデックスでより高価で低スコアの兄弟ですが、あなたのトレースで勝つというワークロード固有の証拠があるなら依然として正しい選択です。GPT-5.6 Terra は、フラッシュ層が本当に不十分なときに Luna の上に位置します。ofox カタログの外では、同じモデルが DeepSeek、Google AI Studio、OpenAI API からファーストパーティで入手でき、これはベンダーが1つだけで足り、経路が追いつくのを待つのではなく値下げがあった当日に手に入れたい場合に正しい選択です。

ライブ価格付きのモデルページ: DeepSeek V4 FlashGemini 3.6 FlashGPT-5.6 Luna

出典

よくある質問

DeepSeek V4 Flash は Gemini 3.6 Flash より優れていますか?
Artificial Analysis Intelligence Index v4.1 では、2026-08-01 時点のスナップショットで両者とも50点の同点です。したがってこの総合スコアではどちらが優れているとは言えません。ただし両者は互換ではありません。Gemini 3.6 Flash は画像、動画、音声、PDF 入力に対応しますが、DeepSeek V4 Flash 0731 はテキスト専用です。Gemini は AA の計測で最初のトークンを約15秒で返し、毎秒およそ220トークンでストリーミングしますが、スナップショット時点で AA は 0731 ビルドの速度やレイテンシの数値を公開していませんでした。DeepSeek は出力トークン上限が384Kで、Gemini の64Kを上回ります。インデックススコアでは差がつかないので、モダリティ、レイテンシ、出力長で選んでください。
DeepSeek V4 Flash は Gemini 3.6 Flash よりどれくらい安いですか?
定価の入力で約10.7倍($0.14/M 対 $1.50/M)、定価の出力で約27倍($0.28/M 対 $7.50/M)安いです。実際の作業では約10倍に落ち着きます。Artificial Analysis は各評価実行にかかった費用を公開しており、同じ Intelligence Index スイートで DeepSeek V4 Flash 0731 が $72.02、Gemini 3.6 Flash が $726.70、その差は10.1倍です。27倍にならない理由は冗長さで、DeepSeek はその実行で出力トークンを210M消費したのに対し Gemini は59Mで、出力部分だけを見ると7.5倍になります。27倍ではなくおおよそ10倍を想定してください。
DeepSeek V4 Flash 0731 では何が変わりましたか?
ポストトレーニングのみです。DeepSeek のドキュメントには、4月のビルドと同じ 284B 総 / 13B アクティブの MoE アーキテクチャ、同じ 1M コンテキスト、同じ $0.14 / $0.28 の価格が、モデルバージョン文字列 DeepSeek-V4-Flash-0731 として記載されています。計測結果は大きく動きました。Artificial Analysis Intelligence Index v4.1 は40から50へ、GDPval-AA v2 Elo は1189から1559へ、Terminal-Bench 2.1 は17ポイント上昇して79%になりました。AA はまた、これが DeepSeek V4 Pro を6ポイント上回るとしており、これは通常の「Pro が Flash に勝る」という前提を覆すものです。
DeepSeek V4 Flash は DeepSeek V4 Pro より優れていますか?
Artificial Analysis の総合インデックスでは、2026-08-01 時点のスナップショットで6ポイント上回っており、はい優れています。さらに Flash は $0.14 / $0.28 で、Pro の $0.435 / $0.87 に比べておよそ3倍安いです。Pro にはまだ2つの利点があります。1つは Responses API から制限されていないこと(DeepSeek のドキュメントによると Responses 対応は Flash のみで、Pro 対応は2026年8月上旬予定)、もう1つは Pro の同時実行上限が500と低く、Flash の2500より少ないことです。これは主に Pro の上限を前提に規模設計していた場合に問題になります。ほとんどのルーティング判断では、0731 ビルドによって Flash がデフォルトとなり、Pro は例外になります。
DeepSeek V4 Flash は画像に対応していますか?
いいえ。DeepSeek V4 Flash 0731 はテキスト専用モデルです。関数呼び出し、JSON 出力、プロンプトキャッシング、そして OpenAI と Anthropic の両方のワイヤーフォーマットに対応しますが、画像、音声、動画の入力はありません。もしパイプラインがスクリーンショット、スキャンした PDF、動画フレームを送るなら、Gemini 3.6 Flash との価格比較は意味を失います。DeepSeek の呼び出しはそのペイロードを物理的に運べないからです。Gemini 3.6 Flash と GPT-5.6 Luna はどちらも画像入力を受け付けます。
今、GPT-5.6 Luna は DeepSeek V4 Flash より安いですか?
完全にとはいきませんが、かなり近づきました。OpenAI は 2026-07-30 に Luna の定価を80%引き下げ、$1 / $6 から $0.20 / $1.20(100万トークンあたり)にしました。DeepSeek V4 Flash は両側で依然として安く、入力で1.4倍、出力で4.3倍です。そして Luna は AA のインデックスで1ポイント高いスコアです。どの経路で購入するかに注意してください。Azure 経由で Luna を提供するゲートウェイのリストは、2026-08-01 のスナップショット時点で引き下げ前の $1 / $6 の価格帯を表示しており、同じモデル ID で5倍の差があります。
DeepSeek V4 Flash 0731 のオープンウェイトは入手できますか?
はい、2026-08-01 の確認時点で入手可能です。Hugging Face のリポジトリ deepseek-ai/DeepSeek-V4-Flash-0731 は、MIT ライセンスの下で48個の safetensors シャードとして完全なウェイトを、ゲートなし、fp8 で保持しています。AA のローンチ記事はウェイトが「数週間以内に」公開予定と述べており、多くの報道が今もこの表現を繰り返していますが、ファイルは早めに公開されました。Gemini 3.6 Flash にも GPT-5.6 Luna にもオープンウェイトの相当品はないので、DeepSeek は3つのうち、API でプロトタイプを作ってからセルフホストできる唯一のモデルです。
DeepSeek V4 Flash はなぜこれほど多くの出力トークンを使うのですか?
思考モードがデフォルトでオンだからです。DeepSeek 自身のドキュメントには、deepseek-v4-flash が非思考モードと思考モードの両方に対応し、思考モードがデフォルトであると記載されており、推論トークンは出力として課金されます。AA は最大努力の構成で Intelligence Index を実行し、出力トークン210Mを記録しましたが、これは非常に冗長だと注記しています。抽出、分類、短い編集のような範囲が限定された作業では非思考モードに切り替えることが、請求額に対する最大の梃子であり、それはフラグ1つで済みます。