DeepSeek V4 Flash vs Gemini 3.6 Flash: スコアは同点、価格は10倍差
Artificial Analysisで両者とも50点。DeepSeekは$0.14/M、Geminiは$1.50/M、だがトークン消費は210M対59M。10倍差の行方を追う。
要約: DeepSeek V4 Flash 0731 と Gemini 3.6 Flash はどちらも Artificial Analysis Intelligence Index v4.1 で50点に着地し、GPT-5.6 Luna が51点で1ポイント先行します。3つの定価は1桁以上の幅にわたります。興味深いのは、値札を比べるのをやめて、同じ評価ワークロードに対する請求書を比べ始めたときに何が起きるかです。Artificial Analysis は各モデルの実行に支払った額を公開しています。DeepSeek で $72.02、Luna で $190.87、Gemini で $726.70。出力価格の値札上の差は27倍です。実際の請求書での差は10.1倍で、その理由は DeepSeek がその実行で出力トークンを210M消費したのに対し Gemini は59Mだったからです。どちらの数字も、ワークロードがテキストなら DeepSeek を買えと言っています。しかしどちらも、画像を送るパイプラインとの接触には耐えられません。
要約: どれを選ぶべきか?
| あなたの状況 | 選ぶべきもの | 理由 |
|---|---|---|
| テキスト専用、大量、コストが制約 | DeepSeek V4 Flash 0731 | トークンあたりが約10倍安く、さらに98%のキャッシュ割引 |
| 画像、音声、動画、PDF を含む何か | Gemini 3.6 Flash | DeepSeek 0731 はテキスト専用。より安い回避策は存在しない |
| レイテンシがユーザーに見えるインタラクティブな UX | Gemini 3.6 Flash | 毎秒約220出力トークン、AA の実行では3つの中で最も低い TTFT |
| 単一の長い生成(ファイル全体、長いレポート) | DeepSeek V4 Flash 0731 | 出力上限384K 対 Gemini の64K |
| 1つのモデルで最高のインデックススコアとビジョンが欲しい | GPT-5.6 Luna | インデックス51、ビジョン、2026-07-30 の80%値下げ |
| 積極的にキャッシュできる範囲限定のエージェントループ | DeepSeek V4 Flash 0731 | キャッシュ読み取りが $0.0028/M、3つの中で圧倒的に最安 |
| 今日、再現可能な第三者のレイテンシ数値が必要 | Gemini 3.6 Flash または GPT-5.6 Luna | スナップショット時点で AA は 0731 ビルドの速度や TTFT データを持っていなかった |
ここで読むのをやめる方法が2つあります。ワークロードがテキスト以外の入力を送るなら、2行目で決着がつき、この記事の残りは背景説明です。ワークロードがテキストで、月に約20M トークン未満で動くなら、上記の最安と最高価格の選択肢の年間差はエンジニアリング1日分より小さいので、レイテンシで選んで先へ進んでください。以下はすべて、請求額が議論するに足るほど大きい場合のために書かれています。
7月31日に実際に変わったこと
DeepSeek は 2026-07-31 に V4 Flash の新ビルドを出荷しましたが、モデル自体は変えていません。同じ 284B 総パラメータ、同じ 13B アクティブ、同じ 1M コンテキスト、同じ $0.14 / $0.28 の価格。API のモデル名も変わっておらず deepseek-v4-flash で、ビルドは DeepSeek のドキュメントでモデルバージョン DeepSeek-V4-Flash-0731 として識別されます。変わったのはポストトレーニングです。
計測された効果は「ポストトレーニングのみ」が通常示唆するものより大きいです。Artificial Analysis Intelligence Index v4.1 では、スコアが40から50に上がりました。AA のエージェント評価 GDPval-AA v2 は 1189 Elo から 1559 に動きました。Terminal-Bench 2.1 は17ポイント上昇して79%に達しました。AA はまた、0731 ビルドを DeepSeek 自身のフラッグシップである DeepSeek V4 Pro より6ポイント上に位置づけており、これは Pro が難しいケースを扱うという前提でルーティングルールを書いた人にとっては厄介な結果です。
私たちもその一人でした。5月のDeepSeek V4 Pro vs Flash ルーティングガイドでは、マルチファイル作業と長いエージェントループは Pro に属すると結論づけていました。0731 ビルドについてはその結論はもはや成り立たず、正直に言えば、いまや Flash がデフォルトで、Pro は正当化して使う例外です。
ウェイトの公開は誰の予想よりも速かったです。AA のローンチ報道は完全なウェイトが「数週間以内に」公開予定と説明し、二次的な報道の多くも今なおそれを繰り返しています。2026-08-01 に確認すると、Hugging Face の deepseek-ai/DeepSeek-V4-Flash-0731 はすでにモデルを MIT ライセンス、ゲートなしで48個の safetensors シャードとして保持していました。どこかで 0731 は API 専用だと読んだなら、それは約1日だけ本当でした。
数字が始まる前に述べておくべき注意点が1つあります。Intelligence Index はローリング式のリーダーボードであり、以下のすべては 2026-08-01 のスナップショットです。順位を持続する事実として扱い、絶対スコアは特定の日に取った測定値として扱ってください。
簡易スペック比較
| DeepSeek V4 Flash 0731 | Gemini 3.6 Flash | GPT-5.6 Luna | |
|---|---|---|---|
| ofox モデル ID | deepseek/deepseek-v4-flash | google/gemini-3.6-flash | openai/gpt-5.6-luna |
| AA Intelligence Index v4.1 | 50 | 50 | 51 🏆 |
| リリース | 2026-07-31(0731 ビルド) | 2026-07-21 | 2026-07-09 |
| 入力価格(ベンダー定価) | $0.14/M 🏆 | $1.50/M | $0.20/M |
| 出力価格(ベンダー定価) | $0.28/M 🏆 | $7.50/M | $1.20/M |
| キャッシュ入力 | $0.0028/M 🏆 | $0.15/M | $0.02/M |
| コンテキストウィンドウ | 1M | 1M (1,048,576) | 1M |
| 最大出力 | 384K 🏆 | 64K (65,536) | 128K |
| 入力モダリティ | テキスト | テキスト、画像、動画、音声、PDF 🏆 | テキスト、画像 |
| 出力速度(AA) | スナップショット時点で未公開 | 219.6 tok/s 🏆 | 172.1 tok/s |
| 最初のトークンまでの時間(AA) | スナップショット時点で未公開 | 15.11s 🏆 | 121.89s |
| オープンウェイト | あり、Hugging Face で MIT 🏆 | なし | なし |
| ワイヤープロトコル | OpenAI, Anthropic, Responses | OpenAI, Gemini | OpenAI, Anthropic, Responses |
2行は見直す価値があります。最大出力は本当の分かれ目です。384K 対 64K は、長いファイルを1回の呼び出しで生成するか、継続ループを構築するかの違いです。そして空欄のレイテンシセルは書式設定のミスではありません。AA の 0731 ビルド向けプロバイダーページは、2026-08-01 のスナップショット時点で速度や最初のトークンまでの時間のデータを掲載していなかったので、このビルドについて毎秒トークン数の数値を提示する人は別のものを引用しています。
ベンチマークの全体像: 3つのモデルを1ポイントが分ける
以下は 0731 ビルドの AA サブスコア詳細で、AA が公開している場合は4月ビルドとの差分を併記しています。
| 評価 | DeepSeek V4 Flash 0731 | 4月ビルドとの変化 |
|---|---|---|
| Intelligence Index v4.1 | 50 | +10 |
| GDPval-AA v2 (Elo) | 1559 | +370 |
| Terminal-Bench 2.1 | 79% | +17 |
| GPQA Diamond | 91% | +1 |
| AA-LCR | 66% | +3 |
| SciCode | 50% | +5 |
| Humanity’s Last Exam | 37% | +5 |
| τ³-Bench Banking | 31% | +8 |
| CritPt | 17% | +9 |
| AA-Omniscience Index | -16 | +7 |
Omniscience の行は皆が読み飛ばすものです。AA は、この改善が知識の増加ではなく幻覚の減少によるもので、正確さは横ばいだったと報告しています。本番トラフィックに向けようとしているモデルにとって、「間違えることが減る」は「より多く知っている」よりも有用な改善であり、単一の総合スコアが隠しがちなものです。
出典に関する注記が2つあります。このリリースには複数組の数字が出回っているからです。
DeepSeek 自身のリリース資料は Terminal-Bench 2.1 を82.7、DeepSWE を54.4、Cybergym を76.7 と報告しています。Artificial Analysis は Terminal-Bench 2.1 を79%と報告しています。どちらも正しくあり得ます。ハーネス、足場、努力設定が異なるうえ、スナップショット時点で DeepSWE と Cybergym の数値の第三者による再現はありませんでした。私たちは通して AA の数字を使っています。ここにある3つのモデルすべてで同じ方法で計測された唯一のものだからです。どこかで82.7が引用されているのを見たら、それはベンダーのハーネスであって、矛盾ではありません。
もう1つ。ほとんどのカタログページ(私たちのものも含む)で DeepSeek V4 Flash に付いている LMArena スコアは、Overall 1438、順位は70番台で、更新は 2026-07-12 です。これは 0731 ビルドより19日前のものです。それは4月のモデルを計測しています。新ビルドの Arena スコアには新しい投票が必要で、それまでは比較ページで「DeepSeek V4 Flash」の隣にある数字は、AA で10ポイント低いスコアだったモデルを説明しています。
冗長さの税金: 値札の差が請求書の差でない理由
この2つのモデルの比較はどれも $0.14 対 $1.50 を筆頭に持ってきて、そこで止まります。その比率は本物ですが、同時にこの記事で最も信頼できない数字でもあります。仕事ではなくトークンに値付けしているからです。
Artificial Analysis はより良いものを公開しています。各モデルを同じ Intelligence Index スイートに通すために実際に支払った額を、請求書ごと公開しているのです。
| モデル | インデックス実行の出力トークン | AA の実行総コスト |
|---|---|---|
| DeepSeek V4 Flash 0731 | 210M | $72.02 |
| GPT-5.6 Luna | 130M | $190.87 |
| Gemini 3.6 Flash | 59M | $726.70 |
同じ評価、3つの実際の請求書。Gemini は DeepSeek の10.1倍、Luna は2.7倍のコストです。出力価格の値札上の比率である27倍と4.3倍に対して、DeepSeek の紙の上の優位のおよそ60%が価格表と請求書の間のどこかで消えています。
その行き先はトークンです。DeepSeek はそのスイートで出力トークンを210M消費したのに対し Gemini は59Mで、AA はこれを他と比べて非常に冗長だと注記しています。出力部分だけを定価で計算すると、DeepSeek が $58.80、Luna が $156.00、Gemini が $442.50 で、その部分では7.5倍の差になります。2つの請求書の形はそれに応じて異なります。出力は DeepSeek の実行コストの約82%、Gemini の約61%を占めます。これは同じスコアに達するのに3.5倍多く書くモデルの特徴です。AA はモデルごとの入力トークン数を公開していないので、残りは公開された数値からこれ以上分解できません。
どの数字を前提に計画するかはトラフィックによります。ほぼプロンプト主体のワークロードは入力比率の10.7倍に沿います。ほぼ生成主体のワークロードは冗長さによって7.5倍へ圧縮されます。AA のエンドツーエンドの数値10.1倍はその中間にあり、スイート自体が混合物なので、予算レビューで擁護しなければならないものには27倍より10倍がデフォルトとして適しています。
トークン数について注意が2つあります。それらは AA の最大努力と高努力の構成から得たもので、各モデルの範囲の高価な側であって、典型的な本番設定ではありません。そして冗長さはワークロード依存です。難しい推論問題ばかりのスイートは簡潔に推論するモデルを有利に見せますし、あなたの抽出パイプラインはそのスイートではありません。
210M についての脚注を1つ。AA の数字が2つ出回っているからです。モデルページはインデックス実行の出力トークンを210Mと報告し、AA のローンチ記事は約206Mと報告しています。加えてより興味深い事実として、これは前の V4 Flash ビルドが消費した(約234M)より12%少ない出力トークンです。つまり 0731 は同世代の他モデルより冗長であると同時に、自身の前身より冗長ではありません。私たちは通して210Mを使っています。モデルページの数値がここにある3つのモデルすべてで同じ方法で公開されているからです。
とはいえ梃子は本物で、それはフラグ1つです。DeepSeek のドキュメントには deepseek-v4-flash が非思考モードと思考モードの両方に対応し、思考モードがデフォルトであると記載されており、推論トークンは出力として課金されます。範囲が限定された作業では、思考をオフにするところで冗長さの税金が消えます。
自分のトラフィックで計測する
AA の比率は出発点の見積もりであって、あなたの数字ではありません。あなた自身の数字を得るには、実際のプロンプトのサンプルに対して1回実行すれば済みます。OpenAI 互換のレスポンスにはどれも必要なトークン数が含まれているからです。
import collections
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")
costs = { # input, output, per 1M tokens
"deepseek/deepseek-v4-flash": (0.14, 0.28),
"google/gemini-3.6-flash": (1.50, 7.50),
"openai/gpt-5.6-luna": (0.20, 1.20),
}
totals = collections.defaultdict(float)
for prompt in load_your_real_prompts(): # 50 is enough to see the shape
for model, (pin, pout) in costs.items():
u = client.chat.completions.create(
model=model, messages=[{"role": "user", "content": prompt}]
).usage
totals[model] += (u.prompt_tokens * pin + u.completion_tokens * pout) / 1e6
for model, spend in sorted(totals.items(), key=lambda kv: kv[1]):
print(f"{model:32} ${spend:.4f} over the sample")
代表的なプロンプト50件を3つすべてで実行しても数セント程度で、どんなリーダーボードよりも多くを教えてくれます。注意点が2つあります。DeepSeek については思考オンとオフで2回実行してください。そのフラグはモデルの選択よりも出力の列を大きく動かします。そして最も難しいケースではなく実際のトラフィック分布からサンプリングしてください。難しい推論問題で計測した冗長さの比率は、2行の分類が並ぶキューには転移しないからです。
価格計算: 2つの実際の月額請求
以下の価格はすべてベンダー定価、スナップショットは 2026-08-01、100万トークンあたりです。
シナリオ A、抽出パイプライン。 月あたり入力トークン200M、出力トークン10M、キャッシュなし、短い構造化出力。
| モデル | 入力コスト | 出力コスト | 月額合計 |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | $28.00 | $2.80 | $30.80 |
| GPT-5.6 Luna | $40.00 | $12.00 | $52.00 |
| Gemini 3.6 Flash | $300.00 | $75.00 | $375.00 |
入力が支配的なので、このシナリオは入力価格の比率に近く沿います。Gemini は DeepSeek の12倍、Luna は1.7倍のコストです。7月30日の値下げがここで Luna の位置をどれだけ変えたかに注目してください。旧価格の $1 / $6 では同じワークロードが月 $260 でした。
シナリオ B、コーディングエージェントループ。 月あたりキャッシュヒット率70%で入力トークン100M、出力トークン40M。
| モデル | キャッシュ入力 | 新規入力 | 出力 | 月額合計 |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | $0.20 | $4.20 | $11.20 | $15.60 |
| GPT-5.6 Luna | $1.40 | $6.00 | $48.00 | $55.40 |
| Gemini 3.6 Flash | $10.50 | $45.00 | $300.00 | $355.50 |
その表はトークンを一定に保っており、暗黙のうちに3つのモデルすべてが同じ仕事をするのに同じ量を書くと仮定しています。実際はそうではありません。代わりに仕事を一定に保ち、インデックス実行の冗長さ比率で出力をスケールすると、同じエージェントループについてより公平な絵が得られます。
| モデル | 同等の仕事の出力トークン | 月額合計 |
|---|---|---|
| DeepSeek V4 Flash 0731 | 142M | $44.16 |
| GPT-5.6 Luna | 88M | $113.00 |
| Gemini 3.6 Flash | 40M(基準) | $355.50 |
DeepSeek は23倍安いから8倍安いへと変わります。判断は変わりません。スライドに載せる数字は変わるべきです。
特に DeepSeek についてのこの計算のより深いバージョン、キャッシュミスが実際の請求に何をするかも含めて、についてはV4 Pro コスト内訳とDeepSeek V4 API 価格ガイドをご覧ください。
請求を動かす2つの価格の詳細
DeepSeek はまもなくピーク時価格を導入しようとしています。 その価格ドキュメントには脚注があります。API はピーク/オフピークの方針を採用し、ピーク時価格はすべての課金項目に適用される通常価格の2倍となり、発効日は公式発表待ちです。ピークの時間帯は北京時間 UTC+8 の 09:00 to 12:00 と 14:00 to 18:00 です。
無害だと決めつける前に、自分の時計に変換してください。それらの時間帯は US Eastern の 21:00 to 00:00 と 02:00 to 06:00 に当たり、これは米国日中のワークロードにとっては真夜中です。そして Central European の 03:00 to 06:00 と 08:00 to 12:00 に当たり、これはヨーロッパのチームの午前中全体を食い潰します。ヨーロッパで運用していて DeepSeek がこれを有効にすれば、労働日の前半で $0.14 が $0.28 になります。それでも Gemini より下ですが、予算に組み込んだ数字ではありません。
購入する経路はベンダーの定価と異なる場合があります。 OpenAI は 2026-07-30 に GPT-5.6 Luna を80%引き下げ、$1 / $6 から $0.20 / $1.20 にしました。Azure 経由で Luna を提供するリストは 2026-08-01 のスナップショット時点で動いておらず、私たちのものも含まれます。そこでは openai/gpt-5.6-luna は $1 / $6 の定価を表示する Azure 経路です。同じモデル ID、5倍の差、純粋にどのアップストリームに着地するかだけによるものです。
| モデル | スナップショット時の経路 | 入力 | 出力 | キャッシュ入力 |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | DeepSeek ファーストパーティ | $0.14 | $0.28 | $0.0028 |
| DeepSeek V4 Flash 0731 | Aliyun BaiLian | $0.14 | $0.28 | $0.028 |
| DeepSeek V4 Flash 0731 | Azure | $0.19 | $0.51 | $0.19 |
| Gemini 3.6 Flash | Google / Vertex | $1.50 | $7.50 | $0.15 |
| Gemini 3.6 Flash | Google バッチまたはフレックス | $0.75 | $3.75 | $0.075 |
| GPT-5.6 Luna | OpenAI ファーストパーティ | $0.20 | $1.20 | $0.02 |
| GPT-5.6 Luna | Azure | $1.00 | $6.00 | $0.10 |
その表に脚注が2つあります。私たちの Luna リストはスナップショット時点で20%のプロモーションを実施しており、Azure 経路は実質 $0.80 / $4.80 になりますが、それでも OpenAI の定価の4倍です。そしてキャッシュ読み取りの列は独自の注目に値します。Azure の DeepSeek 経路では、キャッシュ読み取りは新規入力と同じコストで、これはこのモデルが持つ単一で最大のコスト優位を消し去ります。
その表が教える一般則: モデル名ではなく経路を確認せよ。ラボが発表した値下げはそのラボ自身の API には即座に届きますが、他の全員にはそれぞれのスケジュールで届きます。上の7行のうち2行は、非常に異なる金額の同じモデルです。
テキスト専用が実際にあなたに要求するコスト
この比較で最も安いモデルは見ることができません。DeepSeek V4 Flash 0731 はテキストを受け取り、関数を呼び出し、JSON を返し、OpenAI と Anthropic の両方のワイヤーフォーマットを話します。そしてそれが全リストです。Gemini 3.6 Flash はテキスト、画像、動画、音声、PDF を受け取ります。GPT-5.6 Luna はテキストと画像を受け取ります。
これはプロンプトエンジニアリングやより大きな予算で埋められる品質のギャップではありません。もしパイプラインが壊れた UI のスクリーンショット、スキャンした請求書、動画のフレームを送るなら、DeepSeek の呼び出しはより高い価格で優雅に失敗するのではありません。構造的に失敗します。上のすべてのコスト表はその種の仕事には無関係になります。だからこそモダリティの行はスペック表の一番下に埋もれさせるのではなく上部近くに置いてあります。
よくある解決策はトラフィックを分割することです。マルチモーダルのリクエストは Gemini へ、それ以外はすべて DeepSeek へ、前段にルーターを1つ。それは1つのモデルを選ぶより手間がかかりますが、90%のリクエストがテキストのパイプラインでは、たいてい最初の月で元が取れます。
DeepSeek V4 Flash 0731 を選ぶべきとき
請求が実際の費用項目になる、大量のテキスト専用ワークロード。キャッシュヒット率の高いものは不釣り合いに恩恵を受けます。$0.0028/M のキャッシュ読み取りは新規入力からの98%割引、50倍の削減だからです。単一の長い生成にも有利です。最大出力384K は Gemini の上限の6倍です。また3つの中で公開ウェイトを持つ唯一のもので、Hugging Face で MIT ライセンスなので、API でプロトタイプを作ってから後でセルフホストする計画なら、これが道筋のあるモデルです。
範囲が限定された作業では思考をオフにしてください。それが上の $15.60 と $44.16 の行の違いです。
Gemini 3.6 Flash を選ぶべきとき
テキスト以外のモダリティが関わるときは常に。それは価格が会話に入る前に決着をつけます。レイテンシがユーザーに見えるときも。毎秒219.6出力トークンは、スナップショット時点で AA の速度ランキングで185モデル中3位に位置づけ、最初のトークンまで15.11秒は推論モデルとしては速いです。そして依存しようとしているものを第三者に計測してもらいたいときも。AA は Gemini については速度とレイテンシを公開していましたが、0731 ビルドについては公開していなかったからです。
バッチ層は過小評価されています。遅延を許容できる仕事に対して $0.75 / $3.75 なら、Gemini の DeepSeek との実効的な距離は半分になります。
GPT-5.6 Luna を選ぶべきとき
3つの中で最高のインデックススコアとビジョンを同じモデルで欲しいとき。そして80%の値下げによって、その組み合わせが3週間前には無理だった形で手頃になりました。$0.20 / $1.20 の Luna は、価格では Gemini よりも DeepSeek に近く、しかも両者より1ポイント高いスコアです。
先に確認すべきことが2つあります。AA が計測した最初のトークンまで121.89秒は最大努力の構成で、最大努力はインタラクティブな設定ではありません。UI で Luna を使うなら、より低い努力レベルを使ってください。そしてゲートウェイがどの経路に載せているかを確認してください。引き下げ前の Azure 層は OpenAI の定価の5倍だからです。私たちのGPT-5.6 層ガイドは、Sol、Terra、Luna がどう仕事を分担するかを扱っています。
3つのどれも正解でないとき
ワークロードが小さいなら、これはどれも問題になりません。月に数百万トークンなら、ここでの最安と最高価格の選択肢の差はエンジニアリング1時間に対する丸め誤差なので、能力で選んで先へ進むべきです。
ゼロを追うなら、ホスト型 API は間違った道具です。このモデルファミリーの無料およびセルフホストの道筋は、実際の上限が付いた別の作業で、DeepSeek V4 Flash 無料: 4つのゼロコストの道筋で扱っています。それらの道筋は 0731 に先行するビルドに対して検証されているので、頼る前に上限を再確認してください。セルフホストの道筋はそれ以降変わっています。0731 のウェイトはいまや Hugging Face で MIT の下にあるので、ライセンス不要の選択肢は4月のビルドではなく現行のビルドに適用されます。
そして仕事が2桁台のツール呼び出しを伴う深いマルチステップのエージェント作業なら、これら3つのフラッシュ層モデルはどれも明らかな適合ではありません。それはフロンティア層の領域で、正直な答えは誰かのインデックスではなく自分のトレースでベンチマークすることです。以前のGemini Flash Lite vs DeepSeek V4 Flash エージェントループ比較は、ツール呼び出しの信頼性が深さにおいて計算をどう変えるかを説明しています。
ofox で3つすべてを試す: 1つのループで A/B
3つすべてが1つの OpenAI 互換エンドポイントで動くので、比較は3つの統合ではなく文字列の入れ替えです。モデル ID は deepseek/deepseek-v4-flash、google/gemini-3.6-flash、openai/gpt-5.6-luna です。
Python
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")
MODELS = [
"deepseek/deepseek-v4-flash",
"google/gemini-3.6-flash",
"openai/gpt-5.6-luna",
]
prompt = "Refactor this function to remove the nested loop. Return only code."
for model in MODELS:
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
u = r.usage
print(f"{model:32} in={u.prompt_tokens:6} out={u.completion_tokens:6}")
レイテンシだけでなく completion_tokens も記録してください。その列こそ、自分のトラフィックで冗長さの差が現れる場所であり、値札が教えてくれない数字です。
Node
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.ofox.io/v1",
apiKey: process.env.OFOX_API_KEY,
});
const models = [
"deepseek/deepseek-v4-flash",
"google/gemini-3.6-flash",
"openai/gpt-5.6-luna",
];
for (const model of models) {
const r = await client.chat.completions.create({
model,
messages: [{ role: "user", content: "Summarize this changelog in 3 bullets." }],
});
console.log(model, r.usage.prompt_tokens, r.usage.completion_tokens);
}
DeepSeek が実行できない呼び出し
同じクライアント、同じエンドポイント、すべてを変える1つのコンテンツブロック。これを google/gemini-3.6-flash か openai/gpt-5.6-luna に送れば答えが返ります。deepseek/deepseek-v4-flash に送れば、どんな価格でも動きません。
import base64
img = base64.b64encode(open("screenshot.png", "rb").read()).decode()
r = client.chat.completions.create(
model="google/gemini-3.6-flash",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Which element is misaligned?"},
{"type": "image_url",
"image_url": {"url": f"data:image/png;base64,{img}"}},
],
}],
)
print(r.choices[0].message.content)
代替案
3つのどれも合わないなら、確認する価値のある近隣モデルは同じエンドポイントにあります。定価 $0.435 / $0.87 の DeepSeek V4 Pro(ofox のリストは $0.45 / $0.88 に丸めています)は、いまや AA のインデックスでより高価で低スコアの兄弟ですが、あなたのトレースで勝つというワークロード固有の証拠があるなら依然として正しい選択です。GPT-5.6 Terra は、フラッシュ層が本当に不十分なときに Luna の上に位置します。ofox カタログの外では、同じモデルが DeepSeek、Google AI Studio、OpenAI API からファーストパーティで入手でき、これはベンダーが1つだけで足り、経路が追いつくのを待つのではなく値下げがあった当日に手に入れたい場合に正しい選択です。
ライブ価格付きのモデルページ: DeepSeek V4 Flash、Gemini 3.6 Flash、GPT-5.6 Luna。
出典
- https://artificialanalysis.ai/articles/deepseek-v4-flash-0731-scores-50-on-the-artificial-analysis-intelligence-index-10-points-above-previous-deepseek-v4-flash
- https://artificialanalysis.ai/models/deepseek-v4-flash
- https://artificialanalysis.ai/models/gemini-3-6-flash
- https://artificialanalysis.ai/models/gpt-5-6-luna
- https://api-docs.deepseek.com/quick_start/pricing
- https://ai.google.dev/gemini-api/docs/pricing?hl=en
- https://docs.cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/3-6-flash
- https://developers.openai.com/api/docs/pricing
- https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731


