DeepSeek V4 Flash 对决 Gemini 3.6 Flash:分数打平,价格差 10 倍
两者在 Artificial Analysis 上都拿 50 分。DeepSeek 定价 $0.14/M,Gemini 为 $1.50/M,但前者花掉 210M token,后者仅 59M。10 倍差距藏在哪。
太长不看: DeepSeek V4 Flash 0731 和 Gemini 3.6 Flash 在 Artificial Analysis Intelligence Index v4.1 上都落在 50 分,GPT-5.6 Luna 以 51 分领先一分。它们的标价跨度超过一个数量级。有意思的地方在于:当你不再对比价签,而是开始对比同一套评测工作负载的实际账单时会发生什么。Artificial Analysis 公布了它跑每个模型所付的钱:DeepSeek $72.02,Luna $190.87,Gemini $726.70。输出价签上的差距是 27x,实际账单上的差距是 10.1x,因为 DeepSeek 那次跑烧掉了 210M 输出 token,而 Gemini 只用了 59M。两个数字都在说:如果你的工作负载是文本,就选 DeepSeek;但一旦流水线要发送图像,这两个数字都撑不住。
太长不看:你该选哪个?
| 你的情形 | 选择 | 原因 |
|---|---|---|
| 纯文本、高并发、成本是硬约束 | DeepSeek V4 Flash 0731 | 每 token 最便宜,约 10x,还叠加 98% 的缓存折扣 |
| 涉及图像、音频、视频或 PDF 的任何场景 | Gemini 3.6 Flash | DeepSeek 0731 只支持文本;没有更便宜的绕行方案 |
| 用户能感知到延迟的交互式 UX | Gemini 3.6 Flash | 约每秒 220 个输出 token,且在 AA 的测试中三者里 TTFT 最低 |
| 长的单次生成(完整文件、长报告) | DeepSeek V4 Flash 0731 | 最大输出 384K,Gemini 只有 64K |
| 想在一个模型上同时拥有最高指数分和视觉能力 | GPT-5.6 Luna | 指数 51、支持视觉,且在 2026-07-30 降价 80% |
| 可以激进缓存的有界智能体循环 | DeepSeek V4 Flash 0731 | 缓存读取 $0.0028/M,是三者中最低的,且遥遥领先 |
| 你今天就需要可复现的第三方延迟数据 | Gemini 3.6 Flash 或 GPT-5.6 Luna | 快照时 AA 没有 0731 版本的速度或 TTFT 数据 |
有两种理由可以读到这里就停下。如果你的工作负载会发送任何非文本输入,第二行就已经拍板,本文其余部分只是背景。如果你的工作负载是文本,且每月运行量在约 2000 万 token 以下,那么上表中最便宜和最贵选项之间的年度差额,比一天的工程时间还小,所以按延迟来选然后往下走就行。下文所有内容,都是写给账单大到值得争论的场景。
7 月 31 日到底改了什么
DeepSeek 在 2026-07-31 发布了 V4 Flash 的新版本,但没有改动模型本身。同样的 284B 总参数、同样的 13B 激活、同样的 1M 上下文、同样的 $0.14 / $0.28 定价。API 模型名也没变,仍是 deepseek-v4-flash,该版本在 DeepSeek 文档中标识为模型版本 DeepSeek-V4-Flash-0731。变的是后训练。
实测效果比「仅后训练」通常给人的印象要大得多。在 Artificial Analysis Intelligence Index v4.1 上,分数从 40 涨到 50。AA 的智能体评测 GDPval-AA v2 从 1189 Elo 升到 1559。Terminal-Bench 2.1 提升 17 个点,达到 79%。AA 还把 0731 版本排在 DeepSeek 自家旗舰 DeepSeek V4 Pro 之上 6 个点,这对任何按「Pro 处理难题」的假设写过路由规则的人来说都是个尴尬的结果。
我们也是这类人之一。我们五月的 DeepSeek V4 Pro 与 Flash 路由指南 得出结论:多文件工作和长智能体循环应交给 Pro。对 0731 版本而言,这个结论不再成立,诚实的说法是:Flash 现在是默认,Pro 是你需要拿出理由才用的例外。
权重上线得比谁说的都快。AA 的发布报道称完整权重预计在「未来几周」推出,多数二手报道至今仍在重复这句话。在 2026-08-01 核实时,Hugging Face 上的 deepseek-ai/DeepSeek-V4-Flash-0731 已经以 48 个 safetensors 分片、MIT 许可、无门槛的形式提供了该模型。如果你在别处读到 0731 只有 API,那大概只在一天左右的时间里是对的。
在数字开始堆叠之前,有一点值得先说清楚。Intelligence Index 是一个滚动排行榜,下文的一切都是 2026-08-01 的快照。请把排序当作耐久的事实,把绝对分数当作某一天的读数。
参数速览对比
| DeepSeek V4 Flash 0731 | Gemini 3.6 Flash | GPT-5.6 Luna | |
|---|---|---|---|
| ofox 模型 ID | deepseek/deepseek-v4-flash | google/gemini-3.6-flash | openai/gpt-5.6-luna |
| AA Intelligence Index v4.1 | 50 | 50 | 51 🏆 |
| 发布时间 | 2026-07-31(0731 版本) | 2026-07-21 | 2026-07-09 |
| 输入价格(厂商标价) | $0.14/M 🏆 | $1.50/M | $0.20/M |
| 输出价格(厂商标价) | $0.28/M 🏆 | $7.50/M | $1.20/M |
| 缓存输入 | $0.0028/M 🏆 | $0.15/M | $0.02/M |
| 上下文窗口 | 1M | 1M (1,048,576) | 1M |
| 最大输出 | 384K 🏆 | 64K (65,536) | 128K |
| 输入模态 | 文本 | 文本、图像、视频、音频、PDF 🏆 | 文本、图像 |
| 输出速度(AA) | 快照时未公布 | 219.6 tok/s 🏆 | 172.1 tok/s |
| 首 token 时间(AA) | 快照时未公布 | 15.11s 🏆 | 121.89s |
| 开放权重 | 是,Hugging Face 上 MIT 许可 🏆 | 否 | 否 |
| 协议格式 | OpenAI、Anthropic、Responses | OpenAI、Gemini | OpenAI、Anthropic、Responses |
有两行值得再看一眼。最大输出是个真正的分水岭:384K 对 64K,是「一次调用生成长文件」和「构建续写循环」之间的区别。而空着的延迟单元格并不是排版失误。AA 关于 0731 版本的供应商页面在 2026-08-01 快照时没有列出任何速度或首 token 时间数据,所以任何给你报某个每秒 token 数的人,报的都是别的东西。
基准全景:三个模型仅差一分
以下是 0731 版本的 AA 子项分数明细,凡是 AA 公布了四月版本对应数据的,都附上了差值。
| 评测 | DeepSeek V4 Flash 0731 | 相较四月版本的变化 |
|---|---|---|
| Intelligence Index v4.1 | 50 | +10 |
| GDPval-AA v2 (Elo) | 1559 | +370 |
| Terminal-Bench 2.1 | 79% | +17 |
| GPQA Diamond | 91% | +1 |
| AA-LCR | 66% | +3 |
| SciCode | 50% | +5 |
| Humanity’s Last Exam | 37% | +5 |
| τ³-Bench Banking | 31% | +8 |
| CritPt | 17% | +9 |
| AA-Omniscience Index | -16 | +7 |
Omniscience 这一行是大家会跳过的。AA 报告称,提升来自更少的幻觉,而非知道得更多,准确率持平。对于一个你即将接入生产流量的模型来说,「更少出错」比「知道更多」是更有用的升级,而这恰恰是单一综合分会掩盖的那类东西。
这里有两条来源说明,因为这次发布不止一套数字在流传。
DeepSeek 自己的发布材料报告 Terminal-Bench 2.1 为 82.7、DeepSWE 为 54.4、Cybergym 为 76.7。Artificial Analysis 报告的 Terminal-Bench 2.1 是 79%。两者都可能是对的;测试框架、脚手架和努力档位各不相同,而且快照时并没有第三方复现过 DeepSWE 和 Cybergym 的数字。我们全程采用 AA 的数字,因为在这里的三个模型上,只有它是用同一种方式测出来的。如果你在别处看到有人引用 82.7,那是厂商自己的测试框架,并非矛盾。
另一条:附在多数目录页(包括我们的)上的 DeepSeek V4 Flash 的 LMArena 分数显示为 Overall 1438、排名七十几,更新于 2026-07-12。它比 0731 版本早了十九天,测的是四月的模型。新版本的 Arena 分数需要新的投票,在那之前,任何对比页面上「DeepSeek V4 Flash」旁边的那个数字,描述的都是一个在 AA 上低 10 分的模型。
啰嗦税:为什么价签差距不等于账单差距
对这两个模型的每一篇对比都以 $0.14 对 $1.50 开头,然后就停在那里。这个比例是真实的,但它也是本文里最不可靠的数字,因为它给一个 token 定价,而不是给一件工作定价。
Artificial Analysis 公布了更好的东西:它用同一套 Intelligence Index 跑每个模型时实际付了多少钱,连账单一起。
| 模型 | 该次指数跑的输出 token | AA 该次跑的总花费 |
|---|---|---|
| DeepSeek V4 Flash 0731 | 210M | $72.02 |
| GPT-5.6 Luna | 130M | $190.87 |
| Gemini 3.6 Flash | 59M | $726.70 |
同一套评测,三张真实账单。Gemini 的花费是 DeepSeek 的 10.1x,Luna 是 2.7x。对照输出价格 27x 和 4.3x 的价签比例,这意味着 DeepSeek 纸面优势的大约 60% 在价格卡和账单之间的某处消失了。
消失去了 token 里。DeepSeek 在那套评测上花了 210M 输出 token,Gemini 只用了 59M,AA 将其标注为在同类中非常啰嗦。单把输出这一段按标价算,DeepSeek 是 $58.80,Luna 是 $156.00,Gemini 是 $442.50,这一段的差距是 7.5x。两张账单的构成也因此不同:输出约占 DeepSeek 那次花费的 82%,占 Gemini 的约 61%。这是一个为达到同样分数而写出三倍半文字的模型的特征。AA 不公布每个模型的输入 token 数,所以剩下的部分无法从公开数字进一步拆解。
你该按哪个数字来规划,取决于你的流量。以提示为主的工作负载会贴近输入比例 10.7x。以生成为主的工作负载会被啰嗦压向 7.5x。AA 的端到端数字 10.1x 落在两者之间,跑在一套本身就是混合的评测上,这也是为什么在预算评审里需要辩护的场景,用 10x 作默认比 27x 更靠谱。
关于这些 token 数有两点提醒。它们来自 AA 的最大努力和高努力配置,这是每个模型区间里最贵的那一端,而非典型的生产设定。而且啰嗦程度取决于工作负载;一套满是硬推理题的评测偏袒推理简短的模型,而你的抽取流水线不是那套评测。
关于 210M 的一条脚注,因为流传着两个 AA 数字。模型页面报告该次指数跑为 210M 输出 token;AA 的发布文章报告约 206M,同时还有个更有意思的事实:这比上一个 V4 Flash 版本花的(约 234M)少 12%。所以 0731 既比同类更啰嗦,又比自己的前代更省。我们全程用 210M,因为模型页面的数字是这里三个模型都以同一种方式公布的那个。
不过这个杠杆是真实存在的,而且只是一个开关。DeepSeek 文档列出 deepseek-v4-flash 同时支持非思考和思考两种模式,默认是思考模式,而推理 token 按输出计费。对于有界任务,关掉思考就是啰嗦税消失的地方。
在你自己的流量上测量
AA 的比例是个起点估计,不是你的数字。要拿到你自己的数字,只需在你真实提示的一个样本上跑一次,因为每个 OpenAI 兼容的响应都会带上你需要的 token 计数:
import collections
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")
costs = { # input, output, per 1M tokens
"deepseek/deepseek-v4-flash": (0.14, 0.28),
"google/gemini-3.6-flash": (1.50, 7.50),
"openai/gpt-5.6-luna": (0.20, 1.20),
}
totals = collections.defaultdict(float)
for prompt in load_your_real_prompts(): # 50 is enough to see the shape
for model, (pin, pout) in costs.items():
u = client.chat.completions.create(
model=model, messages=[{"role": "user", "content": prompt}]
).usage
totals[model] += (u.prompt_tokens * pin + u.completion_tokens * pout) / 1e6
for model, spend in sorted(totals.items(), key=lambda kv: kv[1]):
print(f"{model:32} ${spend:.4f} over the sample")
用五十条有代表性的提示,在三个模型上各跑一遍只花几分钱,能告诉你的东西比任何排行榜都多。有两点要注意。给 DeepSeek 分别在思考开启和关闭下各跑一次,因为这个开关对输出这一列的影响比模型选择还大。而且要从你实际的流量分布里取样,而不是取最难的用例,因为在硬推理题上测出的啰嗦比例,无法迁移到一队两行的分类任务上。
定价算账:两张真实的月度账单
以下所有价格均为厂商标价,快照日期 2026-08-01,按每 1M token 计。
场景 A,一个抽取流水线。 每月 200M 输入 token 和 10M 输出 token,无缓存,输出为短结构化。
| 模型 | 输入成本 | 输出成本 | 月度合计 |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | $28.00 | $2.80 | $30.80 |
| GPT-5.6 Luna | $40.00 | $12.00 | $52.00 |
| Gemini 3.6 Flash | $300.00 | $75.00 | $375.00 |
输入占主导,所以这个场景紧贴输入价格比例:Gemini 的花费是 DeepSeek 的 12x,Luna 是 1.7x。注意 7 月 30 日的降价把 Luna 的位置改变了多少。按旧的 $1 / $6,同样的工作负载每月要 $260。
场景 B,一个编码智能体循环。 每月 100M 输入 token(缓存命中率 70%)和 40M 输出 token。
| 模型 | 缓存输入 | 新鲜输入 | 输出 | 月度合计 |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | $0.20 | $4.20 | $11.20 | $15.60 |
| GPT-5.6 Luna | $1.40 | $6.00 | $48.00 | $55.40 |
| Gemini 3.6 Flash | $10.50 | $45.00 | $300.00 | $355.50 |
那张表把 token 数固定住了,这暗地里假设三个模型为做同一件工作会写出同样多的字。它们不会。改为固定工作量,并按指数跑的啰嗦比例来缩放输出,能给出同一个智能体循环更公平的画面:
| 模型 | 等量工作所需的输出 token | 月度合计 |
|---|---|---|
| DeepSeek V4 Flash 0731 | 142M | $44.16 |
| GPT-5.6 Luna | 88M | $113.00 |
| Gemini 3.6 Flash | 40M(基准) | $355.50 |
DeepSeek 从便宜 23x 变成便宜 8x。决策不变,但你放进幻灯片的那个数字应该变。
关于 DeepSeek 这套算账更深入的版本,包括缓存未命中对真实账单的影响,见我们的 V4 Pro 成本拆解 和 DeepSeek V4 API 定价指南。
两个会左右你账单的定价细节
DeepSeek 即将引入高峰时段定价。 其定价文档里有一条脚注:API 将采用高峰/非高峰政策,高峰时段价格为常规价格的 2x,适用于所有计费项,生效日期待官方公告。高峰窗口为北京时间(UTC+8)09:00 到 12:00 和 14:00 到 18:00。
在假设它无害之前,先换算到你自己的时钟上。这些窗口落在美国东部时间 21:00 到 00:00 和 02:00 到 06:00,对于美国白天的工作负载正是半夜;落在中欧时间 03:00 到 06:00 和 08:00 到 12:00,会吃掉一个欧洲团队的整个上午。如果你在欧洲运行,而 DeepSeek 把它开起来,那么工作日的前半天你的 $0.14 会变成 $0.28。这仍然低于 Gemini,但已经不是你当初预算的那个数字。
你走哪条通道购买,可能和厂商标价不同。 OpenAI 在 2026-07-30 把 GPT-5.6 Luna 降价 80%,从 $1 / $6 降到 $0.20 / $1.20。通过 Azure 提供 Luna 的列表在 2026-08-01 快照时还没有变动,包括我们的,其中 openai/gpt-5.6-luna 是一条 Azure 通道,显示 $1 / $6 标价。同一个模型 ID,相差 5x,纯粹取决于你落到哪个上游。
| 模型 | 快照时的通道 | 输入 | 输出 | 缓存输入 |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | DeepSeek 第一方 | $0.14 | $0.28 | $0.0028 |
| DeepSeek V4 Flash 0731 | 阿里云 BaiLian | $0.14 | $0.28 | $0.028 |
| DeepSeek V4 Flash 0731 | Azure | $0.19 | $0.51 | $0.19 |
| Gemini 3.6 Flash | Google / Vertex | $1.50 | $7.50 | $0.15 |
| Gemini 3.6 Flash | Google batch 或 flex | $0.75 | $3.75 | $0.075 |
| GPT-5.6 Luna | OpenAI 第一方 | $0.20 | $1.20 | $0.02 |
| GPT-5.6 Luna | Azure | $1.00 | $6.00 | $0.10 |
那张表有两条脚注。我们的 Luna 列表在快照时正在跑一个 20% 的促销,把 Azure 通道拉到实际 $0.80 / $4.80,仍是 OpenAI 标价的四倍。而缓存读取那一列值得单独看一眼:在 Azure 的 DeepSeek 通道上,缓存读取和新鲜输入同价,这抹掉了这个模型最大的那项成本优势。
这张表教给你的通用规则是:查通道,而不是查模型名。某个实验室宣布的降价会立刻到达它自己的 API,其他人则各按各自的节奏。上面七行里有两行是同一个模型,价格却相差悬殊。
纯文本实际会让你付出什么
这次对比里最便宜的模型看不见东西。DeepSeek V4 Flash 0731 接受文本、调用函数、返回 JSON,同时讲 OpenAI 和 Anthropic 两种协议格式,就这些。Gemini 3.6 Flash 接受文本、图像、视频、音频和 PDF。GPT-5.6 Luna 接受文本和图像。
这不是靠提示工程或更大预算能弥补的质量差距。如果你的流水线要发送坏掉界面的截图、扫描的发票,或视频里的帧,DeepSeek 的调用不会以更高价格优雅降级,而是从结构上失败。对于这类工作,上面每一张成本表都变得无关紧要,这也是为什么模态那一行放在参数表靠上的位置,而不是埋在最底下。
一个常见的解法是把流量拆开:多模态请求发给 Gemini,其余全发给 DeepSeek,前面放一个路由器。这比只选一个模型要多干点活,但对于 90% 请求都是文本的流水线,通常在第一个月就能回本。
何时该选 DeepSeek V4 Flash 0731
有量的纯文本工作负载,账单是一项真实的支出。任何缓存命中率高的场景都受益尤其大,因为 $0.0028/M 的缓存读取相当于新鲜输入 98% 的折扣,是 50x 的降幅。长的单次生成也偏爱它:384K 最大输出是 Gemini 上限的六倍。它也是三者中唯一公布了权重的,在 Hugging Face 上以 MIT 许可发布,所以如果计划是先用 API 做原型、之后自托管,这一个是有路径的。
对有界任务关掉思考。它就是上面 $15.60 和 $44.16 两行之间的区别。
何时该选 Gemini 3.6 Flash
只要涉及非文本模态,价格还没进对话它就已经拍板了。还有当延迟对用户可见时:219.6 输出 token/秒让它在快照时的 AA 速度排名里位列 185 个模型中的第三,15.11 秒的首 token 时间对一个推理模型来说很快。以及当你希望你即将依赖的东西已经被第三方测过时,因为 AA 公布了 Gemini 的速度和延迟,却没有 0731 版本的。
批处理档被低估了。对于能容忍延迟的工作,$0.75 / $3.75 让 Gemini 与 DeepSeek 的有效距离减半。
何时该选 GPT-5.6 Luna
当你想在同一个模型上同时拥有三者中最高的指数分和视觉能力时,而这次降价 80% 让这个组合变得实惠,这在三周前还做不到。$0.20 / $1.20 的 Luna 在价格上现在更接近 DeepSeek 而非 Gemini,得分却比两者都高一分。
先查两件事。AA 测得的 121.89 秒首 token 时间是最大努力配置,而最大努力不是交互式设定;如果你在 UI 里用 Luna,就用更低的努力档。还要确认你的网关把你放到哪条通道上,因为降价前的 Azure 档是 OpenAI 标价的 5x。我们的 GPT-5.6 分档指南 讲了 Sol、Terra 和 Luna 如何分工。
何时三者都不是正确答案
如果你的工作负载很小,这一切都无所谓。在每月几百万 token 的量级上,这里最便宜和最贵选项之间的差别,相对于一小时工程时间只是舍入误差,你应该按能力来选然后往下走。
如果你在追求零成本,托管 API 就是错的工具。这个模型家族的免费和自托管路径是另一套单独的活,带着实打实的额度上限,见 DeepSeek V4 Flash 免费:四条零成本路径。那些路径是针对 0731 之前的版本核实过的,所以在依赖它们之前请重新核对额度。自托管路径此后有了变化:0731 权重现在已在 Hugging Face 上以 MIT 许可提供,所以免许可选项适用于当前版本,而非四月那个。
而如果这份活是深度多步的智能体工作、工具调用达到两位数,那么这三个 flash 档模型都不是明显合适的选择。那是前沿档的领地,诚实的答案是在你自己的轨迹上做基准测试,而不是在任何人的指数上。我们之前的 Gemini Flash Lite 对决 DeepSeek V4 Flash 智能体循环对比 讲解了工具调用可靠性在深度上如何改变这笔账。
通过 ofox 试用全部三个:在一个循环里做 A/B
三个都跑在一个 OpenAI 兼容的端点上,所以对比是换个字符串的事,而不是三套集成。模型 ID 分别是 deepseek/deepseek-v4-flash、google/gemini-3.6-flash 和 openai/gpt-5.6-luna。
Python
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")
MODELS = [
"deepseek/deepseek-v4-flash",
"google/gemini-3.6-flash",
"openai/gpt-5.6-luna",
]
prompt = "Refactor this function to remove the nested loop. Return only code."
for model in MODELS:
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
u = r.usage
print(f"{model:32} in={u.prompt_tokens:6} out={u.completion_tokens:6}")
记录 completion_tokens,而不只是延迟。那一列就是啰嗦差异在你自己流量上显现的地方,也是价签不会告诉你的那个数字。
Node
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.ofox.io/v1",
apiKey: process.env.OFOX_API_KEY,
});
const models = [
"deepseek/deepseek-v4-flash",
"google/gemini-3.6-flash",
"openai/gpt-5.6-luna",
];
for (const model of models) {
const r = await client.chat.completions.create({
model,
messages: [{ role: "user", content: "Summarize this changelog in 3 bullets." }],
});
console.log(model, r.usage.prompt_tokens, r.usage.completion_tokens);
}
DeepSeek 跑不了的那次调用
同一个客户端、同一个端点,一个改变一切的内容块。把它发给 google/gemini-3.6-flash 或 openai/gpt-5.6-luna,你会得到答案。把它发给 deepseek/deepseek-v4-flash,则无论什么价格都不行。
import base64
img = base64.b64encode(open("screenshot.png", "rb").read()).decode()
r = client.chat.completions.create(
model="google/gemini-3.6-flash",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Which element is misaligned?"},
{"type": "image_url",
"image_url": {"url": f"data:image/png;base64,{img}"}},
],
}],
)
print(r.choices[0].message.content)
备选方案
如果三个都不合适,值得看的邻居就在同一个端点上。DeepSeek V4 Pro 标价 $0.435 / $0.87(ofox 列表四舍五入为 $0.45 / $0.88),现在是 AA 指数上更贵且分数更低的那个兄弟,不过如果你有针对特定工作负载的证据表明它在你的轨迹上胜出,它仍是正确选择。GPT-5.6 Terra 在 flash 档确实不够用时排在 Luna 之上。在 ofox 目录之外,同样的模型可以从 DeepSeek、Google AI Studio 和 OpenAI API 第一方获得,如果你只需要一个厂商、并且想在降价当天就拿到而不是等通道跟上,那这是正确选择。
带实时定价的模型页面:DeepSeek V4 Flash、Gemini 3.6 Flash、GPT-5.6 Luna。
来源
- https://artificialanalysis.ai/articles/deepseek-v4-flash-0731-scores-50-on-the-artificial-analysis-intelligence-index-10-points-above-previous-deepseek-v4-flash
- https://artificialanalysis.ai/models/deepseek-v4-flash
- https://artificialanalysis.ai/models/gemini-3-6-flash
- https://artificialanalysis.ai/models/gpt-5-6-luna
- https://api-docs.deepseek.com/quick_start/pricing
- https://ai.google.dev/gemini-api/docs/pricing?hl=en
- https://docs.cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/3-6-flash
- https://developers.openai.com/api/docs/pricing
- https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731


