Qwen 3.7 Max、Kimi K3、DeepSeek V4 实测对比:34 倍价差
同一套评测、同一套方法:Kimi K3 得 57 分,跑完花 $2,437;DeepSeek V4 Flash 得 50 分,只花 $72;Qwen 3.7 Max 得 46 分,花了 $1,604。
三个中国旗舰家族,同一套评测,跑完它的花费相差 34 倍。 最强和最弱之间的能力差是 13 个 index 分。账单差是 $2,365。
- 能力最强:Kimi K3 (max),Artificial Analysis Intelligence Index v4.1 得 57 分
- 性价比断层第一:DeepSeek V4 Flash 0731,50 分,跑完 index 只花 $72.02
- 最快:Qwen 3.7 Max,206.4 输出 token/秒
- 意外之处:这一组里最便宜的模型,分数压过了它所低于的两个旗舰
- 四个模型今天都在 ofox 上,所以切换只是改一个 model ID

摘要:你该选哪个?
| 你的处境 | 选 | 理由 |
|---|---|---|
| 最难的推理,预算不是约束 | Kimi K3 | 四个里分数最高,57 分 |
| 高频 agent 循环,成本主导 | DeepSeek V4 Flash 0731 | 50 分,同一套评测的花费比 K3 低 34 倍 |
| 延迟比最后几分更要紧 | Qwen 3.7 Max | 206.4 tok/s 对 K3 的 35 |
| 需要图片输入 | Kimi K3 或 Qwen 3.8 Max | 另外三个在目录里是纯文本 |
| 今天还在用 DeepSeek V4 Pro | 重新评估 | Flash 0731 高 6 分,花费低 2.4 倍 |
| 给混合负载挑一个默认模型 | DeepSeek V4 Flash 0731 | 分数每美元领先一个数量级,且 1M 上下文 |
| 想用最新的 Qwen | Qwen 3.8 Max | 比 3.7 Max 便宜,但还没有第三方分数 |
两种可以就此打住的情况。月 token 支出低于约 $200,直接选 DeepSeek V4 Flash 就走,下面所有优化都不值你花一个下午。生产环境的 agent 循环月支出超过 $2,000,直接跳到评测花费那一节,34 倍就在那里。
规格快速对照
下表数据全部来自 ofox 模型目录,2026-08-03 实时拉取。
| Kimi K3 | DeepSeek V4 Flash | DeepSeek V4 Pro | Qwen 3.7 Max | |
|---|---|---|---|---|
| 模型 ID | moonshotai/kimi-k3 | deepseek/deepseek-v4-flash | deepseek/deepseek-v4-pro | bailian/qwen3.7-max |
| 输入 / 每百万 | $3.00 | $0.14 | $0.45 | $2.50 |
| 输出 / 每百万 | $15.00 | $0.28 | $0.88 | $7.50 |
| 缓存读 / 每百万 | $0.30 | $0.0028 | $0.0037 | $0.50 |
| 上下文窗口 | 1,048,576 | 1,000,000 | 1,000,000 | 1,064,000 |
| 最大输出 | 1,048,576 | 384,000 | 384,000 | 64,000 |
| 输入模态 | 文本、图片 | 文本 | 文本 | 文本 |
| 开源权重 | 有 | 有(MIT) | 有 | 无 |
这张表里有三处值得停下来看。
缓存读那一列不是四舍五入的差别。 DeepSeek 的缓存输入是 $0.0028 每百万。Qwen 3.7 Max 同样一件事收 $0.50,是 179 倍;K3 收 $0.30,是 107 倍。如果你的负载有一份大的、被反复读取的系统提示词,决定账单的是缓存读单价,不是那个显眼的输入单价。
Qwen 3.7 Max 的 64K 输出上限是四个里最紧的,比 DeepSeek 紧六倍,比 K3 紧十六倍。如果你的任务是「读一个大仓库,产出一个大文件」,最先卡住你的是这个上限而不是别的。Qwen 3.8 Max 把它提到了 131K,细节见 Qwen 3.8 Max 发布拆解。
只有 K3 同时具备开源权重和第一梯队分数。 DeepSeek 的权重是 MIT 且可下载,但它在这里的最高分来自便宜的那个模型而不是旗舰。Qwen 3.7 Max 完全没有开源权重,不过阿里已宣布 Max 级别的开源权重发布定在 2026-08-10 那一周。
同一把尺子量出来是什么结果?
Artificial Analysis Intelligence Index v4.1,快照 2026-08-03。 这是本文唯一一个用同样方法测过全部四个模型的来源,整篇对比都锚在它上面。
| 模型 | Index 分数 | 本组排名 |
|---|---|---|
| Kimi K3 (max) | 57 | 1 |
| DeepSeek V4 Flash 0731 | 50 | 2 |
| Qwen 3.7 Max | 46 | 3 |
| DeepSeek V4 Pro(Reasoning, Max Effort) | 44 | 4 |
这个 index 是九项评测的合成:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。
看排序,别抠绝对分。这是一个滚动榜,index 版本和模型构建变了就会重新打分,所以「K3 第一、Flash 第二」比「57 和 50」更经得起时间。Flash 与 Qwen 3.7 Max 之间那 4 分的差距,在一次重跑就可能翻转的范围内。
不会变的是这个意外的方向:这一组里最便宜的模型压在两个旗舰之上,其中一个还是同一家厂商的。
有三件事会改变这个排名,而且三件在一个季度内都可能发生:
- Qwen 3.8 Max 被收录。 它比 3.7 Max 便宜,阿里自己的表也把它放在明显领先上一代的位置。如果它以 $2.00/$6.00 的价格落在 K3 附近,性价比这一列就要重排。
- DeepSeek 再出一个构建。 0731 那次重训在架构不变的情况下把 Flash 拉高了 10 分,没有理由认为那是最后一次。
- Index 版本变化。 v4.1 增加并重新加权了评测项;一个 v4.2 完全可能在没有任何模型改变的情况下,把只差 4 分的两个模型换位。
所以更该做的是每季度重跑自己的评测,而不是从任何一篇文章(包括这篇)继承一份排名。
各家厂商也都发自己的表,而那些表互相之间不可比。Qwen 给 3.8 Max 发的表对标的是 Claude 和 GPT,评测框架是 Qwen 自己选的。Moonshot 的 K3 发布表里 Terminal-Bench 2.1 是 88.3,而榜首是 88.8,那是第二不是第一。DeepSeek 自己报的 V4 Flash 的 Terminal-Bench 分数高于 Artificial Analysis 对同一模型测出的值。这是三套不同的测量设置,把它们混进一张表,就是一篇对比变得毫无意义的方式。
跑完同一套评测到底要花多少钱?
这个数字重新定义了整场对比。 Artificial Analysis 会公布自己在每个模型上跑完 index 的总花费,所以这是同一份工作量的真账单,而不是拿单价乘出来的估算。
| 模型 | Index 分数 | 产生的输出 token | 跑完 index 的花费 |
|---|---|---|---|
| Kimi K3 (max) | 57 | 130M | $2,437.41 |
| Qwen 3.7 Max | 46 | 100M | $1,604.13 |
| DeepSeek V4 Pro | 44 | 180M | $176.34 |
| DeepSeek V4 Flash 0731 | 50 | 210M | $72.02 |
从这四行推算出来(derived):
- K3 的花费是 V4 Flash 的 33.8 倍,换来 +7 分。
- Qwen 3.7 Max 的花费是 V4 Flash 的 22.3 倍,而且低 4 分。
- V4 Pro 的花费是 V4 Flash 的 2.4 倍,而且低 6 分。
- K3 的花费是 Qwen 3.7 Max 的 1.5 倍,换来 +11 分。
关于价格列的一点说明:Artificial Analysis 把 DeepSeek V4 Pro 标为 $0.435 / $0.87,而 ofox 目录四舍五入成 $0.45 / $0.88。评测花费那几个数字来自 Artificial Analysis,用的是它自己的单价;上面的规格表用的是目录的。
这四组对比里只有一组算是一笔交易,另外三组描述的是「又贵又差」。
K3 的溢价至少说得通:你比 Qwen 3.7 Max 多付 1.5 倍,换到实打实的 11 分,如果你的工作卡在最难的推理上,这是一次理性采购。而比 V4 Flash 多付 22 倍、分数还低 4 分,这不是交易,这是 2026-07-31 之后没人重跑过数字留下的惯性。
为什么最便宜的模型能压过两个旗舰?
因为 0731 是重训而不是新模型,而它把分数抬了 10 分。 DeepSeek V4 Flash 0731 保持了同样的 284B 总参、13B 激活的 MoE 架构,回来时从上一版的 40 分变成了 50 分。
答案的另一半是啰嗦,而这一半对 DeepSeek 不利。
- V4 Flash 在这套 index 上产生了 210M 输出 token,四个里最多。
- Qwen 3.7 Max 产生了 100M,最少。
- 也就是说同样的活,Flash 吐出的 token 是 Qwen 的 2.1 倍。
这就是实际差距小于单价差距的原因。Qwen 3.7 Max 的输出单价是 Flash 的 26.8 倍($7.50 对 $0.28),但真实账单只差 22.3 倍。Flash 靠多说话把大约五分之一的价格优势还了回去,然后还是赢了一大截。
DeepSeek 默认开启思考,而推理 token 按输出计费,啰嗦就是从这里来的。它可以关掉。但关掉的同时,你也放弃了一部分把 Flash 顶到两个旗舰之上的那个分数,所以决定之前先用自己的 prompt 两种模式各测一遍。
这一节的实用版本:按 token 的标价是一个很差的成本代理指标。 单价差 27 倍的两个模型,干完同样的活只差 22 倍;单价差 1.5 倍的两个模型,干完同样的活差了 2.4 倍。模型之间的 token 用量差异,比价格差异更大。
换成你的月账是多少?
一套 benchmark 不是你的工作负载。 下面把同一场对比放到一个具体团队上,单价用规格表里 ofox 目录的值。
场景:5 个开发者跑编码 agent。
- 每人每天 40 个任务,每月 21 个工作日
- 中位任务:12,000 输入 token 的仓库上下文,3,000 输出 token
- 40% 的输入命中提示词缓存
每人每月的量:1,008 万输入 token(403 万命中缓存,605 万未命中)和 252 万输出 token。
| 缓存输入 | 未缓存输入 | 输出 | 每人 | 5 人团队 | |
|---|---|---|---|---|---|
| Kimi K3 | $1.21 | $18.14 | $37.80 | $57.15 | $285.77 |
| Qwen 3.7 Max | $2.02 | $15.12 | $18.90 | $36.04 | $180.18 |
| DeepSeek V4 Pro | $0.01 | $2.72 | $2.22 | $4.95 | $24.77 |
| DeepSeek V4 Flash | $0.01 | $0.85 | $0.71 | $1.56 | $7.82 |
K3 与 Flash 之间落在 36.5 倍,与 index 那次跑出来的 33.8 倍很接近。两份完全不同的工作负载给出同一个量级的比值,是这个比值站得住的一个合理信号。
对这张表要做一处修正,而且对 Flash 不利。 它假设每个模型每个任务都吐 3,000 个输出 token,而 index 那次的数据说这是错的:同样的活 Flash 吐的 token 是 Qwen 的 2.1 倍。把 Flash 的输出那一行乘 2.1,团队月成本从 $7.82 变成约 $11.70,与 K3 的差距从 36.5 倍降到大约 24 倍。
仍然是 24 倍。啰嗦税是真的,但它远远填不平这条沟。
这个场景会在哪里误导你:
- 缓存命中率在这里承担了很多。 40% 命中的情况下,DeepSeek 近乎免费的缓存读几乎看不出来,因为绝对值太小。换成一份 20 万 token 的系统提示词、每天被读几百次的负载,那一列会变成账单的全部,差距只会更大。
- 它给 token 定价,不给结果定价。 如果 K3 一次做完的事 Flash 要重试三次,重试成本和工程师时间会把上面所有数字淹没。
- 单价会动。 DeepSeek 这两个构建在过去一个季度里价格和分数都变过。承诺之前先拉当前值。
它们各自有多快?
Qwen 3.7 Max 的输出吞吐是 Kimi K3 的 5.9 倍。
| 模型 | 输出 token/秒 |
|---|---|
| Qwen 3.7 Max | 206.4 |
| DeepSeek V4 Pro | 55.0 |
| Kimi K3 (max) | 35 |
| DeepSeek V4 Flash 0731 | 未公布 |
Artificial Analysis 把 K3 标为明显偏慢、V4 Pro 标为低于平均,而 Qwen 3.7 Max 在其价格档里明显高于平均。写作时 0731 这一版 Flash 还没有公布速度测量,所以那一格留空,不拿上一版的数字去填。
速度改变的东西和分数不一样。12 分的 index 差距体现为模型能不能完成某类任务。5.9 倍的吞吐差距体现为一次 40 分钟的 agent 运行会不会变成四小时。对交互式工具和长自治循环来说,后者往往才是人真正感觉到的约束。
什么时候该选 Kimi K3?
当任务在另外三个上失败,而失败的代价高于 token 的时候。
具体信号:
- 你的评测显示其他模型是在某一类任务上失败,而不只是做得差一点。
- 你需要图片输入配上第一梯队推理。这一条我们在 2026-08-03 通过网关实测过:发一张图让 prompt token 从 97 涨到 189,并返回了准确描述,所以视觉是真通而不只是列在字段里。
- 你需要一次性产出非常长的回复。K3 的 1,048,576 最大输出是 Qwen 3.7 Max 上限的 16 倍。
- 你希望分数最高的那个同时是开源权重,K3 是,Qwen 3.7 Max 不是。
不该选它的信号:高请求量、对延迟敏感的交互,或者任何你还没真正量出质量差异的负载。35 token/秒加 $15 每百万输出,K3 对「量大」和「性急」两件事都会惩罚。它在中国模型之外的位置见 Kimi K3 对比 GPT-5.5 与 Opus 4.8,接入方式见 Kimi K3 使用指南。
什么时候该选 DeepSeek V4 Flash?
当作默认,直到有什么东西让它失败为止。
它在四个里排第二,成本低一个数量级,有 1M 上下文窗口和 384K 输出上限,还带 MIT 开源权重。反对它的理由很窄:
- 纯文本。 没有图片输入,任何碰截图或图片型文档的管线都用不了。
- 啰嗦。 这套 index 上 210M 输出 token,四个里最多。要为推理 token 留预算,长循环上给
max_tokens设上限。 - 比 K3 低 7 分。 这是真的,在你最难的那一小块工作上会显出来。
如果你现在用的是 DeepSeek V4 Pro,这一节是最该动手的。Flash 0731 高 6 分,跑同一套评测的花费低 2.4 倍。任何「难的给 Pro、简单的给 Flash」的路由规则,都是对着一个已经不存在的构建写的。跨厂商的预算档对比见 V4 Flash 对比 Gemini 3.6 Flash,V4 系列的整体情况见 DeepSeek V4 发布指南。
什么时候该选 Qwen?
当吞吐是约束的时候,或者你本来就在阿里的生态里。
Qwen 3.7 Max 在这一组里的论据是速度:206.4 输出 token/秒,接近 V4 Pro 的 4 倍、K3 的 6 倍。对一个用户盯着 token 一个个冒出来的对话产品,或者一个按墙钟而不是按美元衡量的 agent 循环,这是任何 index 分数都捕捉不到的真实产品差异。
反对它的论据是,在这组数字上它能力居中、成本靠上,这个位置很尴尬。它比一个跑同样评测便宜 22 倍的模型还低 4 分。
而且它已经不是阿里最新的了。 Qwen 3.8 Max 在 2026-08-03 上线,$2.00/$6.00,两边都比 3.7 Max 便宜,输出上限 131K,还带图片输入。它没有进这场对比,是因为写作时 Artificial Analysis 还没有它的页面,没有可以并列的同法分数。如果你今天是在挑一个 Qwen 而不是在比公开数字,起点应该是 3.8 Max。更便宜的同系列见 3.7 Plus 与 3.7 Max 实测对比。
什么时候一个都别选?
三种情况下,这整个货架都是错的:
- 你需要视频输入。 四个模型通过网关都不接受。Qwen 3.8 Max 的目录条目只列了文本和图片,尽管 QwenCloud 自己的页面列了视频。
- 你需要它们没有的某个特定前沿能力。 如果你的评测是按 Claude 或 GPT 的行为校准的,7 分的 index 差距不会告诉你这次替换安不安全。跑你自己的评测集。
- 你的瓶颈不在模型上。 如果一个检索 bug 或一个糟糕的提示词比 token 账单更贵,本文所有数字都帮不上忙。
通过 ofox 一次跑通三家:10 行做 A/B
四个模型在同一个目录里,所以这场对比是一个遍历 model ID 的循环,不是四次接入。
Python:同一个 prompt 跑遍四个模型
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("OFOX_API_KEY"),
base_url="https://api.ofox.io/v1",
)
MODELS = [
"moonshotai/kimi-k3",
"deepseek/deepseek-v4-flash",
"deepseek/deepseek-v4-pro",
"bailian/qwen3.7-max",
]
prompt = "重构这个模块,并说明迁移过程中的风险。"
for model in MODELS:
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
max_tokens=2048,
)
u = r.usage
print(f"{model:<32} out={u.completion_tokens:<7} total={u.total_tokens}")
Node:同样的形状
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.OFOX_API_KEY,
baseURL: "https://api.ofox.io/v1",
});
for (const model of ["moonshotai/kimi-k3", "deepseek/deepseek-v4-flash", "bailian/qwen3.7-max"]) {
const r = await client.chat.completions.create({
model,
messages: [{ role: "user", content: prompt }],
max_tokens: 2048,
});
console.log(model, r.usage.completion_tokens);
}
打印 completion_tokens,不要只看延迟。上面那张评测花费表的全部意义就在于:这几个模型之间 token 用量的差异比价格差异更大,所以在你自己的 prompt 上得到的每模型输出 token 数,比任何公开榜单都值钱。
关于目录字段的一点提醒。K3 的条目只列了 /v1/chat/completions,而 Qwen 和 DeepSeek 的条目还列了 /v1/responses。这个字段在两个方向上都出错过,所以按你打算用的协议发一个真请求,别拿 metadata 做规划。各模型当前单价见 Kimi K3、DeepSeek V4 Flash 和 Qwen 3.7 Max 的模型页。
常见问题
2026 年最好的中国模型是哪个? 按 Artificial Analysis Intelligence Index v4.1 在 2026-08-03 的快照,Kimi K3 (max) 的 57 分是这一组里最高的。按每美元得分算,DeepSeek V4 Flash 0731 领先大约一个数量级。
Kimi K3 比 DeepSeek V4 Flash 贵这么多值吗? 它用同一套评测 33.8 倍的花费买到 7 个 index 分。只有当某一类任务在 Flash 上失败而在 K3 上成功时才值,而这件事你必须用自己的 prompt 量出来。
DeepSeek V4 Flash 有开源权重吗?
有。0731 这一版在 Hugging Face 上是 deepseek-ai/DeepSeek-V4-Flash-0731,MIT 许可,fp8,非 gated。
为什么这篇比的是 Qwen 3.7 Max 而不是 3.8 Max? 因为写作时 Artificial Analysis 还没有 3.8 Max 的页面,没有和另外三个用同一套方法测出的分数。Qwen 3.7 Max 是有可比第三方数字的最新 Qwen。
哪个模型的输出上限最大? Kimi K3,1,048,576 token。DeepSeek 那两个是 384,000,Qwen 3.7 Max 是 64,000。
这几个里有支持视觉的吗? Kimi K3 支持,2026-08-03 通过网关实测过。Qwen 3.8 Max 支持。Qwen 3.7 Max 和两个 DeepSeek V4 在目录里都是纯文本。
Artificial Analysis 那个花费就是我的账单吗? 不是。那是一套特定的 9 项评测,它告诉你的是模型之间在固定工作量上的比值,不是你的绝对支出。用它排序,然后用自己的 prompt 去测。
本次核实的来源
- https://artificialanalysis.ai/models/kimi-k3
- https://artificialanalysis.ai/models/deepseek-v4-flash
- https://artificialanalysis.ai/models/deepseek-v4-pro
- https://artificialanalysis.ai/models/qwen3-7-max
- https://ofox.io/zh/models/moonshotai/kimi-k3
- https://ofox.io/zh/models/deepseek/deepseek-v4-flash
- https://ofox.io/zh/models/bailian/qwen3.7-max
GET https://api.ofox.io/v1/models(2026-08-03 实调,取 model ID、价格、上下文与模态字段)- 针对
moonshotai/kimi-k3的图片输入实测,2026-08-03:带图 prompt token 189,同一 prompt 不带图 97,描述准确
常见问题
- Qwen 3.7 Max、Kimi K3、DeepSeek V4 哪个更好?
- 按 Artificial Analysis Intelligence Index v4.1(快照 2026-08-03):Kimi K3 (max) 57 分,DeepSeek V4 Flash 0731 50 分,Qwen 3.7 Max 46 分,DeepSeek V4 Pro 44 分。所以四个里 K3 能力最强,V4 Flash 第二,压过了两个单价高得多的旗舰。但能力排序不等于性价比排序:跑完同一套 index,K3 花了 $2,437.41,V4 Flash 只花 $72.02。
- 同样的工作量在每个模型上要花多少钱?
- Artificial Analysis 会公布自己跑完 Intelligence Index 在每个模型上的总花费,这是目前最干净的同工作量对照数据。2026-08-03 快照:Kimi K3 (max) $2,437.41,Qwen 3.7 Max $1,604.13,DeepSeek V4 Pro $176.34,DeepSeek V4 Flash 0731 $72.02。最贵和最便宜之间差 33.8 倍,而分数只差 7 分。
- DeepSeek V4 Flash 真的比 V4 Pro 强吗?
- 在这个榜上是的。V4 Flash 0731 得 50 分,V4 Pro 得 44 分;跑完 index 的花费是 Flash $72.02、Pro $176.34。0731 是同架构重训而不是新模型,却把 Flash 的分数拉高了 10 分。如果你的 V4 Pro 路由规则是 2026-07-31 之前定的,续用之前值得重跑一次评测。
- Kimi K3 为什么这么贵?
- 两件事叠加。它的 token 单价是这一组里最高的,输入 $3.00、输出 $15.00 每百万;而且它慢,Artificial Analysis 测到 35 输出 token/秒。单价体现在账单上,速度体现在 agent 循环的墙钟时间上。K3 确实是四个里分数最高的,所以这个溢价买到了真东西,只是不便宜。
- 为什么不是 Qwen 3.8 Max?
- Qwen 3.8 Max 于 2026-08-03 发布,$2.00/$6.00,两边都比 3.7 Max 便宜,输出上限也从 64K 提到 131K。它是被刻意排除在表外的:写作时 Artificial Analysis 还没有它的页面,没有用同一套方法测出的分数。把厂商自测分塞进第三方对照表,会毁掉这篇文章赖以成立的可比性。
- 这几个模型哪些支持图片输入?
- Kimi K3 支持,Qwen 3.8 Max 支持。Qwen 3.7 Max、DeepSeek V4 Pro 和 V4 Flash 在 ofox 目录里都标为纯文本。K3 我们在 2026-08-03 通过网关实测过:一张图让 prompt token 从 97 涨到 189,描述准确,所以图片输入是真通而不只是列在字段里。
- 能用一把 key 同时调这几个模型吗?
- 可以。四个模型都在 ofox 目录里,ID 分别是 bailian/qwen3.7-max、moonshotai/kimi-k3、deepseek/deepseek-v4-pro 和 deepseek/deepseek-v4-flash,切换只是改一个 model ID,不是重做接入。这才是让「用自己的 prompt 做 A/B」便宜到真的会去做的前提,而这件事比任何公开榜单都重要。
- 哪个模型最快?
- Qwen 3.7 Max,而且领先幅度很大。Artificial Analysis 测到它 206.4 输出 token/秒,DeepSeek V4 Pro 是 55.0,Kimi K3 是 35(AA 页面直接标注为「明显偏慢」)。写作时 V4 Flash 0731 还没有公布速度数据。对一个长 agent 循环来说,5.9 倍的吞吐差改变的是一天的工作节奏,比几分榜单差距更能被感知到。


