Qwen 3.8 Max 对比 DeepSeek V4 Flash:差 3 分,账单差 345 倍
Qwen 3.8 Max 在 AA Intelligence Index 拿 53 分,DeepSeek V4 Flash 0731 拿 50 分。但实测三个任务,前者贵 345 倍、慢 6 倍。这 3 分什么时候值得付。
先给结论,字段可直接抄走:
AA Intelligence Index v4.1: Qwen 3.8 Max 53 · DeepSeek V4 Flash 0731 50
Arena 文本榜 Elo: 1496 ±10 对 1436 ±4(Qwen 领先 60)
参数: 2.4T / 激活 95B 对 284B / 激活 13B(8.5 倍)
ofox 每百万 token 价: $2.00 / $6.00 对 $0.14 / $0.28(14.3 倍、21.4 倍)
实测三任务: $0.052328 对 $0.000151(345 倍),181 秒对 30 秒(6 倍)
只有一个能看图: Qwen 3.8 Max(图片 + 视频 + 联网搜索)
单次输出上限更高: DeepSeek V4 Flash,384K 对 131K
ofox model ID: bailian/qwen3.8-max · deepseek/deepseek-v4-flash
快照日期: 2026-08-04
r/DeepSeek 昨天在吵一张图:这两个模型在 Artificial Analysis Intelligence Index 上只差 3 分,而其中一个的参数是另一个的 8.5 倍。帖子标题写的是「性能相近」,最高赞评论直接否掉了这个说法——3 分不是噪声,他们是对的。但那个帖子里没人算另一半账。我们把两个模型放在同一个网关上跑了同样三个任务,这 3 分的代价是 345 倍。
摘要:你该选哪个?
| 你的处境 | 选 | 理由 |
|---|---|---|
| 大批量文本处理,成本是硬约束 | DeepSeek V4 Flash | 输出便宜 21.4 倍,index 只落后 3 分 |
| 任何涉及截图、扫描件、视频的活 | Qwen 3.8 Max | 有图片、视频输入和联网搜索;DeepSeek 是纯文本 |
| 最难的推理,3 分能决定成败 | Qwen 3.8 Max | AA 53 对 50,Arena 文本榜领先 60 分 |
| 单次要吐很长的内容 | DeepSeek V4 Flash | 输出上限 384K 对 131K |
| 对延迟敏感的交互产品 | DeepSeek V4 Flash | 三个任务合计 30 秒对 181 秒 |
| 输出必须严格对齐格式或行数 | Qwen 3.8 Max | 要 40 行就给 40 行;DeepSeek 只给了 29 行 |
| 带大段缓存前缀的 agent 循环 | DeepSeek V4 Flash | 缓存读 $0.0028 对 $0.25,差 89 倍 |
| 想用最便宜的方式够到第一梯队 | 都不选,见下文 | Kimi K3 57 分、GLM-5.2 51 分 |
规格对照
价格是 2026-08-04 从 ofox 模型页实抓的。参数量取自各家自己的发布材料。
| 规格 | Qwen 3.8 Max | DeepSeek V4 Flash 0731 |
|---|---|---|
| ofox model ID | bailian/qwen3.8-max | deepseek/deepseek-v4-flash |
| 输入 / 每百万 | $2.00 | $0.14 |
| 输出 / 每百万 | $6.00 | $0.28 |
| 缓存读 / 每百万 | $0.25 | $0.0028(DeepSeek provider 行) |
| 缓存写 / 每百万 | $2.50 | $0.175(BaiLian provider 行) |
| 总参数 | 2.4T | 284B |
| 每 token 激活 | 95B | 13B |
| 上下文窗口 | 1M | 1M |
| 单次输出上限 | 131K | 384K |
| 图片输入 | 支持 | 不支持 |
| 视频输入 | 支持 | 不支持 |
| 联网搜索 | 支持 | 不支持 |
| 协议 | OpenAI + Anthropic | OpenAI + Anthropic |
| 发布日期 | 2026-08-03 | 2026-07-31 |
有两行几乎决定了整个选择。Qwen 是唯一能看图的那个,而 DeepSeek 单次能吐出 2.9 倍的 token。其余都归结为一个问题:3 分 index 对你值多少钱。
第三方评测里谁更高?
Qwen 3.8 Max,在每一个同时收录两者的来源上都领先。 但差距一致地小。
| 来源(快照 2026-08-04) | Qwen 3.8 Max | DeepSeek V4 Flash 0731 |
|---|---|---|
| AA Intelligence Index v4.1 | 53 | 50 |
| Arena 文本榜 Elo | 1496 ±10 | 1436 ±4 |
| Arena WebDev 榜 Elo | 1668 +18/-18 | 1577(flash-high) |
| Arena Vision 榜 Elo | 1305 ±9 | 纯文本,不参与 |
| LiveBench 2026-06-25 | 未收录 | 74.2 |
用这些数字之前,先看清它们的来源层级。
- AA 那个 53 是本文来源最弱的一个数字,我们选择标出来而不是藏起来。 Artificial Analysis 没有给 Qwen 3.8 Max 建模型页:这个分数只存在于 Intelligence Index 图表控件里,所以通常能拿到的逐模型数据(跑完 index 的花费、verbosity、输出速度)对它都不存在。同一套 index 的参照系:Kimi K3 57、GLM-5.2 51、Gemini 3.6 Flash 50、DeepSeek V4 Pro 44、Qwen 3.7 Max 46。
- Arena 的数字是我们直接从榜上读的。 那里的 Elo 每天滚动更新,所以排序是耐用的部分,具体数值只是快照。60 分的差距配上 ±10 和 ±4 的区间,是真实领先。
- LiveBench 根本没测过 Qwen 3.8 Max。 它给 DeepSeek V4 Flash 0731 打 74.2 分,而四月版是 65.5——这是七月那次重训带来了什么的最清楚证据。
引发那个 Reddit 帖子的参数效率论点,算术上是成立的:284B 总参数打到 2.4T 模型的 3 分以内,每 token 激活 13B 对 95B。这件事对你重不重要,取决于你是在买权重还是在买 token。如果你买的是 token,参数量是厂商的问题,价格才是你的问题。
三个真实任务实测下来如何?
两个模型都做对了活,但账单不在一个量级。 2026-08-04,我们通过 api.ofox.ai/v1/chat/completions 发了三个 prompt,默认参数、无 system prompt,token 数取自 API 返回的 usage 对象。
| 任务 | Qwen 3.8 Max | DeepSeek V4 Flash 0731 |
|---|---|---|
| 收据抽成 JSON | 1,332 输出,26.0 秒,正确 | 133 输出,13.6 秒,正确 |
修一个有 bug 的 median() | 3,385 输出,73.2 秒,用例通过 | 67 输出,6.6 秒,用例通过 |
| HTTP 400-439 的 40 行 CSV | 3,881 输出,82.1 秒,40 行 | 236 输出,10.1 秒,29 行 |
| 输出 token 合计 | 8,598(19.7 倍) | 436 |
| 墙钟时间合计 | 181.3 秒(6.0 倍) | 30.3 秒 |
| 三题总成本 | $0.052328(345 倍) | $0.000151 |
三条观察比总数更有用。
- 推理上两边都没错。 收据那题给出的 JSON 完全一致,逐行算术都对。两边都返回了能处理偶数长度的 median,我们把函数拿去实际执行、跑了四组用例才判定正确。3 分 index 差在这种体量的活上没有表现为对错差异——这本来就该如此:benchmark 的差距活在困难长尾里,不在日常任务里。
- 严格格式那题 Qwen 完胜。 要求给出覆盖 400 到 439 的 40 行,Qwen 正好给了 40 行,未分配的状态码用占位说明补齐。DeepSeek 给了 29 行,悄悄跳过所有未分配码,然后跑到范围外去加了个 451。如果下游解析器期待固定形状,这是正确性问题,不是风格偏好。
- 延迟是被啰嗦度放大的,6 倍不是吞吐量断言。 我们这个数是三次调用的端到端墙钟时间,驱动它的是 token 数量而不是速度:Qwen 多吐了 19.7 倍输出。每秒吞吐是另一种测量,而且这场对比里只有一边有。Artificial Analysis 给 DeepSeek V4 Flash 0731 标 122.7 输出 token/秒(该视图第 8/101 名,2026-08-04 读取),对 Qwen 3.8 Max 则没有吞吐数据,因为它没有模型页。所以 6 倍要理解成「这批活早六倍干完」,而不是「这个模型每 token 快六倍」。对批处理这是成本项,对交互产品这是产品决策。
三个 prompt 是样本,不是研究。三题方向一致,而验证它在你的活上成不成立,最便宜的办法是文末那段循环代码。
写代码用哪个更好?
看榜是 Qwen 3.8 Max,看账单是 DeepSeek V4 Flash。 Arena 的 WebDev 榜由人类并排比较生成的前端代码,qwen3.8-max 1668(+18/-18),deepseek-v4-flash-high 1577。这 91 分的差距比通用文本榜上的 60 分更宽,说明 Qwen 多出来的参数确实有一部分花在了前端生成上。
给这个 1668 一点参照:同一张榜上 kimi-k3-max 是 1676、claude-opus-5-high 是 1669,三者置信区间互相重叠。Qwen 3.8 Max 在这项任务上确实进了第一梯队,而 $2 的输入价通常买不到这个位置。
我们自己那道编码题没有复现出这个差距,这件事本身是有信息量的,不是矛盾。两个模型都在第一次尝试就正确修好了偶数长度的 median bug,而那个修法一共六行。日常修补分不出 53 和 50。分得出的是长尾:不熟悉的框架、含糊的需求、要跨文件保持一致的重构。如果你的编码工作大部分是日常那种,你在为一个不会显形的差异付 21 倍;如果大部分是困难那种,WebDev 榜说明这钱花出去有响声。
0731 那次重训到底改了什么?
它把 DeepSeek V4 Flash 从明显落后拉到只差 3 分。 model ID 没变,架构没变,价格也没变,变的是权重。
LiveBench 把两个版本分开打分,差值一目了然:
| LiveBench 2026-06-25 | 总平均分 |
|---|---|
| DeepSeek V4 Flash 0731 | 74.2 |
| DeepSeek V4 Pro | 71.6 |
| DeepSeek V4 Flash(四月版) | 65.5 |
同一套评测涨了 8.7 分,而且把便宜档拉过了 DeepSeek 自家旗舰。在 Artificial Analysis 的 index 上同样的倒挂也成立:V4 Flash 0731 是 50,V4 Pro 是 44。
两个现实后果:
- ofox 上的条目已经指向 0731。
deepseek/deepseek-v4-flash的目录页写的发布日期是 2026-07-31,所以你不用加日期后缀就拿到重训后的权重。任何八月之前写的关于 V4 Flash 的内容,描述的是一个实质上更弱的模型。 - 六月写的对比是过期,不是错。 六月那种「Qwen 大幅领先」的判断在当时是准确的。今天还剩下的差距是 3 分 index,本文说的就是这 3 分。
两个模型都能走 Anthropic 协议吗?
都能,POST https://api.ofox.io/anthropic/v1/messages 两个都有响应。 2026-08-04 我们给两边发了同一句只要一个词的指令:
curl https://api.ofox.io/anthropic/v1/messages \
-H "x-api-key: $OFOX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"bailian/qwen3.8-max","max_tokens":64,
"messages":[{"role":"user","content":"Reply with exactly: ok"}]}'
两边都回了 ok。但 usage 对象对不上:Qwen 3.8 Max 报的是 98 输入、27 输出,DeepSeek V4 Flash 报的是 15 输入、2 输出。同一个两字母答案,输出 token 差 13 倍、输入 token 差 6.5 倍——这还没乘上 21.4 倍的单价差。
如果你的团队跑的是 Anthropic 形状的工具链、又想在后面接一个更便宜的模型,这件事就有意义:请求结构不变,响应里照样返回 cache_creation_input_tokens 和 cache_read_input_tokens,动的只有 model 字符串。
每月账单各是多少?
15 倍到 82 倍之间,取决于你按 rate card 算还是按实际吐回来的 token 算。 下面两个场景都用 ofox 目录价、每月按 30 天。这是对公开价格做的算术,不是发票。
场景 A,按 rate card 算。 每天 500 万输入 token、50 万输出 token,不走缓存。
| 模型 | 每天 | 每月 | 相对 DeepSeek |
|---|---|---|---|
| DeepSeek V4 Flash | $0.84 | $25.20 | 基准 |
| Qwen 3.8 Max | $13.00 | $390.00 | 15.5 倍 |
场景 B,同样的活,按我们实测的 token 比例算。 Qwen 吐出 19.7 倍的输出,所以它那 50 万变成每天 985 万,而 DeepSeek 还是 50 万。
| 模型 | 每天 | 每月 | 相对 DeepSeek |
|---|---|---|---|
| DeepSeek V4 Flash | $0.84 | $25.20 | 基准 |
| Qwen 3.8 Max,实测比例 | $69.10 | $2,073.00 | 82 倍 |
一旦把两边实际吐回来的量算进去,rate card 把差距少算了五倍。
缓存这一行需要一个说明,因为 ofox 给 DeepSeek V4 Flash 列了三个 provider,而它们的缓存定价并不一样:
| ofox 上的 provider 行 | 输入 / 输出 | 缓存读 |
|---|---|---|
| DeepSeek | $0.14 / $0.28 | $0.0028 |
| BaiLian(阿里云) | $0.14 / $0.28 | $0.028 |
| Azure | $0.19 / $0.51 | $0.19 |
相对 Qwen 的 $0.25 便宜 89 倍这个说法,只在 DeepSeek 行成立——Artificial Analysis 的缓存命中价榜也是按这一行给的 $0.003/百万。落到 BaiLian 行,同样的比较是 8.9 倍,仍然是大差距,但小了一个数量级。在拿最低那个数字做预算之前,先确认你的流量会落到哪个 provider。
Qwen 3.8 Max 能做而 DeepSeek V4 Flash 做不了的是什么?
看。 ofox 目录给 bailian/qwen3.8-max 列的是 Vision、Video Input 和 Web Search,给 deepseek/deepseek-v4-flash 列的是 Function Calling 和 Prompt Caching。这是能力线,价格优势再大也跨不过去。
会撞上这堵墙的活:
- 截图分诊、UI 走查,以及任何要检查自己渲染结果的 agent
- 扫描件、票据、表单,任何以照片形式到达的东西
- 视频关键帧打标,这需要视频输入这条路径
- 图表和示意图,数字只存在于图里
- 幻灯片、看板、文档排版类工作——阿里的发布演示重点就在这里
那个 Reddit 帖子里有条评论把这一点讲得最锋利:带图片输入的模型可以写一个 UI、截图、再检查自己的成果。纯文本模型在任何价位都进不了这个循环。
反方向的差距更窄但真实存在。DeepSeek 的 384K 输出上限对 Qwen 的 131K 是 2.9 倍,它决定一份长翻译、一整套测试、一次大规模结构化抽取能不能一次返回,还是逼你去写分块逻辑。
r/DeepSeek 到底在吵什么?
那个帖子自己否掉了自己的标题,而被否掉的过程才是有用的部分。 帖子把 53 对 50 加上 8.5 倍参数量框成了「性能相近」。得票最高的两条回复是「这不叫性能相近」和「3 分是个大差距」,从数字上看都对。
那个帖子里有三个论点值得带进决策,因为它们覆盖了榜单覆盖不到的地方。
- 办公文档缺口。 有评论指出四月版 DeepSeek V4 Flash 在 AA briefcase 这项评测上表现很差——这项测的是表格、文档、幻灯片和 PDF 上的工作——而七月重训版还没有被测过。阿里给 3.8 Max 做的发布演示大量集中在幻灯片、看板和分析型排版上。如果你的负载是办公形状的,通用 index 分数就是错的量具,而这件事目前两个模型都没有能定论的公开数字。
- 自我检查循环。 带图片输入的模型可以生成 UI、截图、检查自己的输出。DeepSeek V4 Flash 完全进不了这个循环,这是结构差异,不是质量差异。
- 效率论点是双向的。 284B 总参数落在 2.4T 模型 3 分以内,是实打实的工程成果。但除非你在自托管,它跟你的账单无关:走 API 你买的是 token 不是参数,而把这份效率换成你的省钱的,是 DeepSeek 的定价。
那个帖子里没人算的,正是我们量出来的东西:同样三个任务,成本差 345 倍、墙钟差 6 倍。参数效率是他们争的题,token 效率才是改变预算的那个数。
两个之间怎么路由?
默认走便宜的,用一句话能说清的规则做升级。 两个模型在同一个端点后面,所以路由决策落在你自己的代码里,而不是第二套集成。
一条和我们实测对得上的阶梯:
- 默认
deepseek/deepseek-v4-flash。 文本进、文本出、量大,输出便宜 21.4 倍。 - 请求里带图片或视频帧时升级到
bailian/qwen3.8-max。 这不是质量判断,是能力检查,可以做成对 content type 的一行分支。 - 输出必须匹配固定形状时升级。 先用 schema 校验 DeepSeek 的返回,校验失败再用 Qwen 重试。按我们实测的 345 倍成本比,你完全负担得起「校验加重试」,而不必把所有请求都送去贵的那个。
- 按重复失败升级,而不是按预判难度升级。 两次 DeepSeek 加一次 Qwen,仍然只是全量走 Qwen 的零头,而且能让你拿到「这 3 分到底多久才咬你一次」的真实数据。
最后这条值得认真对待。index 差距是一个总体统计量,你的流量不是总体,唯一能查明这 3 分在哪里生效的办法,是让便宜的模型先试、然后记账。
什么时候该选 Qwen 3.8 Max?
当活是视觉类的,或者当最后这 3 分决定输出能不能用的时候。 这两种情况撑得住 21 倍的输出价。
- 请求里随时可能出现图片或视频帧的管线。
- 固定 schema 的生成。我们那次实测它给出了要求的全部 40 行,DeepSeek 给了 29 行还跑出了范围。
- 低量的高难推理,账单小到 25 美元乘以 15 倍对谁都不算一个真实数字。
- 需要联网搜索、否则你要自己搭一层检索的场景。
它的短板:输出 token 是 19.7 倍、我们这批任务的墙钟是 6 倍、单次输出上限 131K,而且 Artificial Analysis 没有它的模型页,所以你查不到它的「每分花多少钱」。发布细节、开源状态和完整规格见 Qwen 3.8 Max 发布拆解。
什么时候该选 DeepSeek V4 Flash?
当活是文本进、文本出,而且量是真的大的时候。 index 落后 3 分,输出便宜 21.4 倍,我们的实测里端到端快 6 倍,而且它的缓存命中价是 Artificial Analysis 目前排到第一的。
- 批量分类、抽取、摘要、打标。
- 带稳定 system prompt 和仓库前缀的编码 agent,靠的是 $0.0028 的缓存读。
- 需要单次长输出的场景,384K 上限管用。
- 任何你宁可把差价花在「多试几次」而不是「换个更好的模型」上的场景。在这个价位上,同一个任务跑十遍还比 Qwen 一次调用便宜。
它的短板:不能读图,而且对严格输出规格抓得没那么牢。校验返回的形状,别直接信任它。接入方式和参数细节见 DeepSeek V4 API 使用指南,跟 Gemini 3.6 Flash 的同分对比见 DeepSeek V4 Flash 对比 Gemini 3.6 Flash。
什么时候两个都不该选?
当你需要 index 顶端,或者当你优化的是每分成本而不是每 token 成本的时候。
- 第一梯队推理。 Kimi K3 在同一套 index 上是 57 分,Qwen 是 53,这个差距值多少钱,Qwen 3.7 Max 对比 Kimi K3 与 DeepSeek V4 里按 Artificial Analysis 自己跑 index 的实际花费算过。
- 要宽松许可的开源权重。 DeepSeek V4 Flash 在 Arena 榜上标的是 MIT;Qwen 3.8 Max 的 API 是闭源,开源权重已宣布但截至 2026-08-04 未发布。
- 同分但更便宜的模型。 Gemini 3.6 Flash 在这套 index 上同样是 50 分,那场对比里的 token 数量陷阱在上一节的链接里讲过。
用 ofox 同时跑两个:只改一个字符串
两个模型都在同一把 ofox key 后面、走同一个 OpenAI 兼容端点。实时价格看模型页:bailian/qwen3.8-max 和 deepseek/deepseek-v4-flash。
Python:同一个 prompt,两个模型,打印用量
import os, time
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.io/v1", api_key=os.environ["OFOX_API_KEY"])
MODELS = ["bailian/qwen3.8-max", "deepseek/deepseek-v4-flash"]
PRICES = {"bailian/qwen3.8-max": (2.00, 6.00), "deepseek/deepseek-v4-flash": (0.14, 0.28)}
PROMPT = "Rewrite this changelog as 5 release-note bullets:\n\n" + open("CHANGELOG.md").read()
for model in MODELS:
t0 = time.time()
r = client.chat.completions.create(model=model, messages=[{"role": "user", "content": PROMPT}])
pin, pout = PRICES[model]
cost = r.usage.prompt_tokens / 1e6 * pin + r.usage.completion_tokens / 1e6 * pout
print(f"{model:<28} out={r.usage.completion_tokens:<6} {time.time()-t0:5.1f}s ${cost:.6f}")
打印成本,别只打印答案。rate card 是每 token 的数字,你的发票是每任务的数字,而在我们这三个任务上,这两者差了五倍。
Node:同样的形状
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.ofox.io/v1",
apiKey: process.env.OFOX_API_KEY,
});
for (const model of ["bailian/qwen3.8-max", "deepseek/deepseek-v4-flash"]) {
const r = await client.chat.completions.create({
model,
messages: [{ role: "user", content: "Summarize this incident report in 5 bullets:\n" + report }],
});
console.log(model, r.usage.completion_tokens, r.choices[0].message.content.slice(0, 200));
}
只有 Qwen 能跑:发一张截图
把 model 换成 deepseek/deepseek-v4-flash,这个请求会在 content type 上直接失败——这是最快看清能力线的办法。
import base64, os
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.io/v1", api_key=os.environ["OFOX_API_KEY"])
img = base64.b64encode(open("dashboard.png", "rb").read()).decode()
r = client.chat.completions.create(
model="bailian/qwen3.8-max",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Which number on this dashboard contradicts the chart above it?"},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{img}"}},
],
}],
)
print(r.choices[0].message.content)
常见问题
3 分 index 是真实差距吗? 是,但它活在困难长尾里。我们这三个日常任务上两个模型都做对了,差距没有表现为对错。它该在你本来就不会交给便宜模型的问题上生效。
分数这么接近,DeepSeek 为什么便宜这么多? 体量。284B 总参数、每 token 激活 13B,对 2.4T 和 95B。服务 13B 激活参数的成本是服务 95B 的零头,而 DeepSeek 把这份差价让了出来,没有按分数定价。
Qwen 3.8 Max 开源权重了吗? 截至 2026-08-04 还没有。阿里在发布时宣布了 Max 档要开源,但没给许可证也没给日期。DeepSeek V4 Flash 在 Arena 榜上已经标为 MIT。
agent 循环里默认该用哪个? DeepSeek V4 Flash,除非那个循环会收到图片。前缀稳定之后,缓存读价($0.0028 对 $0.25)比任何别的数字都更能决定账单,而且你负担得起「失败了再重试」而不是「提前预防失败」。
本次核查过的来源
- 我们自己的 A/B 实测,2026-08-04:三个 prompt(收据抽 JSON、修
median()、40 行 CSV),每个模型每题一次调用,走https://api.ofox.io/v1/chat/completions,默认参数、无 system prompt。token 数取自 APIusage对象;两个 median 函数都实际执行过四组用例才判定正确。 - ofox 模型目录页,2026-08-04 读取:https://ofox.io/zh/models/bailian/qwen3.8-max · https://ofox.io/zh/models/deepseek/deepseek-v4-flash
- Arena 文本榜 与 Arena WebDev 榜,2026-08-04 读取
- LiveBench,LiveBench-2026-06-25 版,2026-08-04 读取:DeepSeek V4 Flash 0731 74.2,无 Qwen 3.8 条目
- Artificial Analysis Intelligence Index v4.1 图表,2026-08-04 读取。Qwen 3.8 Max 没有 Artificial Analysis 模型页,它的 53 分只出现在 index 图表里。交叉核对了确实存在的模型页:https://artificialanalysis.ai/models/deepseek-v4-flash
- Qwen 3.8 Max 发布博客,用于参数量与开源状态
常见问题
- Qwen 3.8 Max 比 DeepSeek V4 Flash 更强吗?
- 在可测量的质量上是,但优势很窄。Artificial Analysis Intelligence Index v4.1 给 Qwen 3.8 Max 53 分、DeepSeek V4 Flash 0731 50 分;Arena 文本榜上 Qwen 领先 60 分(1496 对 1436)。差距真实存在,但这是本文里最贵的 3 分。
- Qwen 3.8 Max 比 DeepSeek V4 Flash 贵多少?
- 按 ofox 目录价,输入贵 14.3 倍($2.00 对 $0.14 每百万),输出贵 21.4 倍($6.00 对 $0.28)。缓存读差 89 倍($0.25 对 $0.0028,DeepSeek provider 行)。而 2026-08-04 我们实跑的三个任务里,账单差距是 345 倍——因为 Qwen 还多吐了 19.7 倍的输出 token。
- 两个模型在 ofox 上的 model ID 是什么?
- bailian/qwen3.8-max 和 deepseek/deepseek-v4-flash。两个共用一把 key、同一个 OpenAI 兼容端点,也都支持 Anthropic 协议,所以做正面对比只需要改一个字符串。
- 两个模型谁更大?
- Qwen 3.8 Max 大 8.5 倍:2.4T 总参数、每 token 激活 95B;DeepSeek V4 Flash 是 284B 总参数、激活 13B。用这么大的参数差只换来 3 分 index 差,正是 DeepSeek 的参数效率成为话题、而不是 Qwen 的分数成为话题的原因。
- DeepSeek V4 Flash 能读图吗?
- 不能。ofox 目录里它只列了 Function Calling 和 Prompt Caching。Qwen 3.8 Max 列的是 Vision、Video Input、Web Search、Function Calling、Reasoning 和 Prompt Caching。任何要发截图、扫描件或视频帧的管线,这里只有一个选项。
- 谁的单次输出上限更高?
- DeepSeek V4 Flash,384K 对 Qwen 3.8 Max 的 131K,便宜的那个反而高 2.9 倍。两者在 ofox 上都是 1M 上下文。
- Qwen 3.8 Max 上 LiveBench 或 AA 模型页了吗?
- 还没有。LiveBench 2026-06-25 版没有 Qwen 3.8 条目,Artificial Analysis 也没给它建模型页,所以跑完 index 的花费、verbosity、输出速度这些数字对它都不存在。它的 53 分只出现在 Intelligence Index 图表里。


