Qwen 3.8 Max 对比 DeepSeek V4 Flash:差 3 分,账单差 345 倍

Qwen 3.8 Max 在 AA Intelligence Index 拿 53 分,DeepSeek V4 Flash 0731 拿 50 分。但实测三个任务,前者贵 345 倍、慢 6 倍。这 3 分什么时候值得付。

Qwen 3.8 Max 对比 DeepSeek V4 Flash:差 3 分,账单差 345 倍

先给结论,字段可直接抄走:

AA Intelligence Index v4.1: Qwen 3.8 Max 53 · DeepSeek V4 Flash 0731 50
Arena 文本榜 Elo:          1496 ±10 对 1436 ±4(Qwen 领先 60)
参数:                      2.4T / 激活 95B 对 284B / 激活 13B(8.5 倍)
ofox 每百万 token 价:      $2.00 / $6.00 对 $0.14 / $0.28(14.3 倍、21.4 倍)
实测三任务:                $0.052328 对 $0.000151(345 倍),181 秒对 30 秒(6 倍)
只有一个能看图:            Qwen 3.8 Max(图片 + 视频 + 联网搜索)
单次输出上限更高:          DeepSeek V4 Flash,384K 对 131K
ofox model ID:             bailian/qwen3.8-max · deepseek/deepseek-v4-flash
快照日期:                  2026-08-04

r/DeepSeek 昨天在吵一张图:这两个模型在 Artificial Analysis Intelligence Index 上只差 3 分,而其中一个的参数是另一个的 8.5 倍。帖子标题写的是「性能相近」,最高赞评论直接否掉了这个说法——3 分不是噪声,他们是对的。但那个帖子里没人算另一半账。我们把两个模型放在同一个网关上跑了同样三个任务,这 3 分的代价是 345 倍。

摘要:你该选哪个?

你的处境理由
大批量文本处理,成本是硬约束DeepSeek V4 Flash输出便宜 21.4 倍,index 只落后 3 分
任何涉及截图、扫描件、视频的活Qwen 3.8 Max有图片、视频输入和联网搜索;DeepSeek 是纯文本
最难的推理,3 分能决定成败Qwen 3.8 MaxAA 53 对 50,Arena 文本榜领先 60 分
单次要吐很长的内容DeepSeek V4 Flash输出上限 384K 对 131K
对延迟敏感的交互产品DeepSeek V4 Flash三个任务合计 30 秒对 181 秒
输出必须严格对齐格式或行数Qwen 3.8 Max要 40 行就给 40 行;DeepSeek 只给了 29 行
带大段缓存前缀的 agent 循环DeepSeek V4 Flash缓存读 $0.0028 对 $0.25,差 89 倍
想用最便宜的方式够到第一梯队都不选,见下文Kimi K3 57 分、GLM-5.2 51 分

规格对照

价格是 2026-08-04 从 ofox 模型页实抓的。参数量取自各家自己的发布材料。

规格Qwen 3.8 MaxDeepSeek V4 Flash 0731
ofox model IDbailian/qwen3.8-maxdeepseek/deepseek-v4-flash
输入 / 每百万$2.00$0.14
输出 / 每百万$6.00$0.28
缓存读 / 每百万$0.25$0.0028(DeepSeek provider 行)
缓存写 / 每百万$2.50$0.175(BaiLian provider 行)
总参数2.4T284B
每 token 激活95B13B
上下文窗口1M1M
单次输出上限131K384K
图片输入支持不支持
视频输入支持不支持
联网搜索支持不支持
协议OpenAI + AnthropicOpenAI + Anthropic
发布日期2026-08-032026-07-31

有两行几乎决定了整个选择。Qwen 是唯一能看图的那个,而 DeepSeek 单次能吐出 2.9 倍的 token。其余都归结为一个问题:3 分 index 对你值多少钱。

第三方评测里谁更高?

Qwen 3.8 Max,在每一个同时收录两者的来源上都领先。 但差距一致地小。

来源(快照 2026-08-04)Qwen 3.8 MaxDeepSeek V4 Flash 0731
AA Intelligence Index v4.15350
Arena 文本榜 Elo1496 ±101436 ±4
Arena WebDev 榜 Elo1668 +18/-181577(flash-high)
Arena Vision 榜 Elo1305 ±9纯文本,不参与
LiveBench 2026-06-25未收录74.2

用这些数字之前,先看清它们的来源层级。

  • AA 那个 53 是本文来源最弱的一个数字,我们选择标出来而不是藏起来。 Artificial Analysis 没有给 Qwen 3.8 Max 建模型页:这个分数只存在于 Intelligence Index 图表控件里,所以通常能拿到的逐模型数据(跑完 index 的花费、verbosity、输出速度)对它都不存在。同一套 index 的参照系:Kimi K3 57、GLM-5.2 51、Gemini 3.6 Flash 50、DeepSeek V4 Pro 44、Qwen 3.7 Max 46。
  • Arena 的数字是我们直接从榜上读的。 那里的 Elo 每天滚动更新,所以排序是耐用的部分,具体数值只是快照。60 分的差距配上 ±10 和 ±4 的区间,是真实领先。
  • LiveBench 根本没测过 Qwen 3.8 Max。 它给 DeepSeek V4 Flash 0731 打 74.2 分,而四月版是 65.5——这是七月那次重训带来了什么的最清楚证据。

引发那个 Reddit 帖子的参数效率论点,算术上是成立的:284B 总参数打到 2.4T 模型的 3 分以内,每 token 激活 13B 对 95B。这件事对你重不重要,取决于你是在买权重还是在买 token。如果你买的是 token,参数量是厂商的问题,价格才是你的问题。

三个真实任务实测下来如何?

两个模型都做对了活,但账单不在一个量级。 2026-08-04,我们通过 api.ofox.ai/v1/chat/completions 发了三个 prompt,默认参数、无 system prompt,token 数取自 API 返回的 usage 对象。

任务Qwen 3.8 MaxDeepSeek V4 Flash 0731
收据抽成 JSON1,332 输出,26.0 秒,正确133 输出,13.6 秒,正确
修一个有 bug 的 median()3,385 输出,73.2 秒,用例通过67 输出,6.6 秒,用例通过
HTTP 400-439 的 40 行 CSV3,881 输出,82.1 秒,40 行236 输出,10.1 秒,29 行
输出 token 合计8,598(19.7 倍)436
墙钟时间合计181.3 秒(6.0 倍)30.3 秒
三题总成本$0.052328(345 倍$0.000151

三条观察比总数更有用。

  • 推理上两边都没错。 收据那题给出的 JSON 完全一致,逐行算术都对。两边都返回了能处理偶数长度的 median,我们把函数拿去实际执行、跑了四组用例才判定正确。3 分 index 差在这种体量的活上没有表现为对错差异——这本来就该如此:benchmark 的差距活在困难长尾里,不在日常任务里。
  • 严格格式那题 Qwen 完胜。 要求给出覆盖 400 到 439 的 40 行,Qwen 正好给了 40 行,未分配的状态码用占位说明补齐。DeepSeek 给了 29 行,悄悄跳过所有未分配码,然后跑到范围外去加了个 451。如果下游解析器期待固定形状,这是正确性问题,不是风格偏好。
  • 延迟是被啰嗦度放大的,6 倍不是吞吐量断言。 我们这个数是三次调用的端到端墙钟时间,驱动它的是 token 数量而不是速度:Qwen 多吐了 19.7 倍输出。每秒吞吐是另一种测量,而且这场对比里只有一边有。Artificial Analysis 给 DeepSeek V4 Flash 0731 标 122.7 输出 token/秒(该视图第 8/101 名,2026-08-04 读取),对 Qwen 3.8 Max 则没有吞吐数据,因为它没有模型页。所以 6 倍要理解成「这批活早六倍干完」,而不是「这个模型每 token 快六倍」。对批处理这是成本项,对交互产品这是产品决策。

三个 prompt 是样本,不是研究。三题方向一致,而验证它在你的活上成不成立,最便宜的办法是文末那段循环代码。

写代码用哪个更好?

看榜是 Qwen 3.8 Max,看账单是 DeepSeek V4 Flash。 Arena 的 WebDev 榜由人类并排比较生成的前端代码,qwen3.8-max 1668(+18/-18),deepseek-v4-flash-high 1577。这 91 分的差距比通用文本榜上的 60 分更宽,说明 Qwen 多出来的参数确实有一部分花在了前端生成上。

给这个 1668 一点参照:同一张榜上 kimi-k3-max 是 1676、claude-opus-5-high 是 1669,三者置信区间互相重叠。Qwen 3.8 Max 在这项任务上确实进了第一梯队,而 $2 的输入价通常买不到这个位置。

我们自己那道编码题没有复现出这个差距,这件事本身是有信息量的,不是矛盾。两个模型都在第一次尝试就正确修好了偶数长度的 median bug,而那个修法一共六行。日常修补分不出 53 和 50。分得出的是长尾:不熟悉的框架、含糊的需求、要跨文件保持一致的重构。如果你的编码工作大部分是日常那种,你在为一个不会显形的差异付 21 倍;如果大部分是困难那种,WebDev 榜说明这钱花出去有响声。

0731 那次重训到底改了什么?

它把 DeepSeek V4 Flash 从明显落后拉到只差 3 分。 model ID 没变,架构没变,价格也没变,变的是权重。

LiveBench 把两个版本分开打分,差值一目了然:

LiveBench 2026-06-25总平均分
DeepSeek V4 Flash 073174.2
DeepSeek V4 Pro71.6
DeepSeek V4 Flash(四月版)65.5

同一套评测涨了 8.7 分,而且把便宜档拉过了 DeepSeek 自家旗舰。在 Artificial Analysis 的 index 上同样的倒挂也成立:V4 Flash 0731 是 50,V4 Pro 是 44。

两个现实后果:

  • ofox 上的条目已经指向 0731。 deepseek/deepseek-v4-flash 的目录页写的发布日期是 2026-07-31,所以你不用加日期后缀就拿到重训后的权重。任何八月之前写的关于 V4 Flash 的内容,描述的是一个实质上更弱的模型。
  • 六月写的对比是过期,不是错。 六月那种「Qwen 大幅领先」的判断在当时是准确的。今天还剩下的差距是 3 分 index,本文说的就是这 3 分。

两个模型都能走 Anthropic 协议吗?

都能,POST https://api.ofox.io/anthropic/v1/messages 两个都有响应。 2026-08-04 我们给两边发了同一句只要一个词的指令:

curl https://api.ofox.io/anthropic/v1/messages \
  -H "x-api-key: $OFOX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"bailian/qwen3.8-max","max_tokens":64,
       "messages":[{"role":"user","content":"Reply with exactly: ok"}]}'

两边都回了 ok。但 usage 对象对不上:Qwen 3.8 Max 报的是 98 输入、27 输出,DeepSeek V4 Flash 报的是 15 输入、2 输出。同一个两字母答案,输出 token 差 13 倍、输入 token 差 6.5 倍——这还没乘上 21.4 倍的单价差。

如果你的团队跑的是 Anthropic 形状的工具链、又想在后面接一个更便宜的模型,这件事就有意义:请求结构不变,响应里照样返回 cache_creation_input_tokenscache_read_input_tokens,动的只有 model 字符串。

每月账单各是多少?

15 倍到 82 倍之间,取决于你按 rate card 算还是按实际吐回来的 token 算。 下面两个场景都用 ofox 目录价、每月按 30 天。这是对公开价格做的算术,不是发票。

场景 A,按 rate card 算。 每天 500 万输入 token、50 万输出 token,不走缓存。

模型每天每月相对 DeepSeek
DeepSeek V4 Flash$0.84$25.20基准
Qwen 3.8 Max$13.00$390.0015.5 倍

场景 B,同样的活,按我们实测的 token 比例算。 Qwen 吐出 19.7 倍的输出,所以它那 50 万变成每天 985 万,而 DeepSeek 还是 50 万。

模型每天每月相对 DeepSeek
DeepSeek V4 Flash$0.84$25.20基准
Qwen 3.8 Max,实测比例$69.10$2,073.0082 倍

同一批活的每月账单同一批活:每天 500 万输入 + 50 万输出按 ofox 目录价的每月账单,2026-08-04$25DeepSeek V4 Flash$390Qwen 3.8 Max按目录价$2,073Qwen 3.8 Max实测 19.7 倍 token三题共 436 token

一旦把两边实际吐回来的量算进去,rate card 把差距少算了五倍。

缓存这一行需要一个说明,因为 ofox 给 DeepSeek V4 Flash 列了三个 provider,而它们的缓存定价并不一样:

ofox 上的 provider 行输入 / 输出缓存读
DeepSeek$0.14 / $0.28$0.0028
BaiLian(阿里云)$0.14 / $0.28$0.028
Azure$0.19 / $0.51$0.19

相对 Qwen 的 $0.25 便宜 89 倍这个说法,只在 DeepSeek 行成立——Artificial Analysis 的缓存命中价榜也是按这一行给的 $0.003/百万。落到 BaiLian 行,同样的比较是 8.9 倍,仍然是大差距,但小了一个数量级。在拿最低那个数字做预算之前,先确认你的流量会落到哪个 provider。

Qwen 3.8 Max 能做而 DeepSeek V4 Flash 做不了的是什么?

看。 ofox 目录给 bailian/qwen3.8-max 列的是 Vision、Video Input 和 Web Search,给 deepseek/deepseek-v4-flash 列的是 Function Calling 和 Prompt Caching。这是能力线,价格优势再大也跨不过去。

会撞上这堵墙的活:

  • 截图分诊、UI 走查,以及任何要检查自己渲染结果的 agent
  • 扫描件、票据、表单,任何以照片形式到达的东西
  • 视频关键帧打标,这需要视频输入这条路径
  • 图表和示意图,数字只存在于图里
  • 幻灯片、看板、文档排版类工作——阿里的发布演示重点就在这里

那个 Reddit 帖子里有条评论把这一点讲得最锋利:带图片输入的模型可以写一个 UI、截图、再检查自己的成果。纯文本模型在任何价位都进不了这个循环。

反方向的差距更窄但真实存在。DeepSeek 的 384K 输出上限对 Qwen 的 131K 是 2.9 倍,它决定一份长翻译、一整套测试、一次大规模结构化抽取能不能一次返回,还是逼你去写分块逻辑。

r/DeepSeek 到底在吵什么?

那个帖子自己否掉了自己的标题,而被否掉的过程才是有用的部分。 帖子把 53 对 50 加上 8.5 倍参数量框成了「性能相近」。得票最高的两条回复是「这不叫性能相近」和「3 分是个大差距」,从数字上看都对。

那个帖子里有三个论点值得带进决策,因为它们覆盖了榜单覆盖不到的地方。

  • 办公文档缺口。 有评论指出四月版 DeepSeek V4 Flash 在 AA briefcase 这项评测上表现很差——这项测的是表格、文档、幻灯片和 PDF 上的工作——而七月重训版还没有被测过。阿里给 3.8 Max 做的发布演示大量集中在幻灯片、看板和分析型排版上。如果你的负载是办公形状的,通用 index 分数就是错的量具,而这件事目前两个模型都没有能定论的公开数字。
  • 自我检查循环。 带图片输入的模型可以生成 UI、截图、检查自己的输出。DeepSeek V4 Flash 完全进不了这个循环,这是结构差异,不是质量差异。
  • 效率论点是双向的。 284B 总参数落在 2.4T 模型 3 分以内,是实打实的工程成果。但除非你在自托管,它跟你的账单无关:走 API 你买的是 token 不是参数,而把这份效率换成你的省钱的,是 DeepSeek 的定价。

那个帖子里没人算的,正是我们量出来的东西:同样三个任务,成本差 345 倍、墙钟差 6 倍。参数效率是他们争的题,token 效率才是改变预算的那个数。

两个之间怎么路由?

默认走便宜的,用一句话能说清的规则做升级。 两个模型在同一个端点后面,所以路由决策落在你自己的代码里,而不是第二套集成。

一条和我们实测对得上的阶梯:

  • 默认 deepseek/deepseek-v4-flash 文本进、文本出、量大,输出便宜 21.4 倍。
  • 请求里带图片或视频帧时升级到 bailian/qwen3.8-max 这不是质量判断,是能力检查,可以做成对 content type 的一行分支。
  • 输出必须匹配固定形状时升级。 先用 schema 校验 DeepSeek 的返回,校验失败再用 Qwen 重试。按我们实测的 345 倍成本比,你完全负担得起「校验加重试」,而不必把所有请求都送去贵的那个。
  • 按重复失败升级,而不是按预判难度升级。 两次 DeepSeek 加一次 Qwen,仍然只是全量走 Qwen 的零头,而且能让你拿到「这 3 分到底多久才咬你一次」的真实数据。

最后这条值得认真对待。index 差距是一个总体统计量,你的流量不是总体,唯一能查明这 3 分在哪里生效的办法,是让便宜的模型先试、然后记账。

什么时候该选 Qwen 3.8 Max?

当活是视觉类的,或者当最后这 3 分决定输出能不能用的时候。 这两种情况撑得住 21 倍的输出价。

  • 请求里随时可能出现图片或视频帧的管线。
  • 固定 schema 的生成。我们那次实测它给出了要求的全部 40 行,DeepSeek 给了 29 行还跑出了范围。
  • 低量的高难推理,账单小到 25 美元乘以 15 倍对谁都不算一个真实数字。
  • 需要联网搜索、否则你要自己搭一层检索的场景。

它的短板:输出 token 是 19.7 倍、我们这批任务的墙钟是 6 倍、单次输出上限 131K,而且 Artificial Analysis 没有它的模型页,所以你查不到它的「每分花多少钱」。发布细节、开源状态和完整规格见 Qwen 3.8 Max 发布拆解

什么时候该选 DeepSeek V4 Flash?

当活是文本进、文本出,而且量是真的大的时候。 index 落后 3 分,输出便宜 21.4 倍,我们的实测里端到端快 6 倍,而且它的缓存命中价是 Artificial Analysis 目前排到第一的。

  • 批量分类、抽取、摘要、打标。
  • 带稳定 system prompt 和仓库前缀的编码 agent,靠的是 $0.0028 的缓存读。
  • 需要单次长输出的场景,384K 上限管用。
  • 任何你宁可把差价花在「多试几次」而不是「换个更好的模型」上的场景。在这个价位上,同一个任务跑十遍还比 Qwen 一次调用便宜。

它的短板:不能读图,而且对严格输出规格抓得没那么牢。校验返回的形状,别直接信任它。接入方式和参数细节见 DeepSeek V4 API 使用指南,跟 Gemini 3.6 Flash 的同分对比见 DeepSeek V4 Flash 对比 Gemini 3.6 Flash

什么时候两个都不该选?

当你需要 index 顶端,或者当你优化的是每分成本而不是每 token 成本的时候。

  • 第一梯队推理。 Kimi K3 在同一套 index 上是 57 分,Qwen 是 53,这个差距值多少钱,Qwen 3.7 Max 对比 Kimi K3 与 DeepSeek V4 里按 Artificial Analysis 自己跑 index 的实际花费算过。
  • 要宽松许可的开源权重。 DeepSeek V4 Flash 在 Arena 榜上标的是 MIT;Qwen 3.8 Max 的 API 是闭源,开源权重已宣布但截至 2026-08-04 未发布。
  • 同分但更便宜的模型。 Gemini 3.6 Flash 在这套 index 上同样是 50 分,那场对比里的 token 数量陷阱在上一节的链接里讲过。

用 ofox 同时跑两个:只改一个字符串

两个模型都在同一把 ofox key 后面、走同一个 OpenAI 兼容端点。实时价格看模型页:bailian/qwen3.8-maxdeepseek/deepseek-v4-flash

Python:同一个 prompt,两个模型,打印用量

import os, time
from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key=os.environ["OFOX_API_KEY"])

MODELS = ["bailian/qwen3.8-max", "deepseek/deepseek-v4-flash"]
PRICES = {"bailian/qwen3.8-max": (2.00, 6.00), "deepseek/deepseek-v4-flash": (0.14, 0.28)}
PROMPT = "Rewrite this changelog as 5 release-note bullets:\n\n" + open("CHANGELOG.md").read()

for model in MODELS:
    t0 = time.time()
    r = client.chat.completions.create(model=model, messages=[{"role": "user", "content": PROMPT}])
    pin, pout = PRICES[model]
    cost = r.usage.prompt_tokens / 1e6 * pin + r.usage.completion_tokens / 1e6 * pout
    print(f"{model:<28} out={r.usage.completion_tokens:<6} {time.time()-t0:5.1f}s  ${cost:.6f}")

打印成本,别只打印答案。rate card 是每 token 的数字,你的发票是每任务的数字,而在我们这三个任务上,这两者差了五倍。

Node:同样的形状

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.ofox.io/v1",
  apiKey: process.env.OFOX_API_KEY,
});

for (const model of ["bailian/qwen3.8-max", "deepseek/deepseek-v4-flash"]) {
  const r = await client.chat.completions.create({
    model,
    messages: [{ role: "user", content: "Summarize this incident report in 5 bullets:\n" + report }],
  });
  console.log(model, r.usage.completion_tokens, r.choices[0].message.content.slice(0, 200));
}

只有 Qwen 能跑:发一张截图

把 model 换成 deepseek/deepseek-v4-flash,这个请求会在 content type 上直接失败——这是最快看清能力线的办法。

import base64, os
from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key=os.environ["OFOX_API_KEY"])
img = base64.b64encode(open("dashboard.png", "rb").read()).decode()

r = client.chat.completions.create(
    model="bailian/qwen3.8-max",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Which number on this dashboard contradicts the chart above it?"},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{img}"}},
        ],
    }],
)
print(r.choices[0].message.content)

常见问题

3 分 index 是真实差距吗? 是,但它活在困难长尾里。我们这三个日常任务上两个模型都做对了,差距没有表现为对错。它该在你本来就不会交给便宜模型的问题上生效。

分数这么接近,DeepSeek 为什么便宜这么多? 体量。284B 总参数、每 token 激活 13B,对 2.4T 和 95B。服务 13B 激活参数的成本是服务 95B 的零头,而 DeepSeek 把这份差价让了出来,没有按分数定价。

Qwen 3.8 Max 开源权重了吗? 截至 2026-08-04 还没有。阿里在发布时宣布了 Max 档要开源,但没给许可证也没给日期。DeepSeek V4 Flash 在 Arena 榜上已经标为 MIT。

agent 循环里默认该用哪个? DeepSeek V4 Flash,除非那个循环会收到图片。前缀稳定之后,缓存读价($0.0028 对 $0.25)比任何别的数字都更能决定账单,而且你负担得起「失败了再重试」而不是「提前预防失败」。

本次核查过的来源

常见问题

Qwen 3.8 Max 比 DeepSeek V4 Flash 更强吗?
在可测量的质量上是,但优势很窄。Artificial Analysis Intelligence Index v4.1 给 Qwen 3.8 Max 53 分、DeepSeek V4 Flash 0731 50 分;Arena 文本榜上 Qwen 领先 60 分(1496 对 1436)。差距真实存在,但这是本文里最贵的 3 分。
Qwen 3.8 Max 比 DeepSeek V4 Flash 贵多少?
按 ofox 目录价,输入贵 14.3 倍($2.00 对 $0.14 每百万),输出贵 21.4 倍($6.00 对 $0.28)。缓存读差 89 倍($0.25 对 $0.0028,DeepSeek provider 行)。而 2026-08-04 我们实跑的三个任务里,账单差距是 345 倍——因为 Qwen 还多吐了 19.7 倍的输出 token。
两个模型在 ofox 上的 model ID 是什么?
bailian/qwen3.8-max 和 deepseek/deepseek-v4-flash。两个共用一把 key、同一个 OpenAI 兼容端点,也都支持 Anthropic 协议,所以做正面对比只需要改一个字符串。
两个模型谁更大?
Qwen 3.8 Max 大 8.5 倍:2.4T 总参数、每 token 激活 95B;DeepSeek V4 Flash 是 284B 总参数、激活 13B。用这么大的参数差只换来 3 分 index 差,正是 DeepSeek 的参数效率成为话题、而不是 Qwen 的分数成为话题的原因。
DeepSeek V4 Flash 能读图吗?
不能。ofox 目录里它只列了 Function Calling 和 Prompt Caching。Qwen 3.8 Max 列的是 Vision、Video Input、Web Search、Function Calling、Reasoning 和 Prompt Caching。任何要发截图、扫描件或视频帧的管线,这里只有一个选项。
谁的单次输出上限更高?
DeepSeek V4 Flash,384K 对 Qwen 3.8 Max 的 131K,便宜的那个反而高 2.9 倍。两者在 ofox 上都是 1M 上下文。
Qwen 3.8 Max 上 LiveBench 或 AA 模型页了吗?
还没有。LiveBench 2026-06-25 版没有 Qwen 3.8 条目,Artificial Analysis 也没给它建模型页,所以跑完 index 的花费、verbosity、输出速度这些数字对它都不存在。它的 53 分只出现在 Intelligence Index 图表里。