DeepSeek V4 Pro 0813 上线:价格、开源权重与跑分实测(2026)

V4 Pro 0813 在 Artificial Analysis 拿 53 分,每任务 $0.06,比同分模型便宜 5 倍。MIT 权重已公开,8 月 16 日起改峰谷计价。

DeepSeek V4 Pro 0813 上线:价格、开源权重与跑分实测(2026)

DeepSeek 在 2026-08-13 发布了 DeepSeek-V4-Pro-0813,三天之后用它的价格就要涨。 正式版的价格和预览版一模一样。从 2026-08-16 16:00 UTC 起,整个 V4 系列改为峰谷两档计价,而新价目表的每一档都高于今天。

发布:       2026-08-13 正式版;先是文档脚注,当天才补更新日志
模型 ID:    deepseek-v4-pro(未变,没有 0813 后缀)
现价:       每百万 $0.435 输入 / $0.87 输出;缓存命中 $0.003625
08-16 起:   谷时 $0.66 / $1.98;峰时 $1.32 / $3.96
开源权重:   2026-08-13 公开,MIT,66 个 fp8 分片,无需申请
上下文:     输入 1M,最大输出 384K
thinking:   默认开启,effort 三档 low / high / max
智能指数:   AA 指数 53 分,比预览版高 8 分
每任务成本: $0.06,同为 53 分的模型里最便宜
托管方:     3 家(DeepSeek,另有 Cloudflare 与 GMICloud,贵 3 到 4 倍)

DeepSeek V4 Pro 0813 是什么?

它是 DeepSeek 旗舰模型的正式版,在同一个模型 ID 背后顶替了 4 月的预览版。 官方价格页给的规格是 1.6T 总参数、49B 激活,混合专家架构,纯文本。

调用方式没有任何变化。你发 deepseek-v4-pro,拿到的就是 0813 版。DeepSeek 自己的 API 上并不存在 deepseek-v4-pro-0813 这个模型名,两周前 Flash 发布时也是同一套做法。

在 ofox 上这个模型是 deepseek/deepseek-v4-pro

DeepSeek V4 Pro 0813 什么时候发布的?

2026-08-13,分两步。 最早的迹象是快速开始页和价格页上多了一行脚注,说 deepseek-v4-pro 已更新到 DeepSeek-V4-Pro-0813。那一整天里,这行脚注就是全部公告。

更新日志条目当天晚些时候才跟上,而这一条才是该读的:它把这次称作 V4 Pro 在 App、网页端和 API 上的正式发布,列了十项跑分,公布了下面要讲的价格调整,并且写明了三档 thinking effort。它也是 2026-07-31 那条 Flash 条目的下文,那条里写着「DeepSeek-V4-Pro 的正式版随后发布」。

DeepSeek 的发布推文当天晚上才出,里面有一个文档里没有的细节:在消费端 App 和网页客户端上,正式版不是默认模型,它在 Expert Mode 后面。如果你拿 App 的回答去对比 API 的回答,这个开关决定了你测的到底是 0813 还是 App 默认给的那个。

真正的经验教训与 DeepSeek 无关,而是关于怎么盯发布。厂商的模型可以在 API 上先活几个小时,你盯的那个页面才说话,所以只读更新日志的发布监测会慢,只读模型列表的又会错过挂在旁边的价格公告。

如果你会写脚本抓这些文档,还有一点值得知道:/news/ 路径是通配的。请求一个并不存在的 news URL,返回的是 HTTP 200 加快速开始页的正文,所以拿状态码判断会得出「某条并不存在的公告已上线」。

DeepSeek V4 Pro 0813 开源吗?

开源,2026-08-13 起。这里的时间点值得知道,因为发布当天的绝大多数报道都写于它成真之前。

  • deepseek-ai/DeepSeek-V4-Pro-0813 里有 66 个 fp8 safetensors 分片MIT 协议,无需申请权限,另有 config.json 和 DeepSeek 自家的编码工具。
  • 仓库日期戳是 2026-08-13,但我们当天上午(UTC)查的时候,它还没出现在该组织的公开模型列表里。到当天傍晚它就在了,大约是 API 正式发布之后半天。
  • 更早的 deepseek-ai/DeepSeek-V4-Pro 仓库最后修改于 2026-06-22,那是 4 月的预览版:64 个分片,同样是 MIT。别顺手拉错,两个名字只差一个后缀,两个版本差 8 个指数分。
  • unsloth/DeepSeek-V4-Pro-0813-GGUF 当天更早就占好了名字,里面只有一个 README。接下来往里填的会是各种量化版本。

由此有两点。Artificial Analysis 在还没有任何可访问仓库的时候,就给 0813 打上了「Open weights model」标签,这个标签不算错,只是早了半天,跟它在 Flash 0731 上的表现一样。另外,任何把 V4 Pro 0813 列为闭源权重的对比表,包括好几篇发布当天写的,描述的都是一个持续不到一天的窗口。

DeepSeek V4 Pro 多少钱?

2026-08-16 之前是每百万 token 缓存未命中 $0.435、输出 $0.87;之后改成峰谷两档,两档都比现在贵。

项目V4 ProV4 Flash
输入,缓存命中$0.003625$0.0028
输入,缓存未命中$0.435$0.14
输出$0.87$0.28
并发上限5002,500

真正决定账单的是缓存命中率,因为命中比未命中便宜 120 倍。这套算法我们在预览版上算过一遍,见 DeepSeek V4 Pro 真实成本,比例关系至今未变。

2026-08-16 会变什么?

DeepSeek 在 2026-08-06 挂出的那句含糊警告(「预计有显著上调」,没有幅度,没有日期)随正式发布变成了排期。从 2026-08-16 16:00 UTC 起,计费拆成峰时和谷时,谷时价为峰时的一半。峰时是 01:00 至 04:00 与 06:00 至 10:00 UTC,其余时间都算谷时。

每百万 token现价08-16 起谷时08-16 起峰时
V4 Pro,缓存命中$0.003625$0.022$0.044
V4 Pro,缓存未命中$0.435$0.66$1.32
V4 Pro,输出$0.87$1.98$3.96
V4 Flash,缓存命中$0.0028$0.007$0.014
V4 Flash,缓存未命中$0.14$0.22$0.44
V4 Flash,输出$0.28$0.66$1.32

这张表要看三件事。谷时不是相对现价的折扣,只是涨得少一点:V4 Pro 输出谷时涨 2.3 倍、峰时涨 4.6 倍。相对幅度最大的是缓存命中那一行,谷时就已经是 6 倍,而这恰好削的是大家把 DeepSeek 用便宜的主要杠杆。还有就是两个峰时窗口都不长而且卡得别扭,01:00 至 04:00 加 06:00 至 10:00 UTC 覆盖了中国大部分工作时间,所以这次到底算涨价还是小涨,主要取决于你的批量任务跑在哪个时段。

八分的提升和这次涨价出现在同一条更新日志里,这也是理解本次发布最诚实的角度:DeepSeek 在为提升收费,而不是自己吸收成本。16 号之后还有效的省钱杠杆,见涨价前省钱的六种方法

上下文窗口和最大输出是多少?

输入 100 万 token,最大输出 384K,两个 V4 模型相同。

这个输出上限高得反常。多数旗舰模型把输出卡在 64K 到 128K,所以单次 V4 Pro 调用真的能产出一本书那么长的回复。这也意味着 max_tokens 默认并不是安全网,Pro 上一次失控生成可以按每百万 $0.87 的价格烧掉 384,000 个输出 token 才停。

至于窗口具体被 system prompt、工具 schema 和推理 token 怎么吃掉,见什么是上下文窗口

V4 Pro 0813 跑分怎么样?

有两套数字,而且不能混用:DeepSeek 自己的 agentic 跑分,和 Artificial Analysis 的独立指数。后者上 V4 Pro 0813 是 53 分,预览版是 45 分。

DeepSeek 的更新日志条目为正式版公布了下面这些。它们是厂商自测,而且没有附方法学说明,这点值得直说,因为六周前 Flash 0731 那条是写了 harness 的(DeepSeek Harness minimal mode、max effort、top_p 0.95、temperature 1.0),这一条什么都没写。

基准V4 Pro 0813V4 Flash 0731
Terminal Bench 2.187.982.7
Cybergym83.376.7
Toolathlon-Verified74.170.3
DSBench-FullStack71.168.7
DSBench-Hard67.259.6
DeepSWE62.754.4
NL2Repo61.554.2
HLE,不带 / 带工具42.7 / 60.0未公布
AutomationBench(公开集)31.825.1
Agents’ Last Exam25.725.2

两列都出自 DeepSeek 自己的更新日志,所以列与列之间的对比在内部是自洽的,尽管两边都没有被独立复现过。十项里有两项是 DeepSeek 不公开的内部测试集,DSBench-FullStack 和 DSBench-Hard,这两行公司之外的任何人都无从核对。

独立读数看 Artificial Analysis。V4 Pro 0813 在完整榜单上的位置,指数版本 v4.1.1,快照 2026-08-13:

名次模型指数每任务成本
1Claude Opus 5(max)63$2.34
7Kimi K3(max)60$0.84
17DeepSeek V4 Pro 0813(max)53$0.06
18GPT-5.6 Terra(xhigh)53$0.31
19GLM-5.2(max)53$0.32
22DeepSeek V4 Flash 0731(max)52$0.03
36DeepSeek V4 Pro(4 月预览版,max)45$0.05

真正该看的是成本列,不是名次。三个模型并列 53 分,V4 Pro 0813 的每任务成本比另外两个便宜约 5 倍。

引用这个数字时有两点要当心:

  • AA 模型页上写的「#2 / 104」不是总排名。 那是同尺寸类开源权重模型内部的位次。放到完整榜单上,53 分大概排在第 17。
  • 这个指数是滚动的。 Flash 0731 刚发布时是 50 分,现在是 52 分,因为 AA 从 v4.1 换到 v4.1.1 并重算了。引用时写相对排序比写绝对分数稳,而且无论引哪个都要标日期。

同一份快照里还有三个辅助数字,都测自 max effort 配置:

  • 整轮指数跑下来输出 128M token,Flash 0731 是 206M。Pro 用更少的字拿到了更高的分,这与通常的规律相反。
  • 每秒输出 83.2 token,首包 1.63 秒。 作为对比,Claude Opus 5 在 max effort 下首包要 63.9 秒,GPT-5.6 Sol 在 max 下要 176.6 秒。
  • 跑完整套指数的总账单 $135.03,Flash 0731 是 $72.03。

除了 DeepSeek,还能在哪跑 V4 Pro 0813?

目前另有两处,价格都是源价的 3 到 4 倍,而且这份名单一天一变。 OpenRouter 的 endpoints 接口在 2026-08-13 为 deepseek/deepseek-v4-pro-0813 列出 2 家,2026-08-14 是 3 家:

托管方每百万输入 / 输出
DeepSeek$0.435 / $0.87
Cloudflare$1.32 / $3.96
GMICloud(fp8)$1.74 / $3.48

Flash 0731 列了 28 个端点,而权重已经公开的 Pro 正在往那个形态走:第三家是在仓库放出后一天之内出现的。有两个现实推论,今天都成立,但都有保质期:

  • 暂时不存在更便宜的第三方线路。 在 Flash 上比价是真杠杆,光是缓存读取单价各家就差约 27 倍。Pro 现在的每一个替代托管方都比源价贵 3 到 4 倍,GMICloud 的缓存读取是 $0.145,DeepSeek 自己是 $0.003625。
  • 能故障切换,但要为此留预算。 DeepSeek 的端点打满时你可以切别家,代价是 3 到 4 倍的账单,而且没有 DeepSeek 自家端点宣传的那种隐式提示缓存。那是应对故障的兜底,不是常态流量的去处,至少在托管方多到能打价格战之前是这样。

接线时留意 slug。deepseek/deepseek-v4-pro-0813 才是新版。OpenRouter 上不带后缀的 deepseek/deepseek-v4-pro 仍是 4 月预览版,摘要价 $1.168 输入 / $2.336 输出,是现行官方价的约 2.7 倍,而模型还更弱。Flash 发布时是完全一样的陷阱。

怎么调用 DeepSeek V4 Pro 0813?

把任意 OpenAI 兼容客户端指向 DeepSeek,发 deepseek-v4-pro 即可。 OpenAI 和 Anthropic 两套协议都能用,而且从这次发布起 Responses API 在 Pro 上也能用了。

from openai import OpenAI

client = OpenAI(
    base_url="https://api.deepseek.com",
    api_key="YOUR_DEEPSEEK_API_KEY",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Hello!"}],
    reasoning_effort="high",
)
print(response.choices[0].message.content)

Responses API 支持对 Pro 来说是新的。2026-07-31 时官方的说法是原生 Responses 随 Flash 上线、Pro 在 8 月初跟进。现在价格页把两个模型都标成支持,正式版的更新日志还写明这套格式是「专门为 Codex 适配的」,并给了一键配置脚本。这一点主要对 Codex CLI 有意义,因为那个客户端只认 wire_api = "responses"

为什么同一个模型,thinking 的行为会因调用位置而不同?

推理的默认值并不属于模型本身,它属于你正在调的那个端点,而且响应里没有任何字段告诉你拿到的是哪种默认值。

DeepSeek 自己的 thinking 模式文档写得很明确:V4 默认开启 thinking,effort 默认 high;从这次发布起它记录了三档 effort 而不是一个开关,lowhighmax。文档还给出了 OpenAI 风格取值里没有对应项的映射关系,mediumxhigh 都会被折叠成 high,也就是说你可能发出的五个字符串里有两个,即便在 DeepSeek 自家端点上也会被悄悄合并。

把同一个模型 ID 换成经网关调用,默认值本身就可能变,既不报错,响应里也没有任何字段标注。我们在 2026-08-13 用一道 bat-and-ball 题在某个 OpenAI 兼容网关上测了 deepseek/deepseek-v4-pro,每种配置跑三次:

请求completion token(3 次)reasoning_content答案
不带推理参数4, 4, 4正确
reasoning_effort: "high"201, 248, 294正确
reasoning_effort: "max"178, 179, 460正确
thinking: {"type": "enabled"}4, 90, 95正确

这张表给出三个结论。这条线路上 thinking 默认是关的,与厂商默认开启相反,而且三次都一致。把它打开,同一个一个词的答案要花 50 到 75 倍的输出 token,这就是推理模型账单的全部故事;另外注意每一行内部的离散程度,这正是「推理成本只测一次没什么价值」的原因。还有 DeepSeek 原生的 thinking 参数完全没起作用:它那三次的分布和不带任何参数时一样,而 OpenAI 的 reasoning_effort 每次都能把数字推上去。你需要用哪个参数名,取决于网关,不取决于模型。

四种情况下推理 token 都按 completion token 计了费,而推理正文一律没有返回。这是正常的,也正是账单能翻三倍而可见输出长度不变的原因。

有个零成本的自检:发一道算术题,不带任何推理参数,读 usage.completion_tokens,发三次而不是一次。每次都是个位数说明 thinking 是关的,几百就是开着并且你在为它付钱。接任何新端点、给预算定盘子之前都做一次;供应商在稳定 ID 背后悄悄换版本时也要重做一次,这次发生的正是这种事。

如果你想比较两个模型的推理经济性又不想开两个厂商账号,OpenAI 兼容网关可以让你只换 model 字符串、其余全部不动。在 ofox 上这两个 ID 是 deepseek/deepseek-v4-prodeepseek/deepseek-v4-flash,共用同一个 base_url 和同一把 key。

for model_id in ["deepseek/deepseek-v4-pro", "deepseek/deepseek-v4-flash"]:
    r = client.chat.completions.create(
        model=model_id,
        messages=[{"role": "user", "content": PROMPT}],
        reasoning_effort="high",
    )
    print(model_id, r.usage.completion_tokens)

关于这条线路有个补充说明,免得说过头:ofox 目录里 deepseek/deepseek-v4-pro 的发布日期仍标着 2026-04-24,模型页上的 LMArena 快照也仍是 2026-07-12,所以从外部无法确认它今天背后跑的是哪一版。上面那些参数行为的结论与这个问题无关。

DeepSeek V4 Pro 0813 与 V4 Flash 0731 对比

指数差一分,每任务贵一倍。

V4 Pro 0813V4 Flash 0731
AA 智能指数5352
每任务成本$0.06$0.03
指数跑完的输出 token128M206M
输出速度83.2 tok/s115 tok/s
总参数1.6T / 49B 激活284B / 13B 激活
权重公开是,MIT,2026-08-13是,MIT
托管方数量328
并发5002,500

这次发布 Pro 补上了大部分质量差距,价格差距一点没补。在成本、并发和故障切换余地这三件事上,Flash 仍然是 agent 循环和高流量场景的默认选择。Pro 值它这个溢价的地方是最难的那些单次调用,在那里一分指数值两倍的钱。

按任务类型的完整拆解在 V4 Pro 与 Flash 对比,那篇是对着预览版写的,路由建议至今成立,只是差距比当时窄了。

参考信息来源

常见问题

DeepSeek V4 Pro 0813 是什么时候发布的?
2026-08-13,V4 Pro 的正式版(GA),App、网页端和 API 同步上线。最早的迹象是 API 文档快速开始页和价格页多了一行脚注,说 deepseek-v4-pro 已指向 DeepSeek-V4-Pro-0813;带跑分和涨价公告的完整更新日志条目,当天晚些时候才补上。
0813 这一版涨价了吗?
发布当天没涨,但涨价时间已经定了。2026-08-16 之前 V4 Pro 仍是每百万 token 缓存未命中 $0.435、缓存命中 $0.003625、输出 $0.87。从 2026-08-16 16:00 UTC 起整个 V4 系列改成峰谷计价:V4 Pro 谷时 $0.66 输入 / $1.98 输出,峰时 $1.32 / $3.96。也就是说新价里便宜的那一半,输入仍是现价的约 1.5 倍、输出约 2.3 倍。
V4 Pro 0813 的权重能下载吗?
能,2026-08-13 起。Hugging Face 上的 deepseek-ai/DeepSeek-V4-Pro-0813 有 66 个 fp8 safetensors 分片,MIT 协议,无需申请权限,大约在 API 正式发布半天后放出。我们当天上午查的时候它还不可见,所以你看到的任何说 V4 Pro 0813 是闭源权重的内容,都写于仓库公开之前那个窗口里。
为了 V4 Pro 0813 放弃 V4 Flash 0731 值得吗?
只有最难的那一档活值得。在 Artificial Analysis 智能指数上两者是 53 对 52,差一分,而每任务加权成本是 $0.06 对 $0.03。一分要花两倍的钱。托管方数量上 Flash 是 28 家、Pro 是 3 家,故障切换的余地仍然是 Flash 大得多,不过现在两个模型的权重都公开了,Pro 那份名单应该会往上长。
V4 Pro 现在支持 Responses API 了吗?
支持。截至 2026-08-13,价格页把 Responses API 标记为 deepseek-v4-flash 和 deepseek-v4-pro 都可用。2026-07-31 Flash 0731 发布时官方的说法还是 Responses 仅 Flash 支持、Pro 计划在 8 月初跟上,这个计划兑现了。
OpenRouter 上哪个 slug 指向新版?
deepseek/deepseek-v4-pro-0813。不带后缀的 deepseek/deepseek-v4-pro 仍然是 4 月的预览版,摘要价高得多,$1.168 输入 / $2.336 输出。这与 Flash 发布时的陷阱一模一样,当时不带后缀的 slug 也一直指着更旧的 0423 版本。
有几家在托管 DeepSeek V4 Pro 0813?
3 家,2026-08-14 在 OpenRouter endpoints 接口上核实:DeepSeek 自己 $0.435 / $0.87、Cloudflare $1.32 / $3.96、GMICloud $1.74 / $3.48,后两家是源价的 3 到 4 倍。前一天这个数字还是 2 家,而 Flash 0731 已经有 28 家,所以权重公开之后 Pro 这份名单还会继续变长。故障切换的去处有了,更便宜的去处没有。
DeepSeek 官方给 V4 Pro 0813 的跑分是多少?
出自 2026-08-13 的更新日志:Terminal Bench 2.1 87.9、Toolathlon-Verified 74.1、DSBench-FullStack 71.1、DSBench-Hard 67.2、DeepSWE 62.7、NL2Repo 61.5、Cybergym 83.3、AutomationBench(公开集)31.8、Agents' Last Exam 25.7,HLE 不带工具 42.7 / 带工具 60.0。这一次官方没有附方法学说明,而 Flash 0731 那条是写了 harness 和 effort 档位的。
V4 Pro 支持哪几档 thinking effort?
三档:low、high、max,2026-08-13 起 V4 Pro 和 V4 Flash 都有文档。thinking 默认开启,默认档是 high。文档还给出了 OpenAI 风格取值的映射关系:medium 和 xhigh 都会被折叠成 high。
换成 0813 之后我的代码要改吗?
不用。模型 ID、base URL、两套协议和参数集都没变,你已经在用新版了。唯一需要排期的是 2026-08-16 的价格调整,那影响的是账单不是代码。
V4 Pro 0813 比 GLM-5.2 强吗?
在 Artificial Analysis 指数上两者并列 53 分。每任务成本 V4 Pro 只有大约五分之一,$0.06 对 $0.32。现在两边都放出了开源权重;GLM-5.2 的第三方托管名单更长,因为 V4 Pro 0813 的权重 2026-08-13 才公开。
为什么我的 V4 Pro 账单比标价看起来高?
多半是缓存未命中,未命中的单价是命中的 120 倍;再就是 thinking 开着。发一条不带任何推理参数的简单算术题,连发三次,读 usage.completion_tokens:每次都是个位数说明 thinking 是关的,几百就是开着并且在计费。
V4 Pro 支持 FIM 补全吗?
支持,但只在非 thinking 模式下,而且价格页上仍标着 Beta。限制与 V4 Flash 相同。