DeepSeek V4 Pro 0813 上线:价格、开源权重与跑分实测(2026)
V4 Pro 0813 在 Artificial Analysis 拿 53 分,每任务 $0.06,比同分模型便宜 5 倍。MIT 权重已公开,8 月 16 日起改峰谷计价。
DeepSeek 在 2026-08-13 发布了 DeepSeek-V4-Pro-0813,三天之后用它的价格就要涨。 正式版的价格和预览版一模一样。从 2026-08-16 16:00 UTC 起,整个 V4 系列改为峰谷两档计价,而新价目表的每一档都高于今天。
发布: 2026-08-13 正式版;先是文档脚注,当天才补更新日志
模型 ID: deepseek-v4-pro(未变,没有 0813 后缀)
现价: 每百万 $0.435 输入 / $0.87 输出;缓存命中 $0.003625
08-16 起: 谷时 $0.66 / $1.98;峰时 $1.32 / $3.96
开源权重: 2026-08-13 公开,MIT,66 个 fp8 分片,无需申请
上下文: 输入 1M,最大输出 384K
thinking: 默认开启,effort 三档 low / high / max
智能指数: AA 指数 53 分,比预览版高 8 分
每任务成本: $0.06,同为 53 分的模型里最便宜
托管方: 3 家(DeepSeek,另有 Cloudflare 与 GMICloud,贵 3 到 4 倍)
DeepSeek V4 Pro 0813 是什么?
它是 DeepSeek 旗舰模型的正式版,在同一个模型 ID 背后顶替了 4 月的预览版。 官方价格页给的规格是 1.6T 总参数、49B 激活,混合专家架构,纯文本。
调用方式没有任何变化。你发 deepseek-v4-pro,拿到的就是 0813 版。DeepSeek 自己的 API 上并不存在 deepseek-v4-pro-0813 这个模型名,两周前 Flash 发布时也是同一套做法。
在 ofox 上这个模型是 deepseek/deepseek-v4-pro。
DeepSeek V4 Pro 0813 什么时候发布的?
2026-08-13,分两步。 最早的迹象是快速开始页和价格页上多了一行脚注,说 deepseek-v4-pro 已更新到 DeepSeek-V4-Pro-0813。那一整天里,这行脚注就是全部公告。
更新日志条目当天晚些时候才跟上,而这一条才是该读的:它把这次称作 V4 Pro 在 App、网页端和 API 上的正式发布,列了十项跑分,公布了下面要讲的价格调整,并且写明了三档 thinking effort。它也是 2026-07-31 那条 Flash 条目的下文,那条里写着「DeepSeek-V4-Pro 的正式版随后发布」。
DeepSeek 的发布推文当天晚上才出,里面有一个文档里没有的细节:在消费端 App 和网页客户端上,正式版不是默认模型,它在 Expert Mode 后面。如果你拿 App 的回答去对比 API 的回答,这个开关决定了你测的到底是 0813 还是 App 默认给的那个。
真正的经验教训与 DeepSeek 无关,而是关于怎么盯发布。厂商的模型可以在 API 上先活几个小时,你盯的那个页面才说话,所以只读更新日志的发布监测会慢,只读模型列表的又会错过挂在旁边的价格公告。
如果你会写脚本抓这些文档,还有一点值得知道:/news/ 路径是通配的。请求一个并不存在的 news URL,返回的是 HTTP 200 加快速开始页的正文,所以拿状态码判断会得出「某条并不存在的公告已上线」。
DeepSeek V4 Pro 0813 开源吗?
开源,2026-08-13 起。这里的时间点值得知道,因为发布当天的绝大多数报道都写于它成真之前。
deepseek-ai/DeepSeek-V4-Pro-0813里有 66 个 fp8 safetensors 分片,MIT 协议,无需申请权限,另有config.json和 DeepSeek 自家的编码工具。- 仓库日期戳是 2026-08-13,但我们当天上午(UTC)查的时候,它还没出现在该组织的公开模型列表里。到当天傍晚它就在了,大约是 API 正式发布之后半天。
- 更早的
deepseek-ai/DeepSeek-V4-Pro仓库最后修改于 2026-06-22,那是 4 月的预览版:64 个分片,同样是 MIT。别顺手拉错,两个名字只差一个后缀,两个版本差 8 个指数分。 unsloth/DeepSeek-V4-Pro-0813-GGUF当天更早就占好了名字,里面只有一个 README。接下来往里填的会是各种量化版本。
由此有两点。Artificial Analysis 在还没有任何可访问仓库的时候,就给 0813 打上了「Open weights model」标签,这个标签不算错,只是早了半天,跟它在 Flash 0731 上的表现一样。另外,任何把 V4 Pro 0813 列为闭源权重的对比表,包括好几篇发布当天写的,描述的都是一个持续不到一天的窗口。
DeepSeek V4 Pro 多少钱?
2026-08-16 之前是每百万 token 缓存未命中 $0.435、输出 $0.87;之后改成峰谷两档,两档都比现在贵。
| 项目 | V4 Pro | V4 Flash |
|---|---|---|
| 输入,缓存命中 | $0.003625 | $0.0028 |
| 输入,缓存未命中 | $0.435 | $0.14 |
| 输出 | $0.87 | $0.28 |
| 并发上限 | 500 | 2,500 |
真正决定账单的是缓存命中率,因为命中比未命中便宜 120 倍。这套算法我们在预览版上算过一遍,见 DeepSeek V4 Pro 真实成本,比例关系至今未变。
2026-08-16 会变什么?
DeepSeek 在 2026-08-06 挂出的那句含糊警告(「预计有显著上调」,没有幅度,没有日期)随正式发布变成了排期。从 2026-08-16 16:00 UTC 起,计费拆成峰时和谷时,谷时价为峰时的一半。峰时是 01:00 至 04:00 与 06:00 至 10:00 UTC,其余时间都算谷时。
| 每百万 token | 现价 | 08-16 起谷时 | 08-16 起峰时 |
|---|---|---|---|
| V4 Pro,缓存命中 | $0.003625 | $0.022 | $0.044 |
| V4 Pro,缓存未命中 | $0.435 | $0.66 | $1.32 |
| V4 Pro,输出 | $0.87 | $1.98 | $3.96 |
| V4 Flash,缓存命中 | $0.0028 | $0.007 | $0.014 |
| V4 Flash,缓存未命中 | $0.14 | $0.22 | $0.44 |
| V4 Flash,输出 | $0.28 | $0.66 | $1.32 |
这张表要看三件事。谷时不是相对现价的折扣,只是涨得少一点:V4 Pro 输出谷时涨 2.3 倍、峰时涨 4.6 倍。相对幅度最大的是缓存命中那一行,谷时就已经是 6 倍,而这恰好削的是大家把 DeepSeek 用便宜的主要杠杆。还有就是两个峰时窗口都不长而且卡得别扭,01:00 至 04:00 加 06:00 至 10:00 UTC 覆盖了中国大部分工作时间,所以这次到底算涨价还是小涨,主要取决于你的批量任务跑在哪个时段。
八分的提升和这次涨价出现在同一条更新日志里,这也是理解本次发布最诚实的角度:DeepSeek 在为提升收费,而不是自己吸收成本。16 号之后还有效的省钱杠杆,见涨价前省钱的六种方法。
上下文窗口和最大输出是多少?
输入 100 万 token,最大输出 384K,两个 V4 模型相同。
这个输出上限高得反常。多数旗舰模型把输出卡在 64K 到 128K,所以单次 V4 Pro 调用真的能产出一本书那么长的回复。这也意味着 max_tokens 默认并不是安全网,Pro 上一次失控生成可以按每百万 $0.87 的价格烧掉 384,000 个输出 token 才停。
至于窗口具体被 system prompt、工具 schema 和推理 token 怎么吃掉,见什么是上下文窗口。
V4 Pro 0813 跑分怎么样?
有两套数字,而且不能混用:DeepSeek 自己的 agentic 跑分,和 Artificial Analysis 的独立指数。后者上 V4 Pro 0813 是 53 分,预览版是 45 分。
DeepSeek 的更新日志条目为正式版公布了下面这些。它们是厂商自测,而且没有附方法学说明,这点值得直说,因为六周前 Flash 0731 那条是写了 harness 的(DeepSeek Harness minimal mode、max effort、top_p 0.95、temperature 1.0),这一条什么都没写。
| 基准 | V4 Pro 0813 | V4 Flash 0731 |
|---|---|---|
| Terminal Bench 2.1 | 87.9 | 82.7 |
| Cybergym | 83.3 | 76.7 |
| Toolathlon-Verified | 74.1 | 70.3 |
| DSBench-FullStack | 71.1 | 68.7 |
| DSBench-Hard | 67.2 | 59.6 |
| DeepSWE | 62.7 | 54.4 |
| NL2Repo | 61.5 | 54.2 |
| HLE,不带 / 带工具 | 42.7 / 60.0 | 未公布 |
| AutomationBench(公开集) | 31.8 | 25.1 |
| Agents’ Last Exam | 25.7 | 25.2 |
两列都出自 DeepSeek 自己的更新日志,所以列与列之间的对比在内部是自洽的,尽管两边都没有被独立复现过。十项里有两项是 DeepSeek 不公开的内部测试集,DSBench-FullStack 和 DSBench-Hard,这两行公司之外的任何人都无从核对。
独立读数看 Artificial Analysis。V4 Pro 0813 在完整榜单上的位置,指数版本 v4.1.1,快照 2026-08-13:
| 名次 | 模型 | 指数 | 每任务成本 |
|---|---|---|---|
| 1 | Claude Opus 5(max) | 63 | $2.34 |
| 7 | Kimi K3(max) | 60 | $0.84 |
| 17 | DeepSeek V4 Pro 0813(max) | 53 | $0.06 |
| 18 | GPT-5.6 Terra(xhigh) | 53 | $0.31 |
| 19 | GLM-5.2(max) | 53 | $0.32 |
| 22 | DeepSeek V4 Flash 0731(max) | 52 | $0.03 |
| 36 | DeepSeek V4 Pro(4 月预览版,max) | 45 | $0.05 |
真正该看的是成本列,不是名次。三个模型并列 53 分,V4 Pro 0813 的每任务成本比另外两个便宜约 5 倍。
引用这个数字时有两点要当心:
- AA 模型页上写的「#2 / 104」不是总排名。 那是同尺寸类开源权重模型内部的位次。放到完整榜单上,53 分大概排在第 17。
- 这个指数是滚动的。 Flash 0731 刚发布时是 50 分,现在是 52 分,因为 AA 从 v4.1 换到 v4.1.1 并重算了。引用时写相对排序比写绝对分数稳,而且无论引哪个都要标日期。
同一份快照里还有三个辅助数字,都测自 max effort 配置:
- 整轮指数跑下来输出 128M token,Flash 0731 是 206M。Pro 用更少的字拿到了更高的分,这与通常的规律相反。
- 每秒输出 83.2 token,首包 1.63 秒。 作为对比,Claude Opus 5 在 max effort 下首包要 63.9 秒,GPT-5.6 Sol 在 max 下要 176.6 秒。
- 跑完整套指数的总账单 $135.03,Flash 0731 是 $72.03。
除了 DeepSeek,还能在哪跑 V4 Pro 0813?
目前另有两处,价格都是源价的 3 到 4 倍,而且这份名单一天一变。 OpenRouter 的 endpoints 接口在 2026-08-13 为 deepseek/deepseek-v4-pro-0813 列出 2 家,2026-08-14 是 3 家:
| 托管方 | 每百万输入 / 输出 |
|---|---|
| DeepSeek | $0.435 / $0.87 |
| Cloudflare | $1.32 / $3.96 |
| GMICloud(fp8) | $1.74 / $3.48 |
Flash 0731 列了 28 个端点,而权重已经公开的 Pro 正在往那个形态走:第三家是在仓库放出后一天之内出现的。有两个现实推论,今天都成立,但都有保质期:
- 暂时不存在更便宜的第三方线路。 在 Flash 上比价是真杠杆,光是缓存读取单价各家就差约 27 倍。Pro 现在的每一个替代托管方都比源价贵 3 到 4 倍,GMICloud 的缓存读取是 $0.145,DeepSeek 自己是 $0.003625。
- 能故障切换,但要为此留预算。 DeepSeek 的端点打满时你可以切别家,代价是 3 到 4 倍的账单,而且没有 DeepSeek 自家端点宣传的那种隐式提示缓存。那是应对故障的兜底,不是常态流量的去处,至少在托管方多到能打价格战之前是这样。
接线时留意 slug。deepseek/deepseek-v4-pro-0813 才是新版。OpenRouter 上不带后缀的 deepseek/deepseek-v4-pro 仍是 4 月预览版,摘要价 $1.168 输入 / $2.336 输出,是现行官方价的约 2.7 倍,而模型还更弱。Flash 发布时是完全一样的陷阱。
怎么调用 DeepSeek V4 Pro 0813?
把任意 OpenAI 兼容客户端指向 DeepSeek,发 deepseek-v4-pro 即可。 OpenAI 和 Anthropic 两套协议都能用,而且从这次发布起 Responses API 在 Pro 上也能用了。
from openai import OpenAI
client = OpenAI(
base_url="https://api.deepseek.com",
api_key="YOUR_DEEPSEEK_API_KEY",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Hello!"}],
reasoning_effort="high",
)
print(response.choices[0].message.content)
Responses API 支持对 Pro 来说是新的。2026-07-31 时官方的说法是原生 Responses 随 Flash 上线、Pro 在 8 月初跟进。现在价格页把两个模型都标成支持,正式版的更新日志还写明这套格式是「专门为 Codex 适配的」,并给了一键配置脚本。这一点主要对 Codex CLI 有意义,因为那个客户端只认 wire_api = "responses"。
为什么同一个模型,thinking 的行为会因调用位置而不同?
推理的默认值并不属于模型本身,它属于你正在调的那个端点,而且响应里没有任何字段告诉你拿到的是哪种默认值。
DeepSeek 自己的 thinking 模式文档写得很明确:V4 默认开启 thinking,effort 默认 high;从这次发布起它记录了三档 effort 而不是一个开关,low、high、max。文档还给出了 OpenAI 风格取值里没有对应项的映射关系,medium 和 xhigh 都会被折叠成 high,也就是说你可能发出的五个字符串里有两个,即便在 DeepSeek 自家端点上也会被悄悄合并。
把同一个模型 ID 换成经网关调用,默认值本身就可能变,既不报错,响应里也没有任何字段标注。我们在 2026-08-13 用一道 bat-and-ball 题在某个 OpenAI 兼容网关上测了 deepseek/deepseek-v4-pro,每种配置跑三次:
| 请求 | completion token(3 次) | reasoning_content | 答案 |
|---|---|---|---|
| 不带推理参数 | 4, 4, 4 | 空 | 正确 |
reasoning_effort: "high" | 201, 248, 294 | 空 | 正确 |
reasoning_effort: "max" | 178, 179, 460 | 空 | 正确 |
thinking: {"type": "enabled"} | 4, 90, 95 | 空 | 正确 |
这张表给出三个结论。这条线路上 thinking 默认是关的,与厂商默认开启相反,而且三次都一致。把它打开,同一个一个词的答案要花 50 到 75 倍的输出 token,这就是推理模型账单的全部故事;另外注意每一行内部的离散程度,这正是「推理成本只测一次没什么价值」的原因。还有 DeepSeek 原生的 thinking 参数完全没起作用:它那三次的分布和不带任何参数时一样,而 OpenAI 的 reasoning_effort 每次都能把数字推上去。你需要用哪个参数名,取决于网关,不取决于模型。
四种情况下推理 token 都按 completion token 计了费,而推理正文一律没有返回。这是正常的,也正是账单能翻三倍而可见输出长度不变的原因。
有个零成本的自检:发一道算术题,不带任何推理参数,读 usage.completion_tokens,发三次而不是一次。每次都是个位数说明 thinking 是关的,几百就是开着并且你在为它付钱。接任何新端点、给预算定盘子之前都做一次;供应商在稳定 ID 背后悄悄换版本时也要重做一次,这次发生的正是这种事。
如果你想比较两个模型的推理经济性又不想开两个厂商账号,OpenAI 兼容网关可以让你只换 model 字符串、其余全部不动。在 ofox 上这两个 ID 是 deepseek/deepseek-v4-pro 和 deepseek/deepseek-v4-flash,共用同一个 base_url 和同一把 key。
for model_id in ["deepseek/deepseek-v4-pro", "deepseek/deepseek-v4-flash"]:
r = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": PROMPT}],
reasoning_effort="high",
)
print(model_id, r.usage.completion_tokens)
关于这条线路有个补充说明,免得说过头:ofox 目录里 deepseek/deepseek-v4-pro 的发布日期仍标着 2026-04-24,模型页上的 LMArena 快照也仍是 2026-07-12,所以从外部无法确认它今天背后跑的是哪一版。上面那些参数行为的结论与这个问题无关。
DeepSeek V4 Pro 0813 与 V4 Flash 0731 对比
指数差一分,每任务贵一倍。
| V4 Pro 0813 | V4 Flash 0731 | |
|---|---|---|
| AA 智能指数 | 53 | 52 |
| 每任务成本 | $0.06 | $0.03 |
| 指数跑完的输出 token | 128M | 206M |
| 输出速度 | 83.2 tok/s | 115 tok/s |
| 总参数 | 1.6T / 49B 激活 | 284B / 13B 激活 |
| 权重公开 | 是,MIT,2026-08-13 | 是,MIT |
| 托管方数量 | 3 | 28 |
| 并发 | 500 | 2,500 |
这次发布 Pro 补上了大部分质量差距,价格差距一点没补。在成本、并发和故障切换余地这三件事上,Flash 仍然是 agent 循环和高流量场景的默认选择。Pro 值它这个溢价的地方是最难的那些单次调用,在那里一分指数值两倍的钱。
按任务类型的完整拆解在 V4 Pro 与 Flash 对比,那篇是对着预览版写的,路由建议至今成立,只是差距比当时窄了。
参考信息来源
- DeepSeek API 价格页
- DeepSeek 首次 API 调用
- DeepSeek 更新日志
- DeepSeek 发布公告,2026-08-13
- DeepSeek thinking 模式文档
- Hugging Face:deepseek-ai/DeepSeek-V4-Pro-0813
- Hugging Face:deepseek-ai/DeepSeek-V4-Pro
- Hugging Face:unsloth/DeepSeek-V4-Pro-0813-GGUF
- Artificial Analysis:DeepSeek V4 Pro 0813
- Artificial Analysis 模型榜单
- OpenRouter:deepseek/deepseek-v4-pro-0813
常见问题
- DeepSeek V4 Pro 0813 是什么时候发布的?
- 2026-08-13,V4 Pro 的正式版(GA),App、网页端和 API 同步上线。最早的迹象是 API 文档快速开始页和价格页多了一行脚注,说 deepseek-v4-pro 已指向 DeepSeek-V4-Pro-0813;带跑分和涨价公告的完整更新日志条目,当天晚些时候才补上。
- 0813 这一版涨价了吗?
- 发布当天没涨,但涨价时间已经定了。2026-08-16 之前 V4 Pro 仍是每百万 token 缓存未命中 $0.435、缓存命中 $0.003625、输出 $0.87。从 2026-08-16 16:00 UTC 起整个 V4 系列改成峰谷计价:V4 Pro 谷时 $0.66 输入 / $1.98 输出,峰时 $1.32 / $3.96。也就是说新价里便宜的那一半,输入仍是现价的约 1.5 倍、输出约 2.3 倍。
- V4 Pro 0813 的权重能下载吗?
- 能,2026-08-13 起。Hugging Face 上的 deepseek-ai/DeepSeek-V4-Pro-0813 有 66 个 fp8 safetensors 分片,MIT 协议,无需申请权限,大约在 API 正式发布半天后放出。我们当天上午查的时候它还不可见,所以你看到的任何说 V4 Pro 0813 是闭源权重的内容,都写于仓库公开之前那个窗口里。
- 为了 V4 Pro 0813 放弃 V4 Flash 0731 值得吗?
- 只有最难的那一档活值得。在 Artificial Analysis 智能指数上两者是 53 对 52,差一分,而每任务加权成本是 $0.06 对 $0.03。一分要花两倍的钱。托管方数量上 Flash 是 28 家、Pro 是 3 家,故障切换的余地仍然是 Flash 大得多,不过现在两个模型的权重都公开了,Pro 那份名单应该会往上长。
- V4 Pro 现在支持 Responses API 了吗?
- 支持。截至 2026-08-13,价格页把 Responses API 标记为 deepseek-v4-flash 和 deepseek-v4-pro 都可用。2026-07-31 Flash 0731 发布时官方的说法还是 Responses 仅 Flash 支持、Pro 计划在 8 月初跟上,这个计划兑现了。
- OpenRouter 上哪个 slug 指向新版?
- deepseek/deepseek-v4-pro-0813。不带后缀的 deepseek/deepseek-v4-pro 仍然是 4 月的预览版,摘要价高得多,$1.168 输入 / $2.336 输出。这与 Flash 发布时的陷阱一模一样,当时不带后缀的 slug 也一直指着更旧的 0423 版本。
- 有几家在托管 DeepSeek V4 Pro 0813?
- 3 家,2026-08-14 在 OpenRouter endpoints 接口上核实:DeepSeek 自己 $0.435 / $0.87、Cloudflare $1.32 / $3.96、GMICloud $1.74 / $3.48,后两家是源价的 3 到 4 倍。前一天这个数字还是 2 家,而 Flash 0731 已经有 28 家,所以权重公开之后 Pro 这份名单还会继续变长。故障切换的去处有了,更便宜的去处没有。
- DeepSeek 官方给 V4 Pro 0813 的跑分是多少?
- 出自 2026-08-13 的更新日志:Terminal Bench 2.1 87.9、Toolathlon-Verified 74.1、DSBench-FullStack 71.1、DSBench-Hard 67.2、DeepSWE 62.7、NL2Repo 61.5、Cybergym 83.3、AutomationBench(公开集)31.8、Agents' Last Exam 25.7,HLE 不带工具 42.7 / 带工具 60.0。这一次官方没有附方法学说明,而 Flash 0731 那条是写了 harness 和 effort 档位的。
- V4 Pro 支持哪几档 thinking effort?
- 三档:low、high、max,2026-08-13 起 V4 Pro 和 V4 Flash 都有文档。thinking 默认开启,默认档是 high。文档还给出了 OpenAI 风格取值的映射关系:medium 和 xhigh 都会被折叠成 high。
- 换成 0813 之后我的代码要改吗?
- 不用。模型 ID、base URL、两套协议和参数集都没变,你已经在用新版了。唯一需要排期的是 2026-08-16 的价格调整,那影响的是账单不是代码。
- V4 Pro 0813 比 GLM-5.2 强吗?
- 在 Artificial Analysis 指数上两者并列 53 分。每任务成本 V4 Pro 只有大约五分之一,$0.06 对 $0.32。现在两边都放出了开源权重;GLM-5.2 的第三方托管名单更长,因为 V4 Pro 0813 的权重 2026-08-13 才公开。
- 为什么我的 V4 Pro 账单比标价看起来高?
- 多半是缓存未命中,未命中的单价是命中的 120 倍;再就是 thinking 开着。发一条不带任何推理参数的简单算术题,连发三次,读 usage.completion_tokens:每次都是个位数说明 thinking 是关的,几百就是开着并且在计费。
- V4 Pro 支持 FIM 补全吗?
- 支持,但只在非 thinking 模式下,而且价格页上仍标着 Beta。限制与 V4 Flash 相同。


