MiniMax H3 API 价格:2K 每秒 $0.13,以及为什么「先出草稿再升级」一分钱都省不下
MiniMax H3 在 2K 下每秒 $0.13,768P 每秒 $0.08。768P 转 2K 的重生成档是 $0.05,$0.08 + $0.05 正好等于 $0.13。这对真实预算意味着什么。
MiniMax H3 的 2K 输出每秒 $0.13,768P 每秒 $0.08。把已完成的 768P 片子转成 2K 的重生成档是 $0.05。 后两个加起来是 $0.13——和直接出 2K 的价格分毫不差。这道算术是关于这个模型定价你最该知道的一件事,而它没写在营销页上。
模型 ID: MiniMax-H3
输出: 2K 每秒 $0.13,768P 每秒 $0.08
重生成: 每秒 $0.05(仅 768P → 2K)
时长: 4–15 秒,只能取整数,24 fps
音频: 原生立体声,同一遍生成
输入音频: 免费
输入图像: 前 5 张免费,之后每张 $0.04
输入视频: 按它自己的时长、以输出档费率计费
端点: POST /v2/video_generation(异步,轮询取结果)
权重: H3-Base 开源(768P);2K 模块与 Context-IR 未发布
网关: 截至 2026-09-06 不在 Ofox 目录内
费率读取自 MiniMax 2026 年 9 月 6 日的按量付费定价页。H3 于 2026 年 7 月 31 日发布,权重在 8 月 3 日跟上。
MiniMax H3 到底是什么
一个在一次请求里同时吃文本、图像、视频、音频,并返回带声音视频的多模态生成模型。 不是语言模型——搜索结果里一起冒出来的 M3 是另一个编程与语言模型,在同一场 WAIC 2026 上发布。
H3 区别于多数视频模型的地方在于,音频是在同一遍里生成的,不是事后配上去。MiniMax 自己的说法是,它把过去要分开的一堆专家模型——文生视频、图生视频、首尾帧、主体参考、动作参考、视频编辑——收进了一个模型里,模式由你送进去的东西决定,而不是由不同的端点决定。
| 规格 | MiniMax H3 |
|---|---|
| 输出分辨率 | 768P 或 2K |
| 时长 | 4–15 秒,只能取整数 |
| 帧率 | 24 fps |
| 音频 | 原生立体声,同一遍生成 |
| 画幅比 | adaptive、21:9、16:9、4:3、1:1、3:4、9:16 |
| 参考输入 | 最多 9 张图、3 段视频、3 段音频 |
| 请求体 | 总计 ≤ 64 MB |
价目表
两档输出、一档重生成,输入素材另计。
| 计费项 | 费率 |
|---|---|
| 2K 输出 | 每秒 $0.13 |
| 768P 输出 | 每秒 $0.08 |
| 768P → 2K 重生成 | 每秒 $0.05 |
| 输入音频 | 免费 |
| 输入图像 | 前 5 张免费,之后每张 $0.04 |
| 输入视频 | 按输入时长、以输出分辨率对应的费率计费 |
另有一个单独的 MiniMax-H3-Max 模型,480P 每秒 $0.05、768P 每秒 $0.08,目前只支持文生视频和图生视频,且不对输入素材计费。
按公开费率算,一段片子多少钱:
| 时长 | 768P | 2K |
|---|---|---|
| 4 秒 | $0.32 | $0.52 |
| 5 秒 | $0.40 | $0.65 |
| 10 秒 | $0.80 | $1.30 |
| 15 秒 | $1.20 | $1.95 |
定价页上没人写的那道算术
$0.08 + $0.05 = $0.13。 先在 768P 出草稿、再把选中的那条升到 2K,花的钱和直接拍 2K 一模一样。
这件事要紧,是因为「便宜地多生成,把赢家升级」是个显而易见的工作流,听上去像在省钱。就单条片子而言,它不省:
| 路径 | 10 秒片子 |
|---|---|
| 直接 2K | $1.30 |
| 768P 草稿,再重生成 | $0.80 + $0.50 = $1.30 |
草稿路线真正省钱的地方,是你扔掉的那些镜头。 每一秒被丢弃的素材只花 $0.05 而不是 $0.13,所以省是真省,但省多少取决于你的废片率,而不是取决于这个工作流本身。五条 5 秒的镜头扔掉四条,这一批省下 $1.00。全都留下,那你花了同样的钱,还多等了一遍。
它更贵的地方:参考素材重的活儿。 重生成会把原始输入素材重新计一遍费。图像重新给你 5 张免费额度,之后每张 $0.025,参考视频也按它自己的时长再计一次每秒 $0.05。如果你每次生成都要喂一张角色设定图加一段动作参考,那草稿再升级这条路一定比直接上 2K 更贵。
诚实的判断是:把 768P 当成筛选层,而不是省钱手段。 你在探索、并且预计大部分生成结果都会被丢掉时,它划算。你已经明确知道自己要什么时,它反而让你多花钱。
重生成端点的限制很死
在围绕它做开发之前值得先读一遍,因为它不是超分工具。按 MiniMax 自己的 API 文档,源视频必须严格符合 H3 的 768P 输出规格:
| 要求 | 取值 |
|---|---|
| 音轨 | 必须有——没有音频的视频会被拒 |
| 帧率 | 24 fps |
| 宽 / 高 | 都要能被 32 整除 |
| 面积 | ≤ 768 × 1344(1,032,192 像素) |
| 总帧数 | 107–362,步长为 17 |
还有两条会咬人的约束:
- 原始输入必须原样重新提交。 768P 那次任务里所有的参考图、视频和音频都要再传一遍,另加一个
role=base_video的video_url项。 - prompt 必须是后处理之后的那一版。 MiniMax 明确要求
text必须是 “the final prompt actually sent to the model when generating the 768P source video, not the original prompt from before H3-Context-IR processing.”(生成 768P 源视频时实际送给模型的最终 prompt,而不是 H3-Context-IR 处理之前的原始 prompt。)如果你没把那个中间产物记下来,这个任务你就复现不了。
最后这条是真正的坑。Context-IR 会在生成前重写你的指令,而重生成要的是重写之后的那一版。生成时就把它记下来,否则你之后就失去了升级这段片子的能力。
开源的只是模型的一半
H3-Base 是公开的。撑起那些宣传参数的两个模块不是。
MiniMax 于 2026 年 8 月 3 日开源了 H3——两个 BF16 检查点(FL2VA 用于文本和首尾帧类任务,Ref2VA 用于参考类任务),33B 稠密单流 transformer,托管在 Hugging Face 上,许可是 MiniMax 自家的 Community License,不是 Apache 或 MIT。
你拿不到的部分:
- H3-Regenerate-2K,模型卡上写的是 “not yet open-sourced”(尚未开源)。这正是产出 2K 的那个模块。本地部署只能生成 768P。
- H3-Context-IR,把你的多模态指令转成模型真正消费的内容的托管层,因为横跨多个托管服务而被排除。MiniMax 称它对输出质量至关重要。
- 稀疏注意力推理。 模型原生支持,但开源版本只带了全注意力。
所以自部署拿到的是 768P 那一半。官方参考部署是四张 GPU 走 SGLang。在把一个工程师投进去之前,请拿它和每秒 $0.13 掂量一下——另外注意 Community License 在若干地区限制使用,并要求营收超过某个门槛后取得书面授权,这属于法务评估而不是技术评估。
H3 的价格横向对比
H3 不在 Ofox 目录里,所以这是一次跨渠道对比,不是同口径对比。Ofox 的费率读取自 2026 年 9 月 6 日的实时 /v1/models 端点;H3 的是 MiniMax 自己的标价。
| 模型 | 每秒 | 最长时长 | 分辨率 | 原生音频 |
|---|---|---|---|---|
| MiniMax H3(2K) | $0.130 | 15 秒 | 768P、2K | 有 |
| MiniMax H3(768P) | $0.080 | 15 秒 | 768P、2K | 有 |
alibaba/wan-3.0 | $0.050 | 30 秒 | 480p–1080p | 有 |
alibaba/wan-3.0-prime | $0.080 | 30 秒 | 480p–1080p | 有 |
bytedance/seedance-2.5 | $0.110 | 30 秒 | 480p–1080p | 有 |
alibaba/happyhorse-1.1 | $0.130 | 15 秒 | 720p、1080p | 有 |
bytedance/seedance-2.0 | $0.070 | 15 秒 | 480p–4K | 有 |
这张表要仔细读,因为分辨率那一列很关键。H3 是表里唯一输出 2K 的模型,同时也是唯一一个最便宜档位天花板低于 1080p 的。拿 2K 的 $0.13 去比 Wan 3.0 在 1080p 下的 $0.05,比的不是同一件东西。
各自适合什么:
- 你要 2K 且音画同步: 这张表上只有 H3 能给。除了 Seedance 2.0 能到 4K($0.07),其余都上不了 1080p 以上。
- 你要 1080p 且价格最低: Wan 3.0 每秒 $0.05,不到 H3 768P 档的一半,输出的分辨率还更高。
- 你要超过 15 秒的片子: H3 封顶 15 秒。Wan 3.0 和 Seedance 2.5 都能到 30。
- 你要塞大量参考素材: Seedance 2.5 接受 30 张图、10 段视频、10 段音频,H3 是 9 / 3 / 3。
怎么调
H3 跑在 MiniMax 自己的平台上,异步——先创建任务,再轮询取结果:
curl -X POST https://api.minimax.io/v2/video_generation \
-H "Authorization: Bearer $MINIMAX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMax-H3",
"content": [
{"type": "text", "text": "A paper boat drifting down a rain gutter, close on the water line"}
],
"resolution": "2K",
"duration": 5,
"ratio": "16:9"
}'
两条实用提示:纯文生视频时 ratio 是必填的,且不能填 adaptive。另外请求体要控制在 64 MB 以内——Base64 会让载荷膨胀约三分之一,稍大一点的素材都该用公网 URL。
Ofox 这边,截至 2026 年 9 月 6 日 H3 不可用。 目录里的 MiniMax 模型是 M 系列语言模型,包括 minimax/minimax-m3,每百万 $0.60 / $2.40——就是那个老被和 H3 搞混的模型。今天在同一把 key 上做视频:
curl -X POST https://api.ofox.io/v1/videos \
-H "Authorization: Bearer $OFOX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "alibaba/wan-3.0",
"prompt": "A paper boat drifting down a rain gutter, close on the water line",
"duration": 5,
"resolution": "1080p"
}'
到底哪些模型可调,以 GET https://api.ofox.io/v1/models 为准,不要以本页为准。
后续要盯的
有三件事会改变上面的判断:
- H3-Regenerate-2K 开源。 在那之前,自部署就意味着只有 768P,「开源权重」这件事的实际分量比标题看上去小得多。MiniMax 没给日期。
- 独立的质量测量。 目前所有关于 H3 输出质量的公开材料,要么是 MiniMax 自己的 demo,要么是上手体验。这个领域没有可类比 Artificial Analysis 在语言模型上做的第三方视频基准,所以「不到主流模型三分之一」这种说法是厂商口径,不是已被验证的结论。
- 网关上架。 H3 上了聚合平台,你就能在一把 key 上把它和 Wan 3.0、Seedance 2.5 做 A/B——这正是本文今天做不了的那次对比。
来源
- https://www.minimax.io/blog/minimax-h3
- https://platform.minimax.io/docs/guides/pricing-paygo
- https://platform.minimax.io/docs/api-reference/video-generation-v2-create
- https://platform.minimax.io/docs/api-reference/video-generation-v2-regeneration
- https://huggingface.co/MiniMaxAI/MiniMax-H3
- https://ofox.io/models/alibaba/wan-3.0
- https://ofox.io/models/bytedance/seedance-2.5
H3 的费率、时长范围、输入素材规则和重生成源视频规格,读取自 MiniMax 2026 年 9 月 6 日的按量付费定价页与 API 文档。2026 年 7 月 31 日发布、8 月 3 日开源权重这两个日期出自 MiniMax 自己的公告。Ofox 的对比费率和视频属性读取自同一天的实时 /v1/models 端点。截至该日期 MiniMax H3 不在 Ofox 目录内;本页没有任何内容出自我们自己的实测。
常见问题
- MiniMax H3 API 多少钱?
- 输出视频 2K 每秒 $0.13、768P 每秒 $0.08,在 MiniMax 的按量付费方案下按秒计费。一段 10 秒的 2K 片子是 $1.30。把已生成的 768P 片子重生成为 2K,另按每秒 $0.05 计。输入音频免费,前五张参考图免费、之后每张 $0.04,参考视频按它自己的时长、以输出分辨率对应的费率计费。
- 先在 768P 生成再升到 2K 更便宜吗?
- 对你要留下的片子来说不便宜。768P 那一遍 $0.08 加上重生成 $0.05 正好是 $0.13,和直接出 2K 的价格分毫不差。草稿再升级这条路只在你丢弃的镜头上省钱,每秒省到 $0.05;而且重生成会把原始参考素材重新计一遍费,所以参考素材多的活儿反而可能比直接拍 2K 更贵。
- MiniMax H3 是什么?
- MiniMax 于 2026 年 7 月 31 日发布的通用多模态生成模型。它在一次请求里接受文本、图像、视频和音频输入,返回一段 4 到 15 秒、768P 或 2K、24 fps 的片子,并在同一遍里原生生成立体声音频,而不是事后配上去。它是视频模型,不是命名规律相似的 M3 语言模型。
- MiniMax H3 的权重开源了吗?
- 部分开源,而没开的那部分很关键。MiniMax 在 2026 年 8 月 3 日以自家 Community License 开源了 H3-Base,两个 BF16 检查点。但产出 2K 的 H3-Regenerate-2K 模块没有发布,负责处理多模态指令的托管层 H3-Context-IR 因为横跨多个服务也被排除在外。本地部署只能生成 768P。
- MiniMax H3 的视频能有多长?
- 4 到 15 秒,只能取整数,24 fps。重生成端点的要求更严:源视频必须是 24 fps,宽高都能被 32 整除,面积不超过 768×1344,总帧数在 107 到 362 之间且以 17 为步长。它不是通用超分工具,非 H3 在 768P 下产出的视频会被拒。
- Ofox 上能用 MiniMax H3 吗?
- 截至 2026 年 9 月 6 日不能。Ofox 目录里的 MiniMax 模型是 M 系列语言模型。同一把 key 上要做视频,alibaba/wan-3.0 是每秒 $0.05、最高 1080p,bytedance/seedance-2.5 是 $0.11,alibaba/happyhorse-1.1 是 $0.130。到底哪些可调,以 GET /v1/models 的实时目录为准。
- MiniMax H3 和 M3 有什么区别?
- 是两个互不相干的模型,只是在同一场 WAIC 2026 上发布,所以搜索结果里老是被混在一起。H3 是本文讲的多模态视频模型。M3 是语言和编程模型,Ofox 上是 minimax/minimax-m3,每百万输入 $0.60、输出 $2.40。


