MiniMax H3:原生 2K 立体声视频生成
深入拆解 MiniMax H3 的原生 2K 立体声视频生成能力——音频+视频一次出,三种生成模式,以及与 Kling、Gemini 的成本对比。
结论先行 — MiniMax H3 一次 API 调用同时输出视频和同步立体声音频。支持三种模式(文生视频、图生视频、参考视频生成),原生 2K 分辨率输出,单条视频 $0.30–$0.80。不需要额外调 TTS 或音乐生成接口。
大多数视频生成 API 输出的是无声片段。你得先生成视频,再单独调一次 TTS 或音乐模型,然后自己写代码把音轨对齐。MiniMax H3 直接跳过了这条弯路:一次生成就输出带立体声音频的视频。
对 agent 来说这意味着什么?一次 API 调用代替三次,故障点更少,延迟更低,计费事件只有一个。下面拆解 H3 的实际能力、费用和选型建议。
H3 到底有什么不同
H3 是 MiniMax 的第三代视频模型。核心卖点:音频不是后挂的,而是和视频帧在同一个扩散过程中生成的。
实际效果:
- 提示词写”咖啡师在繁忙的咖啡店里打奶泡”,输出视频自带咖啡机声、环境嘈杂声和背景对话
- 人物对话天然唇同步,不需要后处理
- 音乐驱动的场景里,人物动作和节拍自然匹配
三种生成模式
H3 在 SandBase 上暴露了三个操作端点:
| 操作 | 输入 | 适合场景 | SandBase 模型 ID |
|---|---|---|---|
| 文生视频 | 文本提示词 | 从零创意生成 | minimax/h3/text-to-video |
| 图生视频 | 图片 + 文本提示词 | 产品图动画、静图动起来 | minimax/h3/image-to-video |
| 参考视频生成 | 参考视频 + 文本提示词 | 风格/动作迁移 | minimax/h3/reference-to-video |
三种模式都输出立体声音频,都支持最高 2K(2048×1080)分辨率。
技术规格
| 参数 | 数值 |
|---|---|
| 最高分辨率 | 2048 × 1080(2K 电影宽幅) |
| 帧率 | 24 fps |
| 最长时长 | 10 秒 |
| 音频 | 立体声,44.1 kHz |
| 输出格式 | MP4(H.264 + AAC) |
| 生成耗时 | 60–180 秒 |
| 支持比例 | 16:9、9:16、1:1 |
生成耗时 60–180 秒是主要取舍。H3 把质量和音画同步放在速度前面。如果你需要 30 秒内出结果,Gemini Omni Flash 更快,但输出的是无声视频。
定价拆解
H3 采用按次计费 + 时长分档:
| 时长 | 单条价格 | 音频 |
|---|---|---|
| 5 秒 | $0.30 | 包含 |
| 7 秒 | $0.50 | 包含 |
| 10 秒 | $0.80 | 包含 |
和”无声视频 + 单独配音”方案的对比:
| 方案 | 视频费 | 音频费 | 对齐成本 | 合计 |
|---|---|---|---|---|
| H3(10s) | $0.80 | $0.00 | $0.00 | $0.80 |
| Kling Pro(10s)+ TTS | $0.70 | $0.05–$0.15 | 代码维护 | $0.75–$0.85 |
| Kling Turbo(10s)+ TTS | $0.20 | $0.05–$0.15 | 代码维护 | $0.25–$0.35 |
成本差异在你算上音频对齐的开发工时之后会进一步缩小。对于需要音画一体输出的 agent,H3 消除了集成复杂度。
月度预算参考
| 月产量 | 5s 短片 | 10s 短片 | 混合(平均 7s) |
|---|---|---|---|
| 50 条 | $15 | $40 | $25 |
| 200 条 | $60 | $160 | $100 |
| 1,000 条 | $300 | $800 | $500 |
更多视频 API 的费用模型对比,见视频生成成本拆解。
通过 SandBase 调用
H3 通过 SandBase 的 OpenAI 兼容接口调用。文生视频示例:
import requests
import time
SANDBASE_API_KEY = "your-sandbase-api-key"
HEADERS = {
"Authorization": f"Bearer {SANDBASE_API_KEY}",
"Content-Type": "application/json",
}
# 文生视频——提交任务
submit = requests.post(
"https://api.sandbase.ai/v1/run",
headers=HEADERS,
json={
"model": "minimax/h3/text-to-video",
"prompt": "一只金毛犬在秋天的公园里奔跑穿过落叶,"
"脚踩落叶的沙沙声和远处的鸟鸣。低角度跟拍。",
"duration": 10,
"aspect_ratio": "16:9",
},
).json()
task_id = submit["id"]
# 轮询等待完成
while True:
result = requests.get(
f"https://api.sandbase.ai/v1/run/{task_id}",
headers={"Authorization": f"Bearer {SANDBASE_API_KEY}"},
).json()
if result["status"] in ("completed", "failed", "timeout"):
break
time.sleep(3)
video_url = result["outputs"][0]["url"]
print(f"视频地址: {video_url}")
图生视频——给产品图加动画:
# 图生视频:让产品图动起来
submit = requests.post(
"https://api.sandbase.ai/v1/run",
headers=HEADERS,
json={
"model": "minimax/h3/image-to-video",
"prompt": "运动鞋在反光台面上缓慢旋转,配轻柔的环境音乐和微弱的气流声。",
"image": "https://example.com/product-shoe.jpg",
"duration": 5,
},
).json()
task_id = submit["id"]
while True:
result = requests.get(
f"https://api.sandbase.ai/v1/run/{task_id}",
headers={"Authorization": f"Bearer {SANDBASE_API_KEY}"},
).json()
if result["status"] in ("completed", "failed", "timeout"):
break
time.sleep(3)
参考视频生成——风格迁移:
# 参考视频生成:从参考片段迁移动作和风格
submit = requests.post(
"https://api.sandbase.ai/v1/run",
headers=HEADERS,
json={
"model": "minimax/h3/reference-to-video",
"prompt": "把这段舞蹈动作迁移到一个卡通角色身上,保留参考视频的音乐节奏。",
"video": "https://example.com/reference-dance.mp4",
"duration": 7,
},
).json()
task_id = submit["id"]
while True:
result = requests.get(
f"https://api.sandbase.ai/v1/run/{task_id}",
headers={"Authorization": f"Bearer {SANDBASE_API_KEY}"},
).json()
if result["status"] in ("completed", "failed", "timeout"):
break
time.sleep(3)
画质表现
H3 的输出质量处于当前视频生成模型的上游水平:
强项:
- 音画同步是目前最好的——唇同步、环境声匹配、音乐节拍对齐比手动后处理效果好
- 10 秒片段内的运动连贯性好,复杂场景的”融化”伪影少
- 2K 输出是原生锐度,不是从低分辨率放大的
- 皮肤纹理和布料物理表现在中上水准
短板:
- 画面中的文字渲染(招牌、标签)仍然不稳定
- 快速运动镜头会有帧融合瑕疵
- 多人场景 7 秒后偶尔出现身份漂移
- 无法精细控制音频音量或混音比例(整体生成)
选型指南:H3 vs 其他
| 场景 | 推荐 | 原因 |
|---|---|---|
| 带旁白的广告素材 | H3 | 音画一体,一次调用 |
| 批量无声社媒短片 | Kling Turbo | 更便宜,不需要声音 |
| 延迟敏感流水线 | Gemini Omni Flash | 生成 10–30 秒 |
| 品牌高端片 | Kling Omni Pro | 画质天花板 |
| 产品图动画 | H3 图生视频 | 自动加环境声 |
| 风格动作迁移 | H3 参考视频 | 迁移视觉风格+音频氛围 |
| 预算极限批处理 | Kling Turbo Standard | $0.02/秒,最低成本 |
H3 在生态中的位置
H3 不是最便宜的视频模型,也不是最快的。它的价值很明确:原生音画生成砍掉了一整类集成工作。
对于做内容管线的 agent(广告素材、社媒内容、教学视频),单次调用音视频输出消除了:
- 音频生成的额外 API 调用
- 音视频同步对齐逻辑
- 时间对齐 bug
- 同步失败重试带来的额外开销
如果你的 agent 输出需要声音,H3 应该是默认选项。如果不需要声音,你就在为用不到的功能买单——看 Kling Turbo 或 Gemini Omni Flash。
核心要点
- H3 的差异化在音频 — 同一次生成过程出立体声,无需后处理
- 三种模式 覆盖大部分 agent 工作流:文生视频、图生视频、参考视频
- $0.30–$0.80/条 中档定价已包含音频(无额外音频 API 费用)
- 60–180 秒生成耗时 是为质量 + 音画同步付出的代价
- 最适合 需要声音的内容 agent(广告、教程、带旁白的社媒)
- 不适合 大批量无声片段或对延迟要求 < 30 秒的场景


