MiniMax H3:原生 2K 立体声视频生成

深入拆解 MiniMax H3 的原生 2K 立体声视频生成能力——音频+视频一次出,三种生成模式,以及与 Kling、Gemini 的成本对比。

结论先行 — MiniMax H3 一次 API 调用同时输出视频和同步立体声音频。支持三种模式(文生视频、图生视频、参考视频生成),原生 2K 分辨率输出,单条视频 $0.30–$0.80。不需要额外调 TTS 或音乐生成接口。

大多数视频生成 API 输出的是无声片段。你得先生成视频,再单独调一次 TTS 或音乐模型,然后自己写代码把音轨对齐。MiniMax H3 直接跳过了这条弯路:一次生成就输出带立体声音频的视频。

对 agent 来说这意味着什么?一次 API 调用代替三次,故障点更少,延迟更低,计费事件只有一个。下面拆解 H3 的实际能力、费用和选型建议。

H3 到底有什么不同

H3 是 MiniMax 的第三代视频模型。核心卖点:音频不是后挂的,而是和视频帧在同一个扩散过程中生成的

实际效果:

  • 提示词写”咖啡师在繁忙的咖啡店里打奶泡”,输出视频自带咖啡机声、环境嘈杂声和背景对话
  • 人物对话天然唇同步,不需要后处理
  • 音乐驱动的场景里,人物动作和节拍自然匹配

三种生成模式

H3 在 SandBase 上暴露了三个操作端点:

操作输入适合场景SandBase 模型 ID
文生视频文本提示词从零创意生成minimax/h3/text-to-video
图生视频图片 + 文本提示词产品图动画、静图动起来minimax/h3/image-to-video
参考视频生成参考视频 + 文本提示词风格/动作迁移minimax/h3/reference-to-video

三种模式都输出立体声音频,都支持最高 2K(2048×1080)分辨率。

技术规格

参数数值
最高分辨率2048 × 1080(2K 电影宽幅)
帧率24 fps
最长时长10 秒
音频立体声,44.1 kHz
输出格式MP4(H.264 + AAC)
生成耗时60–180 秒
支持比例16:9、9:16、1:1

生成耗时 60–180 秒是主要取舍。H3 把质量和音画同步放在速度前面。如果你需要 30 秒内出结果,Gemini Omni Flash 更快,但输出的是无声视频。

定价拆解

H3 采用按次计费 + 时长分档:

时长单条价格音频
5 秒$0.30包含
7 秒$0.50包含
10 秒$0.80包含

和”无声视频 + 单独配音”方案的对比:

方案视频费音频费对齐成本合计
H3(10s)$0.80$0.00$0.00$0.80
Kling Pro(10s)+ TTS$0.70$0.05–$0.15代码维护$0.75–$0.85
Kling Turbo(10s)+ TTS$0.20$0.05–$0.15代码维护$0.25–$0.35

成本差异在你算上音频对齐的开发工时之后会进一步缩小。对于需要音画一体输出的 agent,H3 消除了集成复杂度。

月度预算参考

月产量5s 短片10s 短片混合(平均 7s)
50 条$15$40$25
200 条$60$160$100
1,000 条$300$800$500

更多视频 API 的费用模型对比,见视频生成成本拆解

通过 SandBase 调用

H3 通过 SandBase 的 OpenAI 兼容接口调用。文生视频示例:

import requests
import time

SANDBASE_API_KEY = "your-sandbase-api-key"
HEADERS = {
    "Authorization": f"Bearer {SANDBASE_API_KEY}",
    "Content-Type": "application/json",
}

# 文生视频——提交任务
submit = requests.post(
    "https://api.sandbase.ai/v1/run",
    headers=HEADERS,
    json={
        "model": "minimax/h3/text-to-video",
        "prompt": "一只金毛犬在秋天的公园里奔跑穿过落叶,"
                  "脚踩落叶的沙沙声和远处的鸟鸣。低角度跟拍。",
        "duration": 10,
        "aspect_ratio": "16:9",
    },
).json()
task_id = submit["id"]

# 轮询等待完成
while True:
    result = requests.get(
        f"https://api.sandbase.ai/v1/run/{task_id}",
        headers={"Authorization": f"Bearer {SANDBASE_API_KEY}"},
    ).json()
    if result["status"] in ("completed", "failed", "timeout"):
        break
    time.sleep(3)

video_url = result["outputs"][0]["url"]
print(f"视频地址: {video_url}")

图生视频——给产品图加动画:

# 图生视频:让产品图动起来
submit = requests.post(
    "https://api.sandbase.ai/v1/run",
    headers=HEADERS,
    json={
        "model": "minimax/h3/image-to-video",
        "prompt": "运动鞋在反光台面上缓慢旋转,配轻柔的环境音乐和微弱的气流声。",
        "image": "https://example.com/product-shoe.jpg",
        "duration": 5,
    },
).json()
task_id = submit["id"]

while True:
    result = requests.get(
        f"https://api.sandbase.ai/v1/run/{task_id}",
        headers={"Authorization": f"Bearer {SANDBASE_API_KEY}"},
    ).json()
    if result["status"] in ("completed", "failed", "timeout"):
        break
    time.sleep(3)

参考视频生成——风格迁移:

# 参考视频生成:从参考片段迁移动作和风格
submit = requests.post(
    "https://api.sandbase.ai/v1/run",
    headers=HEADERS,
    json={
        "model": "minimax/h3/reference-to-video",
        "prompt": "把这段舞蹈动作迁移到一个卡通角色身上,保留参考视频的音乐节奏。",
        "video": "https://example.com/reference-dance.mp4",
        "duration": 7,
    },
).json()
task_id = submit["id"]

while True:
    result = requests.get(
        f"https://api.sandbase.ai/v1/run/{task_id}",
        headers={"Authorization": f"Bearer {SANDBASE_API_KEY}"},
    ).json()
    if result["status"] in ("completed", "failed", "timeout"):
        break
    time.sleep(3)

画质表现

H3 的输出质量处于当前视频生成模型的上游水平:

强项:

  • 音画同步是目前最好的——唇同步、环境声匹配、音乐节拍对齐比手动后处理效果好
  • 10 秒片段内的运动连贯性好,复杂场景的”融化”伪影少
  • 2K 输出是原生锐度,不是从低分辨率放大的
  • 皮肤纹理和布料物理表现在中上水准

短板:

  • 画面中的文字渲染(招牌、标签)仍然不稳定
  • 快速运动镜头会有帧融合瑕疵
  • 多人场景 7 秒后偶尔出现身份漂移
  • 无法精细控制音频音量或混音比例(整体生成)

选型指南:H3 vs 其他

场景推荐原因
带旁白的广告素材H3音画一体,一次调用
批量无声社媒短片Kling Turbo更便宜,不需要声音
延迟敏感流水线Gemini Omni Flash生成 10–30 秒
品牌高端片Kling Omni Pro画质天花板
产品图动画H3 图生视频自动加环境声
风格动作迁移H3 参考视频迁移视觉风格+音频氛围
预算极限批处理Kling Turbo Standard$0.02/秒,最低成本

H3 在生态中的位置

H3 不是最便宜的视频模型,也不是最快的。它的价值很明确:原生音画生成砍掉了一整类集成工作

对于做内容管线的 agent(广告素材、社媒内容、教学视频),单次调用音视频输出消除了:

  • 音频生成的额外 API 调用
  • 音视频同步对齐逻辑
  • 时间对齐 bug
  • 同步失败重试带来的额外开销

如果你的 agent 输出需要声音,H3 应该是默认选项。如果不需要声音,你就在为用不到的功能买单——看 Kling Turbo 或 Gemini Omni Flash。

核心要点

  1. H3 的差异化在音频 — 同一次生成过程出立体声,无需后处理
  2. 三种模式 覆盖大部分 agent 工作流:文生视频、图生视频、参考视频
  3. $0.30–$0.80/条 中档定价已包含音频(无额外音频 API 费用)
  4. 60–180 秒生成耗时 是为质量 + 音画同步付出的代价
  5. 最适合 需要声音的内容 agent(广告、教程、带旁白的社媒)
  6. 不适合 大批量无声片段或对延迟要求 < 30 秒的场景