文生视频 vs 图生视频 vs 参考视频:AI 视频生成模式实战选型指南
三种视频生成模式的深度实战对比——文生视频、图生视频、参考视频生成——含电商批量制作、抖音/快手/小红书投放场景的成本、画质、控制力分析,附完整代码。
结论先行 — 文生视频(T2V)适合没有素材时的创意探索。图生视频(I2V)把已有图片变成视频,视觉控制力最强。参考视频生成(Ref2V)从一条样片迁移动作和风格。选错模式不是多花几毛钱的问题,而是浪费大量迭代时间——这是视频 Agent 工作流中最常见、也最容易避免的损耗。
问题一般在第三次生成时暴露。
有人为一条产品旋转广告选了文生视频,因为手头没有干净的产品图。跑了三次,花了 ¥6.5,鞋子颜色还是不对——模型老是把”午夜蓝”理解成藏青。如果一开始就用图生视频 + 手机随手拍的一张 ¥0 成本的产品照,一次就能出片,成本 ¥1.4。
做了六个不同场景的视频 Agent 之后,我找到了规律:**选错生成模式,是最常见、也最容易避免的浪费。**不是因为贵,而是因为错误的模式把 1 次调用变成了 3 次调用,出来的还更差。
左:T2V 第三次尝试——颜色偏移、比例不对。右:I2V 第一次就对——精确还原产品图。同样 $0.20 / 次。
这篇文章拆解三种模式各自的胜场、真实生产场景的费用计算,以及模式选择如何改变你的 Agent 架构设计。
三种模式速览
| 模式 | 输入 | 控制力 | 输出一致性 | 适合场景 |
|---|---|---|---|---|
| 文生视频(T2V) | 纯文本提示词 | 低——模型自由发挥 | 波动大 | 创意探索、无素材时的灵感发散 |
| 图生视频(I2V) | 图片 + 文本提示词 | 高——精确锁定视觉 | 高 | 电商产品视频、品牌一致性 |
| 参考视频(Ref2V) | 视频 + 文本提示词 | 中——迁移动作/风格 | 中高 | Campaign 变体、系列感统一 |
三个真实场景:暴露模式差异
场景 1:电商产品旋转视频——100 个 SKU,风格统一
你需要什么:为 100 款运动鞋生成 5 秒旋转视频,投放淘宝详情页和抖音橱窗。所有视频要求统一灯光、白底、相同旋转速度。
为什么 I2V 赢:你手里有产品图(每个电商店铺都有)。I2V 锁定源图的精确视觉——颜色、形状、纹理——只添加运动。T2V 需要你用文字描述每双鞋,而模型每次对颜色和比例的理解都不一样。
| 指标 | T2V 方案 | I2V 方案 |
|---|---|---|
| 每个 SKU 调用次数 | 2.5 次平均(颜色/形状不对需重试) | 1.0 次(90%+ 一次出片可用) |
| 总 API 调用 | 250 次 | 100 次 |
| 每条可用视频成本 | ¥3.5(2.5 × ¥1.4) | ¥1.4 |
| 整批总成本 | ¥350 | ¥140 |
| 每条生成耗时 | ~45s × 2.5 = ~112s | ~45s |
| 整批顺序执行时间 | ~7.8 小时 | ~1.25 小时 |
| 批次视觉一致性 | 4/10——每条视频长得不一样 | 9/10——只有运动不同 |
推荐模型:Kling 3.0 Turbo Pro,$0.20/5s(约 ¥1.4/条)。产品视频性价比最优。
平台适配:
- 抖音/快手橱窗:1:1 正方形,5s
- 淘宝详情页:3:4 竖版,5s
- 小红书笔记:9:16 全屏竖版,5–10s
场景 2:社交内容创意发散——没有素材,纯探索
你需要什么:为品牌夏季 Campaign 探索 10 个创意视频方向。没有产品图,没有参考视频。你在探索调性、情绪和视觉风格。
为什么 T2V 赢:你没有图片可以动画化。你在做的是产出创意方向,不是最终素材。T2V 让你描述抽象概念(“落日融化为海浪,液态金色调,梦幻慢动作”),获得意想不到的诠释。
| 指标 | T2V 方案 | I2V 方案 | Ref2V 方案 |
|---|---|---|---|
| 启动需要什么 | 只要提示词 | 需要先准备/找到 10 张源图 | 需要先找到/制作参考视频 |
| 10 个概念需要的调用 | 10–15 次(有些一次命中,有些需要微调) | 无法启动——没有输入 | 无法启动——没有输入 |
| 成本 | ¥10–¥30(取决于模型) | 被阻断 | 被阻断 |
| 每个概念生成时间 | ~2 分钟 | 不适用 | 不适用 |
| 创意多样性 | 高——每次生成都不一样 | 不适用 | 不适用 |
推荐模型:MiniMax H3,$0.30/5s(约 ¥2.1/条),自带音频——你能听到概念的感觉,不只是看到。或者用 Kling Turbo Standard $0.10/5s(约 ¥0.7/条)快速低成本迭代。
场景 3:一条主视频衍生 8 个平台版本
你需要什么:创意总监审批了一条 7 秒主视频。现在需要 8 个变体:同样的节奏和运动风格,但不同主体(纯产品、产品+模特、生活场景、抽象版本)和不同画幅适配抖音、快手、小红书、视频号横版流。
为什么 Ref2V 赢:参考视频本身就是创意方向。Ref2V 从审批通过的主视频中提取运动语言、节奏和能量,应用到新场景。每个变体继承同样的”感觉”,无需用文字重新描述。
| 指标 | T2V 方案 | I2V 方案 | Ref2V 方案 |
|---|---|---|---|
| 8 个变体的调用次数 | 20+(试图用文字匹配主视频的能量) | 无法——没有匹配运动的静图 | 8–10 次 |
| 成本 | ¥42+(20 × ¥2.1) | 不适用 | ¥17–¥28(8 × ¥2.1–¥3.5) |
| 生成时间 | ~10 分钟 + 人工审核 | 不适用 | ~4 分钟 |
| 与主视频一致性 | 3/10——文字无法捕捉运动感觉 | 不适用 | 8/10——运动 DNA 迁移 |
| 提示词复杂度 | 极高——需逆向还原主视频风格 | 不适用 | 低——“把这个运动用到 [新主体]” |
推荐模型:MiniMax H3 Ref2V,$0.30/5s 或 $0.80/7s。只有 H3 能同时迁移视觉风格和音频氛围。
中国平台画幅需求:
- 抖音/快手/视频号竖版:9:16(1080×1920)
- 小红书竖版笔记:3:4(1080×1440)或 9:16
- B 站横版:16:9(1920×1080)
- 朋友圈广告:1:1(1080×1080)
对比矩阵:同一任务,三种模式
任务:生成一条 5 秒的白色运动鞋旋转视频,中性背景。
| 维度 | T2V | I2V | Ref2V |
|---|---|---|---|
| 迭代到可用输出 | 3–4 次平均 | 1 次(一次出片可用) | 1–2 次(需要有旋转参考) |
| 每条可用视频成本 | ¥4.2–¥5.6 | ¥1.4 | ¥2.1–¥4.2 |
| 首次可用输出时间 | 2–3 分钟 | 45 秒 | 1–2 分钟 |
| 视觉一致性评分(1–10) | 3——颜色/形状每次都变 | 9——锁定源图 | 7——运动匹配但视觉可能漂移 |
| 提示词复杂度 | 高——需描述鞋子、灯光、背景、运动 | 低——“缓慢旋转,棚拍光” | 中——需要好的旋转参考 + 简短提示 |
| 含音频(H3) | ✅ 是 | ✅ 是 | ✅ 是 |
| 无需现有素材即可启动 | ✅ 是 | ❌ 需要源图 | ❌ 需要参考视频 |
关键洞察:I2V 每条可用视频成本比 T2V 低 70–75%——不是因为单次调用价格不同,而是因为消除了重试迭代。
架构分析:模式选择如何改变 Agent 设计
接下来这部分比大多数人意识到的更关键——很多人觉得模式选择只是”输出质量”的问题,然后纳闷为什么 T2V Agent 的费用比预期高 3 倍。这不是质量问题,是架构问题。
T2V 需要重试循环(因为输出不可预测),I2V 几乎都是单次通过。所以成本差异不只是单次价格,而是总调用次数。
你选的生成模式不只影响输出质量——它从根本上改变了 Agent 的状态机。
T2V Agent 架构:重试循环模式
┌─────────────┐ ┌─────────────┐ ┌──────────────┐ ┌─────────┐
│ 生成 │────▶│ 评估 │────▶│ 接受/拒绝 │────▶│ 输出 │
│ (API 调用) │◀────│ (Vision LLM)│ │ │ │ │
└─────────────┘ ↑ └─────────────┘ └──────────────┘ └─────────┘
│ │ 拒绝
│ ▼
│ ┌──────────────┐
└───│ 优化提示词 │
└──────────────┘
T2V 输出不可预测。你的 Agent 需要:
- 评估步骤:用 Vision LLM(GPT-4o、Claude)检查输出是否符合意图
- 重试预算:最多 3–5 次尝试,超出则降级或通知人工
- 提示词优化逻辑:失败后根据问题修改提示词
- 费用上限:硬性限制防止困难提示词的费用失控
# T2V Agent 状态机——重试循环
class T2VAgent:
MAX_RETRIES = 4
def generate(self, prompt: str, requirements: dict) -> str:
for attempt in range(self.MAX_RETRIES):
video_url = self.call_api(prompt)
score = self.evaluate(video_url, requirements)
if score >= 7:
return video_url
prompt = self.refine_prompt(prompt, score, attempt)
raise MaxRetriesExceeded(f"{self.MAX_RETRIES} 次尝试后仍未通过")
I2V Agent 架构:预处理流水线
┌──────────────┐ ┌──────────────┐ ┌─────────────┐ ┌─────────┐
│ 源图片 │────▶│ 预处理 │────▶│ 生成 │────▶│ 输出 │
│ │ │ (缩放, 抠图) │ │ (API 调用) │ │ │
└──────────────┘ └──────────────┘ └─────────────┘ └─────────┘
I2V 输出可预测——但输入图片必须到位。你的 Agent 需要:
- 图片预处理:缩放到模型最优分辨率,按需去背景/换背景
- 画幅适配逻辑:生成前匹配目标平台的比例(抖音 9:16、淘宝 3:4)
- 通常无需重试:准备好的图片首次成功率 85–95%
- 批量编排:结果可预测,100 条并发也不怕
# I2V Agent 状态机——预处理后生成
class I2VAgent:
def generate(self, image_url: str, motion_prompt: str, platform: str) -> str:
# 预处理:缩放、去背景、格式检查
target_ratio = self.get_platform_ratio(platform) # "9:16" for 抖音
processed_image = self.preprocess(image_url, target_ratio)
# 单次 API 调用——不需要重试循环
video_url = self.call_api(processed_image, motion_prompt)
return video_url
def get_platform_ratio(self, platform: str) -> str:
ratios = {
"douyin": "9:16", # 抖音
"kuaishou": "9:16", # 快手
"xiaohongshu": "3:4", # 小红书
"taobao": "3:4", # 淘宝详情页
"bilibili": "16:9", # B 站
}
return ratios.get(platform, "1:1")
Ref2V Agent 架构:参考库模式
┌──────────────┐ ┌──────────────┐ ┌─────────────┐ ┌─────────┐
│ 参考库 │────▶│ 选择最佳参考 │────▶│ 生成 │────▶│ 输出 │
│ │ │ │ │ (API 调用) │ │ │
└──────────────┘ └──────────────┘ └─────────────┘ └─────────┘
▲ │
│ │
└─── 将审批通过的输出存回参考库 ──────────────┘
Ref2V 需要管理一个参考视频库。你的 Agent 需要:
- 参考库:按运动类型打标签的审批通过的视频集合
- 选择逻辑:将请求的运动类型匹配到最佳参考
- 库增长:将审批通过的输出存回作为未来参考
- 元数据追踪:哪条参考产出了哪条输出(用于风格一致性审计)
# Ref2V Agent 状态机——参考库
class Ref2VAgent:
def __init__(self, reference_library: ReferenceLibrary):
self.library = reference_library
def generate(self, subject_prompt: str, motion_type: str) -> str:
# 从库中选择最佳参考
reference = self.library.find_best_match(motion_type)
# 使用参考生成
video_url = self.call_api(reference.url, subject_prompt)
# 可选:将输出存为新参考
self.library.add_if_approved(video_url, motion_type)
return video_url
架构选择对代码库的影响
| 架构关注点 | T2V | I2V | Ref2V |
|---|---|---|---|
| 外部依赖 | Vision LLM 做评估 | 图像处理库(Pillow) | 对象存储做参考库 |
| 状态管理 | 重试计数器、提示词历史 | 预处理图片缓存 | 参考索引、元数据库 |
| 错误处理 | N 次重试后优雅降级 | 图片验证失败 | 参考未找到、运动不匹配 |
| 成本可预测性 | 低——随重试次数波动 | 高——1 次调用 = 1 条输出 | 中——偶尔需要重试 |
| 并行能力 | 受限——单项需顺序重试 | 强——并发批处理 | 中——取决于参考选择 |
生产环境费用详算
电商 Agent:100 个 SKU 产品视频
I2V 方案(推荐):
- 100 SKU × ¥1.4/条(Kling Turbo Pro,5s)= 总计 ¥140
- 生成时间:~45s/条,可并行
- 实际产出:~92 条一次成功,~8 条需重试一次 = 108 次调用 = ¥151 实际
T2V 方案(不推荐用于此场景):
- 100 SKU × 2.5 次平均迭代 × ¥1.4 = 总计 ¥350
- 加上:Vision LLM 评估调用(100 × 2.5 × ¥0.07 = ¥17.5)
- 加上:时间浪费——250 次调用 × 45s = 3.1 小时顺序执行 vs I2V 的 1.25 小时
- 真实总成本:¥367.5 + 2.5 倍时间
用 I2V 节省:每批 ¥216(省 58%)+ 节省 1.85 小时
这对于淘宝、京东、拼多多的店铺来说意味着什么:一个 100 SKU 的店铺每季上新,用 I2V 一个下午搞定全部产品视频,总费用不到一顿团建餐。
Campaign 变体 Agent:从一条主视频衍生 8 个平台版本
Ref2V 方案(推荐):
- 8 变体 × ¥3.5/条(H3,7s 含音频)= 总计 ¥28
- 所有变体共享主视频的运动 DNA
- 预估 2 条需重试:10 次调用 × ¥3.5 = ¥35 实际
T2V 方案(不推荐用于此场景):
- 必须用文字逆向还原主视频的风格
- 8 变体 × 3 次平均迭代 × ¥2.1 = ¥50.4
- 加评估成本:¥1.7
- 加上:变体间运动感觉不一致
用 Ref2V 节省:每次 Campaign ¥17(省 33%)+ 一致性大幅提升
社交内容创意探索:10 个方向
T2V 方案(推荐):
- 10 个概念 × 1.3 次平均迭代 × ¥2.1(H3 含音频)= ¥27.3
- 或预算方案:10 × 1.3 × ¥0.7(Kling Turbo Standard)= ¥9.1
- 完全创意自由,H3 自带音频
音频维度:为什么它改变了社交视频的算法
MiniMax H3 原生生成同步音频——环境声、音乐、音效——作为视频生成过程的一部分。其他模型(Kling、Gemini)生成的是无声视频,需要额外步骤加音频。
为什么这对中国社交平台至关重要
在抖音、快手、小红书上,没有声音的视频几乎等于没有流量。 这些平台的算法对完播率极其敏感,而音频是用户停留的核心因素。BGM 不对、没有环境声,用户直接划走。
| 工作流 | 无原生音频 | 有原生音频(H3) |
|---|---|---|
| 从生成到可发布的步骤 | 生成视频 → 找/生成音频 → 同步 → 导出 | 生成视频(含音频)→ 直接发布 |
| 5s 社交片段成本 | ¥1.4(视频)+ ¥0.35–¥1.05(音频)= ¥1.75–¥2.45 | ¥2.1(全包) |
| 同步质量 | 人工或 AI 同步——经常有偏差 | 原生——一起生成,始终同步 |
| 创意连贯性 | 音频是事后加的 | 音频天然匹配画面情绪 |
各模式各模型音频对比
| 模型 | T2V 音频 | I2V 音频 | Ref2V 音频 |
|---|---|---|---|
| MiniMax H3 | ✅ 原生立体声(环境声 + 音效) | ✅ 原生立体声 | ✅ 从参考迁移音频氛围 |
| Kling 3.0 | ❌ 无声 | ❌ 无声 | 不适用(无 Ref2V) |
| Gemini Omni Flash | ❌ 无声 | ❌ 无声 | ❌ 无声(仅视觉风格) |
建议:如果你的输出是发抖音、快手、小红书——音频是必需品,不是加分项——H3 的原生音频省掉一个流水线步骤,且同步效果更好。如果是淘宝详情页、京东商品页那种自动静音播放的场景,Kling 的低价更划算。
生产中你会遇到的限制
T2V 限制
- 无法可靠还原品牌色:你说”潘通 485 红”,模型给你的可能是珊瑚色到深红之间的任意色。文字描述颜色,模型理解很松散。
- 主体身份不稳定:同一个”白色耐克 Air Max”提示词跑 5 次,出 5 双不同的鞋。没有身份锁定。
- 构图不可预测:你无法保证主体在画面的位置、背景的具体样子、镜头的运动方式。
- 需要高提示词技巧:想获得稳定结果需要提示词工程能力,大部分团队不具备。
I2V 限制
- 无法添加源图中没有的元素:如果源图没有展示鞋底,I2V 无法生成展示鞋底的旋转。它只能动画化已有的内容。
- 运动范围受源图限制:一张平铺产品图无法变成戏剧性的 360° 旋转——模型没有 3D 信息。
- 需要好的源图:模糊、低分辨率、光线差的源图出片质量差。垃圾进,垃圾出。
- 背景变化有限:源图的背景大体会保留。生成过程中无法轻易替换。
Ref2V 限制
- 运动迁移在差异大的主体间退化:人的舞蹈动作迁移到汽车上会很奇怪。参考主体和目标主体差异越大,迁移效果越差。
- 风格迁移可能压制内容:如果参考有很强的视觉风格(重调色、非常规打光),可能覆盖你的提示词指令。
- 模型支持有限:目前只有 H3 和 Gemini 支持 Ref2V。Kling 不支持。
- 参考质量天花板:你的输出不会超过参考视频的运动质量。差参考 = 差输出。
通用限制(所有模式)
- 视频中的文字和 Logo:所有当前模型都无法稳定渲染可读文字或可识别 Logo。计划在后期合成中添加。这对电商场景特别重要——价格标签、促销文字都需要后期叠加。
- 精确时间控制:你不能说”主体在 1.2s 入画,2.5s 转身,4.0s 出画”——模型不支持帧级时间指令。
- 物理准确度:复杂物理(布料模拟、流体动力学、碰撞)仍然不稳定。
- 时长限制:大部分模型单次生成上限 5–10 秒。更长内容需要多镜头拼接。
SandBase 作为运行时层
通过 SandBase 统一的 /v1/run 接口协议,你的 Agent 只需改变一个参数就能在 T2V、I2V 和 Ref2V 之间切换——无需更换 SDK,无需轮换鉴权。同一个端点、同一套轮询逻辑、同一个输出格式。
import requests, time
SANDBASE_API_KEY = "your-sandbase-api-key"
HEADERS = {
"Authorization": f"Bearer {SANDBASE_API_KEY}",
"Content-Type": "application/json",
}
def generate_video(mode: str, **kwargs) -> str:
"""一个函数通过 SandBase 统一协议处理所有三种模式。"""
# 模式只改变 model 字符串和输入参数
configs = {
"t2v": {
"model": "minimax/h3/text-to-video",
"payload": {"prompt": kwargs["prompt"], "duration": kwargs.get("duration", 5)},
},
"i2v": {
"model": "kwaivgi/kling-video/3.0/turbo-pro",
"payload": {
"prompt": kwargs["prompt"],
"image": kwargs["image"],
"duration": kwargs.get("duration", 5),
},
},
"ref2v": {
"model": "minimax/h3/reference-to-video",
"payload": {
"prompt": kwargs["prompt"],
"video": kwargs["video"],
"duration": kwargs.get("duration", 7),
},
},
}
config = configs[mode]
submit = requests.post(
"https://api.sandbase.ai/v1/run",
headers=HEADERS,
json={"model": config["model"], **config["payload"]},
).json()
task_id = submit["id"]
# 无论什么模式,轮询逻辑完全一样
while True:
result = requests.get(
f"https://api.sandbase.ai/v1/run/{task_id}",
headers={"Authorization": f"Bearer {SANDBASE_API_KEY}"},
).json()
if result["status"] in ("completed", "failed", "timeout"):
break
time.sleep(3)
if result["status"] == "completed":
return result["outputs"][0]["url"]
raise RuntimeError(f"生成失败: {result['status']}")
# 使用——切换模式只需改一个参数:
# 创意探索
video = generate_video("t2v", prompt="赛博朋克城市中的霓虹水母")
# 产品动画
video = generate_video("i2v", prompt="缓慢 360° 旋转", image="https://example.com/shoe.jpg")
# Campaign 变体
video = generate_video("ref2v", prompt="把这个节奏用到海边场景", video="https://example.com/hero.mp4")
对 Agent 开发者意味着什么:你的 Agent 路由逻辑根据可用输入和任务需求决定 T2V/I2V/Ref2V。API 层保持不变。你可以换模型(H3 → Kling → Gemini)或换模式(T2V → I2V)而不碰基础设施代码。
决策框架
你有起始图片吗?
├── 有 → 这张图就是你想动画化的内容吗?
│ ├── 是 → 用 I2V(完美保留视觉)
│ └── 否 → 你想大幅改变风格吗?
│ ├── 是 → 用 Ref2V + 风格参考,或 T2V 重新描述
│ └── 否 → 用 I2V + 运动指令
└── 没有 → 你有参考视频吗?
├── 有 → 你想要类似的运动/风格吗?
│ ├── 是 → 用 Ref2V
│ └── 否 → 用 T2V(忽略参考)
└── 没有 → 用 T2V(从文字创作)
预算敏感?
├── 每条可用输出成本最低 → I2V(更少重试)
├── 单次调用成本最低 → Kling Turbo Standard T2V(¥0.7/5s)
└── 需要含音频 → H3 任意模式(¥2.1/5s)
投放平台?
├── 抖音/快手/小红书(需要音频)→ 优先 H3
├── 淘宝/京东详情页(静音自动播放)→ Kling 性价比更高
└── B 站/视频号(需要横版)→ 注意设置 16:9 画幅
常见问题
1. I2V 一定比 T2V 便宜吗?
同模型的单次调用价格完全一样。但 I2V 的每条可用输出成本更低,因为很少需要重试。产品内容场景:I2V 平均 1.08 次调用出一条可用视频,T2V 平均 2.5 次。按 Kling Turbo Pro 的 ¥1.4/次计算,I2V 每条可用视频 ¥1.5 vs T2V 的 ¥3.5——节省 56%。
2. 能不能先 T2V 探索,再把满意的输出作为 Ref2V 的参考?
能——这是一个强力工作流。用 T2V 探索创意方向,找到满意的输出后,用它作为 Ref2V 的参考视频来生成一致的变体。成本:¥2.1–¥6.3 用于 T2V 探索 + ¥2.1–¥3.5 每条 Ref2V 变体。很多抖音代运营团队就是这么干的——先出一条爆款风格,再批量复制。
3. H3 的原生音频相比后期加音频能省多少?
社交内容批量场景:H3 ¥2.1/5s 含音频。无声生成(¥1.4 Kling)+ 单独音频生成(¥0.35–¥1.05)+ 同步工作 = ¥1.75–¥2.45 + 工程时间。H3 在原始成本上省 ¥0–¥0.35/条,但完全消除了音频流水线——100 条视频的批次,省掉 2–4 小时的流水线工程。更关键的是:原生音频的同步质量远高于后期拼接,抖音上的完播率差异显著。
4. 什么时候应该投资准备源图来用 I2V,而不是直接 T2V?
如果同一个主体需要生成 3 条以上视频,即使需要专门拍照也值得用 I2V。计算:3 条 × ¥3.5(T2V 含重试)= ¥10.5 vs ¥3.5(源图摊薄成本)+ 3 × ¥1.4(I2V)= ¥7.7。10 条时:T2V = ¥35,I2V = ¥17.5。对电商场景,你已经有产品图了——直接用 I2V 是无脑选择。
5. Ref2V 能在差异很大的主体间工作吗(人→产品,动物→车辆)?
部分可以。运动迁移在结构相似的主体间效果最好。人的舞蹈 → 人形机器人 = 优秀。人的舞蹈 → 运动鞋 = 差(运动无法逻辑映射)。但镜头运动迁移(平移、缩放、跟踪)对任何主体都有效。风格/色调迁移同样通用。经验法则:如果运动依赖身体结构,保持主体相似;如果依赖镜头语言或节奏,任何主体都行。
核心要点
- I2V 是生产主力 — 每条可用输出成本比 T2V 低 56%,适用于任何有源图的任务。电商批量视频、品牌动画首选。
- T2V 用于探索 — 没有素材时的最大创意自由。接受你会迭代的事实。
- Ref2V 用于规模一致性 — 一条审批通过的主视频变成整个 Campaign 的模板。运动 DNA 迁移无需重新描述。
- 音频改变社交视频的方程式 — H3 的原生音频省掉一个流水线步骤。投放抖音/快手/小红书时,把这个纳入模式/模型选择。
- 模式选择是架构决策 — T2V 需要重试循环,I2V 需要图片预处理,Ref2V 需要参考库。据此设计你的 Agent。
- 统一 API 让切换零成本 — 通过 SandBase 的
/v1/run协议,切换模式只是改一个参数。建设路由逻辑,不是多套集成。 - 了解限制 — 所有模式都处理不好文字/Logo,精确时间控制还不存在,Ref2V 运动迁移在差异大的主体间退化。
H3 三种模式的详细介绍见 MiniMax H3:原生 2K 立体声视频生成。Kling 的档位系统和多镜头能力见 Kling Video 3.0:统一多镜头视频生成。


