文生视频 vs 图生视频 vs 参考视频:AI 视频生成模式实战选型指南

三种视频生成模式的深度实战对比——文生视频、图生视频、参考视频生成——含电商批量制作、抖音/快手/小红书投放场景的成本、画质、控制力分析,附完整代码。

结论先行 — 文生视频(T2V)适合没有素材时的创意探索。图生视频(I2V)把已有图片变成视频,视觉控制力最强。参考视频生成(Ref2V)从一条样片迁移动作和风格。选错模式不是多花几毛钱的问题,而是浪费大量迭代时间——这是视频 Agent 工作流中最常见、也最容易避免的损耗。

问题一般在第三次生成时暴露。

有人为一条产品旋转广告选了文生视频,因为手头没有干净的产品图。跑了三次,花了 ¥6.5,鞋子颜色还是不对——模型老是把”午夜蓝”理解成藏青。如果一开始就用图生视频 + 手机随手拍的一张 ¥0 成本的产品照,一次就能出片,成本 ¥1.4。

做了六个不同场景的视频 Agent 之后,我找到了规律:**选错生成模式,是最常见、也最容易避免的浪费。**不是因为贵,而是因为错误的模式把 1 次调用变成了 3 次调用,出来的还更差。

T2V vs I2V 对比截图:同一双运动鞋的生成结果 左:T2V 第三次尝试——颜色偏移、比例不对。右:I2V 第一次就对——精确还原产品图。同样 $0.20 / 次。

这篇文章拆解三种模式各自的胜场、真实生产场景的费用计算,以及模式选择如何改变你的 Agent 架构设计。

三种模式速览

模式输入控制力输出一致性适合场景
文生视频(T2V)纯文本提示词低——模型自由发挥波动大创意探索、无素材时的灵感发散
图生视频(I2V)图片 + 文本提示词高——精确锁定视觉电商产品视频、品牌一致性
参考视频(Ref2V)视频 + 文本提示词中——迁移动作/风格中高Campaign 变体、系列感统一

三个真实场景:暴露模式差异

场景 1:电商产品旋转视频——100 个 SKU,风格统一

你需要什么:为 100 款运动鞋生成 5 秒旋转视频,投放淘宝详情页和抖音橱窗。所有视频要求统一灯光、白底、相同旋转速度。

为什么 I2V 赢:你手里有产品图(每个电商店铺都有)。I2V 锁定源图的精确视觉——颜色、形状、纹理——只添加运动。T2V 需要你用文字描述每双鞋,而模型每次对颜色和比例的理解都不一样。

指标T2V 方案I2V 方案
每个 SKU 调用次数2.5 次平均(颜色/形状不对需重试)1.0 次(90%+ 一次出片可用)
总 API 调用250 次100 次
每条可用视频成本¥3.5(2.5 × ¥1.4)¥1.4
整批总成本¥350¥140
每条生成耗时~45s × 2.5 = ~112s~45s
整批顺序执行时间~7.8 小时~1.25 小时
批次视觉一致性4/10——每条视频长得不一样9/10——只有运动不同

推荐模型:Kling 3.0 Turbo Pro,$0.20/5s(约 ¥1.4/条)。产品视频性价比最优。

平台适配

  • 抖音/快手橱窗:1:1 正方形,5s
  • 淘宝详情页:3:4 竖版,5s
  • 小红书笔记:9:16 全屏竖版,5–10s

场景 2:社交内容创意发散——没有素材,纯探索

你需要什么:为品牌夏季 Campaign 探索 10 个创意视频方向。没有产品图,没有参考视频。你在探索调性、情绪和视觉风格。

为什么 T2V 赢:你没有图片可以动画化。你在做的是产出创意方向,不是最终素材。T2V 让你描述抽象概念(“落日融化为海浪,液态金色调,梦幻慢动作”),获得意想不到的诠释。

指标T2V 方案I2V 方案Ref2V 方案
启动需要什么只要提示词需要先准备/找到 10 张源图需要先找到/制作参考视频
10 个概念需要的调用10–15 次(有些一次命中,有些需要微调)无法启动——没有输入无法启动——没有输入
成本¥10–¥30(取决于模型)被阻断被阻断
每个概念生成时间~2 分钟不适用不适用
创意多样性高——每次生成都不一样不适用不适用

推荐模型:MiniMax H3,$0.30/5s(约 ¥2.1/条),自带音频——你能听到概念的感觉,不只是看到。或者用 Kling Turbo Standard $0.10/5s(约 ¥0.7/条)快速低成本迭代。

场景 3:一条主视频衍生 8 个平台版本

你需要什么:创意总监审批了一条 7 秒主视频。现在需要 8 个变体:同样的节奏和运动风格,但不同主体(纯产品、产品+模特、生活场景、抽象版本)和不同画幅适配抖音、快手、小红书、视频号横版流。

为什么 Ref2V 赢:参考视频本身就是创意方向。Ref2V 从审批通过的主视频中提取运动语言、节奏和能量,应用到新场景。每个变体继承同样的”感觉”,无需用文字重新描述。

指标T2V 方案I2V 方案Ref2V 方案
8 个变体的调用次数20+(试图用文字匹配主视频的能量)无法——没有匹配运动的静图8–10 次
成本¥42+(20 × ¥2.1)不适用¥17–¥28(8 × ¥2.1–¥3.5)
生成时间~10 分钟 + 人工审核不适用~4 分钟
与主视频一致性3/10——文字无法捕捉运动感觉不适用8/10——运动 DNA 迁移
提示词复杂度极高——需逆向还原主视频风格不适用低——“把这个运动用到 [新主体]”

推荐模型:MiniMax H3 Ref2V,$0.30/5s 或 $0.80/7s。只有 H3 能同时迁移视觉风格和音频氛围。

中国平台画幅需求

  • 抖音/快手/视频号竖版:9:16(1080×1920)
  • 小红书竖版笔记:3:4(1080×1440)或 9:16
  • B 站横版:16:9(1920×1080)
  • 朋友圈广告:1:1(1080×1080)

对比矩阵:同一任务,三种模式

任务:生成一条 5 秒的白色运动鞋旋转视频,中性背景。

维度T2VI2VRef2V
迭代到可用输出3–4 次平均1 次(一次出片可用)1–2 次(需要有旋转参考)
每条可用视频成本¥4.2–¥5.6¥1.4¥2.1–¥4.2
首次可用输出时间2–3 分钟45 秒1–2 分钟
视觉一致性评分(1–10)3——颜色/形状每次都变9——锁定源图7——运动匹配但视觉可能漂移
提示词复杂度高——需描述鞋子、灯光、背景、运动低——“缓慢旋转,棚拍光”中——需要好的旋转参考 + 简短提示
含音频(H3)✅ 是✅ 是✅ 是
无需现有素材即可启动✅ 是❌ 需要源图❌ 需要参考视频

关键洞察:I2V 每条可用视频成本比 T2V 低 70–75%——不是因为单次调用价格不同,而是因为消除了重试迭代。

架构分析:模式选择如何改变 Agent 设计

接下来这部分比大多数人意识到的更关键——很多人觉得模式选择只是”输出质量”的问题,然后纳闷为什么 T2V Agent 的费用比预期高 3 倍。这不是质量问题,是架构问题。

T2V(带重试循环)vs I2V(单次通过)的 Agent 状态机对比 T2V 需要重试循环(因为输出不可预测),I2V 几乎都是单次通过。所以成本差异不只是单次价格,而是总调用次数。

你选的生成模式不只影响输出质量——它从根本上改变了 Agent 的状态机。

T2V Agent 架构:重试循环模式

┌─────────────┐     ┌─────────────┐     ┌──────────────┐     ┌─────────┐
│ 生成         │────▶│ 评估         │────▶│ 接受/拒绝     │────▶│ 输出    │
│ (API 调用)   │◀────│ (Vision LLM)│     │              │     │         │
└─────────────┘  ↑  └─────────────┘     └──────────────┘     └─────────┘
                 │         │ 拒绝
                 │         ▼
                 │   ┌──────────────┐
                 └───│ 优化提示词    │
                     └──────────────┘

T2V 输出不可预测。你的 Agent 需要:

  • 评估步骤:用 Vision LLM(GPT-4o、Claude)检查输出是否符合意图
  • 重试预算:最多 3–5 次尝试,超出则降级或通知人工
  • 提示词优化逻辑:失败后根据问题修改提示词
  • 费用上限:硬性限制防止困难提示词的费用失控
# T2V Agent 状态机——重试循环
class T2VAgent:
    MAX_RETRIES = 4
    
    def generate(self, prompt: str, requirements: dict) -> str:
        for attempt in range(self.MAX_RETRIES):
            video_url = self.call_api(prompt)
            score = self.evaluate(video_url, requirements)
            if score >= 7:
                return video_url
            prompt = self.refine_prompt(prompt, score, attempt)
        raise MaxRetriesExceeded(f"{self.MAX_RETRIES} 次尝试后仍未通过")

I2V Agent 架构:预处理流水线

┌──────────────┐     ┌──────────────┐     ┌─────────────┐     ┌─────────┐
│ 源图片       │────▶│ 预处理        │────▶│ 生成         │────▶│ 输出    │
│              │     │ (缩放, 抠图) │     │ (API 调用)   │     │         │
└──────────────┘     └──────────────┘     └─────────────┘     └─────────┘

I2V 输出可预测——但输入图片必须到位。你的 Agent 需要:

  • 图片预处理:缩放到模型最优分辨率,按需去背景/换背景
  • 画幅适配逻辑:生成前匹配目标平台的比例(抖音 9:16、淘宝 3:4)
  • 通常无需重试:准备好的图片首次成功率 85–95%
  • 批量编排:结果可预测,100 条并发也不怕
# I2V Agent 状态机——预处理后生成
class I2VAgent:
    def generate(self, image_url: str, motion_prompt: str, platform: str) -> str:
        # 预处理:缩放、去背景、格式检查
        target_ratio = self.get_platform_ratio(platform)  # "9:16" for 抖音
        processed_image = self.preprocess(image_url, target_ratio)
        # 单次 API 调用——不需要重试循环
        video_url = self.call_api(processed_image, motion_prompt)
        return video_url
    
    def get_platform_ratio(self, platform: str) -> str:
        ratios = {
            "douyin": "9:16",     # 抖音
            "kuaishou": "9:16",   # 快手
            "xiaohongshu": "3:4", # 小红书
            "taobao": "3:4",     # 淘宝详情页
            "bilibili": "16:9",  # B 站
        }
        return ratios.get(platform, "1:1")

Ref2V Agent 架构:参考库模式

┌──────────────┐     ┌──────────────┐     ┌─────────────┐     ┌─────────┐
│ 参考库       │────▶│ 选择最佳参考  │────▶│ 生成         │────▶│ 输出    │
│              │     │              │     │ (API 调用)   │     │         │
└──────────────┘     └──────────────┘     └─────────────┘     └─────────┘
       ▲                                         │
       │                                         │
       └─── 将审批通过的输出存回参考库 ──────────────┘

Ref2V 需要管理一个参考视频库。你的 Agent 需要:

  • 参考库:按运动类型打标签的审批通过的视频集合
  • 选择逻辑:将请求的运动类型匹配到最佳参考
  • 库增长:将审批通过的输出存回作为未来参考
  • 元数据追踪:哪条参考产出了哪条输出(用于风格一致性审计)
# Ref2V Agent 状态机——参考库
class Ref2VAgent:
    def __init__(self, reference_library: ReferenceLibrary):
        self.library = reference_library
    
    def generate(self, subject_prompt: str, motion_type: str) -> str:
        # 从库中选择最佳参考
        reference = self.library.find_best_match(motion_type)
        # 使用参考生成
        video_url = self.call_api(reference.url, subject_prompt)
        # 可选:将输出存为新参考
        self.library.add_if_approved(video_url, motion_type)
        return video_url

架构选择对代码库的影响

架构关注点T2VI2VRef2V
外部依赖Vision LLM 做评估图像处理库(Pillow)对象存储做参考库
状态管理重试计数器、提示词历史预处理图片缓存参考索引、元数据库
错误处理N 次重试后优雅降级图片验证失败参考未找到、运动不匹配
成本可预测性低——随重试次数波动高——1 次调用 = 1 条输出中——偶尔需要重试
并行能力受限——单项需顺序重试强——并发批处理中——取决于参考选择

生产环境费用详算

电商 Agent:100 个 SKU 产品视频

I2V 方案(推荐)

  • 100 SKU × ¥1.4/条(Kling Turbo Pro,5s)= 总计 ¥140
  • 生成时间:~45s/条,可并行
  • 实际产出:~92 条一次成功,~8 条需重试一次 = 108 次调用 = ¥151 实际

T2V 方案(不推荐用于此场景)

  • 100 SKU × 2.5 次平均迭代 × ¥1.4 = 总计 ¥350
  • 加上:Vision LLM 评估调用(100 × 2.5 × ¥0.07 = ¥17.5)
  • 加上:时间浪费——250 次调用 × 45s = 3.1 小时顺序执行 vs I2V 的 1.25 小时
  • 真实总成本:¥367.5 + 2.5 倍时间

用 I2V 节省:每批 ¥216(省 58%)+ 节省 1.85 小时

这对于淘宝、京东、拼多多的店铺来说意味着什么:一个 100 SKU 的店铺每季上新,用 I2V 一个下午搞定全部产品视频,总费用不到一顿团建餐。

Campaign 变体 Agent:从一条主视频衍生 8 个平台版本

Ref2V 方案(推荐)

  • 8 变体 × ¥3.5/条(H3,7s 含音频)= 总计 ¥28
  • 所有变体共享主视频的运动 DNA
  • 预估 2 条需重试:10 次调用 × ¥3.5 = ¥35 实际

T2V 方案(不推荐用于此场景)

  • 必须用文字逆向还原主视频的风格
  • 8 变体 × 3 次平均迭代 × ¥2.1 = ¥50.4
  • 加评估成本:¥1.7
  • 加上:变体间运动感觉不一致

用 Ref2V 节省:每次 Campaign ¥17(省 33%)+ 一致性大幅提升

社交内容创意探索:10 个方向

T2V 方案(推荐)

  • 10 个概念 × 1.3 次平均迭代 × ¥2.1(H3 含音频)= ¥27.3
  • 或预算方案:10 × 1.3 × ¥0.7(Kling Turbo Standard)= ¥9.1
  • 完全创意自由,H3 自带音频

音频维度:为什么它改变了社交视频的算法

MiniMax H3 原生生成同步音频——环境声、音乐、音效——作为视频生成过程的一部分。其他模型(Kling、Gemini)生成的是无声视频,需要额外步骤加音频。

为什么这对中国社交平台至关重要

在抖音、快手、小红书上,没有声音的视频几乎等于没有流量。 这些平台的算法对完播率极其敏感,而音频是用户停留的核心因素。BGM 不对、没有环境声,用户直接划走。

工作流无原生音频有原生音频(H3)
从生成到可发布的步骤生成视频 → 找/生成音频 → 同步 → 导出生成视频(含音频)→ 直接发布
5s 社交片段成本¥1.4(视频)+ ¥0.35–¥1.05(音频)= ¥1.75–¥2.45¥2.1(全包)
同步质量人工或 AI 同步——经常有偏差原生——一起生成,始终同步
创意连贯性音频是事后加的音频天然匹配画面情绪

各模式各模型音频对比

模型T2V 音频I2V 音频Ref2V 音频
MiniMax H3✅ 原生立体声(环境声 + 音效)✅ 原生立体声✅ 从参考迁移音频氛围
Kling 3.0❌ 无声❌ 无声不适用(无 Ref2V)
Gemini Omni Flash❌ 无声❌ 无声❌ 无声(仅视觉风格)

建议:如果你的输出是发抖音、快手、小红书——音频是必需品,不是加分项——H3 的原生音频省掉一个流水线步骤,且同步效果更好。如果是淘宝详情页、京东商品页那种自动静音播放的场景,Kling 的低价更划算。

生产中你会遇到的限制

T2V 限制

  • 无法可靠还原品牌色:你说”潘通 485 红”,模型给你的可能是珊瑚色到深红之间的任意色。文字描述颜色,模型理解很松散。
  • 主体身份不稳定:同一个”白色耐克 Air Max”提示词跑 5 次,出 5 双不同的鞋。没有身份锁定。
  • 构图不可预测:你无法保证主体在画面的位置、背景的具体样子、镜头的运动方式。
  • 需要高提示词技巧:想获得稳定结果需要提示词工程能力,大部分团队不具备。

I2V 限制

  • 无法添加源图中没有的元素:如果源图没有展示鞋底,I2V 无法生成展示鞋底的旋转。它只能动画化已有的内容。
  • 运动范围受源图限制:一张平铺产品图无法变成戏剧性的 360° 旋转——模型没有 3D 信息。
  • 需要好的源图:模糊、低分辨率、光线差的源图出片质量差。垃圾进,垃圾出。
  • 背景变化有限:源图的背景大体会保留。生成过程中无法轻易替换。

Ref2V 限制

  • 运动迁移在差异大的主体间退化:人的舞蹈动作迁移到汽车上会很奇怪。参考主体和目标主体差异越大,迁移效果越差。
  • 风格迁移可能压制内容:如果参考有很强的视觉风格(重调色、非常规打光),可能覆盖你的提示词指令。
  • 模型支持有限:目前只有 H3 和 Gemini 支持 Ref2V。Kling 不支持。
  • 参考质量天花板:你的输出不会超过参考视频的运动质量。差参考 = 差输出。

通用限制(所有模式)

  • 视频中的文字和 Logo:所有当前模型都无法稳定渲染可读文字或可识别 Logo。计划在后期合成中添加。这对电商场景特别重要——价格标签、促销文字都需要后期叠加。
  • 精确时间控制:你不能说”主体在 1.2s 入画,2.5s 转身,4.0s 出画”——模型不支持帧级时间指令。
  • 物理准确度:复杂物理(布料模拟、流体动力学、碰撞)仍然不稳定。
  • 时长限制:大部分模型单次生成上限 5–10 秒。更长内容需要多镜头拼接。

SandBase 作为运行时层

通过 SandBase 统一的 /v1/run 接口协议,你的 Agent 只需改变一个参数就能在 T2V、I2V 和 Ref2V 之间切换——无需更换 SDK,无需轮换鉴权。同一个端点、同一套轮询逻辑、同一个输出格式。

import requests, time

SANDBASE_API_KEY = "your-sandbase-api-key"
HEADERS = {
    "Authorization": f"Bearer {SANDBASE_API_KEY}",
    "Content-Type": "application/json",
}

def generate_video(mode: str, **kwargs) -> str:
    """一个函数通过 SandBase 统一协议处理所有三种模式。"""
    
    # 模式只改变 model 字符串和输入参数
    configs = {
        "t2v": {
            "model": "minimax/h3/text-to-video",
            "payload": {"prompt": kwargs["prompt"], "duration": kwargs.get("duration", 5)},
        },
        "i2v": {
            "model": "kwaivgi/kling-video/3.0/turbo-pro",
            "payload": {
                "prompt": kwargs["prompt"],
                "image": kwargs["image"],
                "duration": kwargs.get("duration", 5),
            },
        },
        "ref2v": {
            "model": "minimax/h3/reference-to-video",
            "payload": {
                "prompt": kwargs["prompt"],
                "video": kwargs["video"],
                "duration": kwargs.get("duration", 7),
            },
        },
    }
    
    config = configs[mode]
    submit = requests.post(
        "https://api.sandbase.ai/v1/run",
        headers=HEADERS,
        json={"model": config["model"], **config["payload"]},
    ).json()
    task_id = submit["id"]
    
    # 无论什么模式,轮询逻辑完全一样
    while True:
        result = requests.get(
            f"https://api.sandbase.ai/v1/run/{task_id}",
            headers={"Authorization": f"Bearer {SANDBASE_API_KEY}"},
        ).json()
        if result["status"] in ("completed", "failed", "timeout"):
            break
        time.sleep(3)
    
    if result["status"] == "completed":
        return result["outputs"][0]["url"]
    raise RuntimeError(f"生成失败: {result['status']}")


# 使用——切换模式只需改一个参数:
# 创意探索
video = generate_video("t2v", prompt="赛博朋克城市中的霓虹水母")

# 产品动画
video = generate_video("i2v", prompt="缓慢 360° 旋转", image="https://example.com/shoe.jpg")

# Campaign 变体
video = generate_video("ref2v", prompt="把这个节奏用到海边场景", video="https://example.com/hero.mp4")

对 Agent 开发者意味着什么:你的 Agent 路由逻辑根据可用输入和任务需求决定 T2V/I2V/Ref2V。API 层保持不变。你可以换模型(H3 → Kling → Gemini)或换模式(T2V → I2V)而不碰基础设施代码。

决策框架

你有起始图片吗?
├── 有 → 这张图就是你想动画化的内容吗?
│   ├── 是 → 用 I2V(完美保留视觉)
│   └── 否 → 你想大幅改变风格吗?
│       ├── 是 → 用 Ref2V + 风格参考,或 T2V 重新描述
│       └── 否 → 用 I2V + 运动指令
└── 没有 → 你有参考视频吗?
    ├── 有 → 你想要类似的运动/风格吗?
    │   ├── 是 → 用 Ref2V
    │   └── 否 → 用 T2V(忽略参考)
    └── 没有 → 用 T2V(从文字创作)

预算敏感?
├── 每条可用输出成本最低 → I2V(更少重试)
├── 单次调用成本最低 → Kling Turbo Standard T2V(¥0.7/5s)
└── 需要含音频 → H3 任意模式(¥2.1/5s)

投放平台?
├── 抖音/快手/小红书(需要音频)→ 优先 H3
├── 淘宝/京东详情页(静音自动播放)→ Kling 性价比更高
└── B 站/视频号(需要横版)→ 注意设置 16:9 画幅

常见问题

1. I2V 一定比 T2V 便宜吗?

同模型的单次调用价格完全一样。但 I2V 的每条可用输出成本更低,因为很少需要重试。产品内容场景:I2V 平均 1.08 次调用出一条可用视频,T2V 平均 2.5 次。按 Kling Turbo Pro 的 ¥1.4/次计算,I2V 每条可用视频 ¥1.5 vs T2V 的 ¥3.5——节省 56%。

2. 能不能先 T2V 探索,再把满意的输出作为 Ref2V 的参考?

能——这是一个强力工作流。用 T2V 探索创意方向,找到满意的输出后,用它作为 Ref2V 的参考视频来生成一致的变体。成本:¥2.1–¥6.3 用于 T2V 探索 + ¥2.1–¥3.5 每条 Ref2V 变体。很多抖音代运营团队就是这么干的——先出一条爆款风格,再批量复制。

3. H3 的原生音频相比后期加音频能省多少?

社交内容批量场景:H3 ¥2.1/5s 含音频。无声生成(¥1.4 Kling)+ 单独音频生成(¥0.35–¥1.05)+ 同步工作 = ¥1.75–¥2.45 + 工程时间。H3 在原始成本上省 ¥0–¥0.35/条,但完全消除了音频流水线——100 条视频的批次,省掉 2–4 小时的流水线工程。更关键的是:原生音频的同步质量远高于后期拼接,抖音上的完播率差异显著。

4. 什么时候应该投资准备源图来用 I2V,而不是直接 T2V?

如果同一个主体需要生成 3 条以上视频,即使需要专门拍照也值得用 I2V。计算:3 条 × ¥3.5(T2V 含重试)= ¥10.5 vs ¥3.5(源图摊薄成本)+ 3 × ¥1.4(I2V)= ¥7.7。10 条时:T2V = ¥35,I2V = ¥17.5。对电商场景,你已经有产品图了——直接用 I2V 是无脑选择。

5. Ref2V 能在差异很大的主体间工作吗(人→产品,动物→车辆)?

部分可以。运动迁移在结构相似的主体间效果最好。人的舞蹈 → 人形机器人 = 优秀。人的舞蹈 → 运动鞋 = 差(运动无法逻辑映射)。但镜头运动迁移(平移、缩放、跟踪)对任何主体都有效。风格/色调迁移同样通用。经验法则:如果运动依赖身体结构,保持主体相似;如果依赖镜头语言或节奏,任何主体都行。

核心要点

  1. I2V 是生产主力 — 每条可用输出成本比 T2V 低 56%,适用于任何有源图的任务。电商批量视频、品牌动画首选。
  2. T2V 用于探索 — 没有素材时的最大创意自由。接受你会迭代的事实。
  3. Ref2V 用于规模一致性 — 一条审批通过的主视频变成整个 Campaign 的模板。运动 DNA 迁移无需重新描述。
  4. 音频改变社交视频的方程式 — H3 的原生音频省掉一个流水线步骤。投放抖音/快手/小红书时,把这个纳入模式/模型选择。
  5. 模式选择是架构决策 — T2V 需要重试循环,I2V 需要图片预处理,Ref2V 需要参考库。据此设计你的 Agent。
  6. 统一 API 让切换零成本 — 通过 SandBase 的 /v1/run 协议,切换模式只是改一个参数。建设路由逻辑,不是多套集成。
  7. 了解限制 — 所有模式都处理不好文字/Logo,精确时间控制还不存在,Ref2V 运动迁移在差异大的主体间退化。

H3 三种模式的详细介绍见 MiniMax H3:原生 2K 立体声视频生成。Kling 的档位系统和多镜头能力见 Kling Video 3.0:统一多镜头视频生成