抽卡式生成的结构性问题

纯文字生成视频,本质是让模型同时决定三件事:画面里有什么(内容)、镜头怎么摆(构图)、动作怎么走(运动)。三件事都不确定,每生成一次就是一次全新的随机组合。这带来三个后果:

  • 命中率低:意图到画面的翻译链条太长,每次roll都是重新掷骰子;
  • 不可累积:roll 出一段 80 分的,无法在它基础上改进,只能继续roll碰 90 分;
  • 无法成剧:单段视频好看没用,镜头之间接不上——角色换了脸,场景换了光。

问题不在模型不够好,而在把所有自由度都交给了模型。可控的做法是把自由度分层:人决定关键状态,模型补过程。

关键帧驱动:把不确定性关进两帧之间

关键帧驱动的流程只有三步:

  1. 生成起始帧:受角色定妆照、场景概念图、道具参考约束,确定镜头开始时的确切画面;
  2. 生成结束帧:同样的约束体系,确定镜头结束时的画面;
  3. 插值生成:模型在两帧之间生成平滑的视频过渡。

起点和终点都锁死了,模型只剩一个问题要回答:怎么从 A 到 B。这就是从"开放题"到"填空题"的转变——填空题的答错率远低于开放题。

镜头与关键帧界面:起始帧与结束帧的确定过程
镜头的关键帧制作:起止画面先定,插值只负责中间过程。

资产约束:两帧为什么不会跑偏

关键帧本身也是 AI 生成的,它为什么不漂移?因为每一帧的生成都被三层资产强约束:

约束 锁住什么 来源
角色定妆照 角色五官、发型、体态 角色资产库
场景概念图 空间结构、光影基调 场景资产库
道具与服装参考 关键道具形态、当前造型 上下文自动装配

所以关键帧不是"凭空画一张图",而是在既定视觉体系内渲染一个具体时刻。体系是统一的,帧就是统一的;帧是统一的,视频就是统一的;镜头是统一的,剧就是统一的。

它和传统动画关键帧的关系

这个名字不是蹭概念,方法论确实同源:传统动画也是先有关键帧(原画),再由动画师手绘中间帧(中割)。区别只在中间帧的来源:

  • 传统:原画师定关键状态 → 动画师手绘中割 → 成片;
  • AI 驱动:创作者定关键状态 → 模型插值中割 → 成片。

对创作者的职责要求没有变——把控关键状态依然是人的工作;变的是中割成本,从按帧计价的人工变成一次 API 调用。这也是"工业化工作流"的含义:结构借鉴成熟工业,产能交给新工具。

CutOS 剪辑时间轴:镜头成片交付
镜头逐个可控之后,时间轴交付才是水到渠成。

什么时候不该用关键帧

诚实地说,关键帧驱动不是万能的。两类场景文生视频更合适:氛围空镜(云、雨、光影变化,没有具体主体要锁)和风格探索(还没想清楚要什么,靠roll找感觉)。关键帧的价值在叙事镜头上——有人物、有动作、有上下文的镜头。把工具用在它擅长的环节,比争论哪种方式"更强"有意义。