把一段文字变成一个镜头,当前的模型已经能做到可用。把同一批角色、同一个场景在几十个镜头里保持住,是另一个量级的问题——而这正是叙事类内容生成的实际门槛。
这个门槛通常被表述为「一致性不够」。本文要说明的是:一致性作为一个可优化的目标,其定义方式本身带有一个陷阱——它存在一个平凡解,而这个平凡解会把生成结果推向没有人想要的方向。
一、一致性指标是怎么算的
一份被广泛使用的文生视频评测基准把生成质量拆成 16 个维度,其中与一致性直接相关的有四个:主体一致性、背景一致性、时序闪烁、动作平滑度。
前两个的计算方式是公开的,也很直接:
| 维度 | 计算方式 |
|---|---|
| 主体一致性 | 对视频中的主体,计算跨帧的视觉特征相似度 |
| 背景一致性 | 对背景场景,计算跨帧的 CLIP 图像特征相似度 |
跨帧相似度衡量的是画面在时间上的变化幅度,而不是「同一个角色是否还是同一个角色」。这两件事在多数情况下相关,但它们可以被分开——一段完全静止的画面,跨帧相似度接近满分。
二、基准作者自己指出了这个平凡解
该基准论文在结果分析一节中记录了一个跨模型的观察:时序一致性类的四个维度与动态程度维度之间存在权衡,在前者上表现强的模型,动态程度往往更低。
论文对其中一个模型的解释是:它在背景一致性与时序闪烁上表现突出,但动态程度很低,原因可能是生成相对静止的场景可以——论文在此处使用的词是「作弊」——取得高的时序一致性分数。反过来,另一个动态程度高的模型,在全部时序一致性维度上表现都差。
论文由此给出的判断是:当前模型难以在大幅运动的动态内容上同时达成时序一致性;后续研究应当同时提升两方面,因为只提升其中之一,可能意味着牺牲了另一个。
这段论述来自基准的设计者本人。指标的局限写在论文里,但在指标被引用时,这段讨论通常不随分数一起传播。
这里需要区分两种解释,否则容易把结论推得过强。观察到的负相关至少有两个来源:其一是当期模型的能力约束——同时做好大幅运动与时序稳定超出了模型的表达能力,静止是能力不足的结果而非策略;其二是指标结构的诱导——因为静止能拿高分,优化过程会向低动态收敛。仅凭跨模型的相关性无法区分这两者,本文也不主张后者是主因。
本文的论点不依赖这个区分。无论模型出于什么原因变得静止,跨帧相似度都会给它奖励:指标无法分辨「稳定」与「不动」,这是计算方式本身的性质,与模型能力强弱无关。能力约束是一个会随模型迭代变化的事实,而指标的这个性质不会。
三、提示词构造上的一道约束
同一份论文里有一个容易被略过的设计细节。
该基准为每个评测维度单独准备了约 100 条提示词。在主体一致性这一维度上,提示词的设计要求是:确保每一条都包含一个可移动的主体,并且该主体在执行非静止的动作。论文给出的动机是,主体的移动与位置变化正是一致性可能被破坏的地方——即让一致性在它最容易失效的条件下接受检验。
论文没有把这条设计表述为针对上一节那个退化解的防御,本文也不作此归因。但客观效果是一致的:在输入侧强制引入运动,「靠静止拿高分」这条路径就被堵住了。由此可以看出一件方法论上的事——当一个指标存在退化解时,约束不一定要写进计算公式,也可以放在测试样本的构造里。
这一防御同时说明了指标的使用边界:主体一致性分数只有在「主体确实在动」的前提下才有意义。脱离这个前提去比较分数,比较的是画面的静止程度。
四、从单镜头到多镜头,问题换了一种形态
上述指标衡量的是单个镜头内部的时序一致性。而叙事类内容的实际约束在镜头之间:同一个角色在第 3 个镜头和第 40 个镜头里,是否还是同一个人。
2026 年出现的一份专门针对这一问题的基准,其构成方式说明了问题的规模:
| 项目 | 规模 |
|---|---|
| 素材来源 | 取自真实叙事媒体的 140 集、2,491 个镜头 |
| 标注方式 | 逐镜头的实体调度表,同时追踪角色、物体、地点 |
| 单集规模上限(全数据集) | 最多 50 个镜头,跨镜头角色 13 个、地点 8 个、物体 22 个 |
| 最大复现间隔 | 同一实体两次出现之间最多相隔 48 个镜头 |
该基准的核心结论是一个失败模式:现有方法的跨镜头实体一致性,随复现间隔的增大而急剧退化。也就是说,一个角色消失得越久,再出现时越不像原来那个。
这个结论对工程的含义是直接的:一致性问题不能靠提升单镜头质量解决,因为它的失效与镜头内的画面质量无关,只与实体在时间轴上的分布有关。
五、第二个平凡解,与针对它的设计
跨镜头一致性同样存在退化方向,而且这一次是基准论文自己先写明的:一个朴素的跨镜头指标,可能错误地奖励那些生成结果近乎静止、但渲染并不正确的方法——这类结果彼此高度相似,所以一致性分数很高,尽管实体保真度并不达标。
本文把这个方向再推一步,以下是本文的推论,论文未以此形式表述:即便画面在动,只要生成的角色外观足够模糊、缺少可辨识的细节,用于比对的特征向量本身就不携带区分信息,它在任何两个镜头之间也都会「很像」。以特征相似度衡量,一个面目不清的角色同样可以拿到很高的跨镜头一致性分数。
这两种情形与单镜头那个退化解的成因并不相同——单镜头是时域上的信号不变,这里一种是内容退到静止、另一种是特征分辨力不足——但被指标处理的方式相同:相似度的计算不区分「因为保持住了所以像」和「因为没有信息所以像」。
本文考察的这两份基准,都对各自的退化方向做了设计上的处理。这可以作为判断一份一致性基准是否可用的一个检查点:它有没有正面处理自己的退化方向。这是两个案例支撑的观察,不构成对全部一致性指标的普遍断言。
该基准的评测套件相应地拆成三个互不替代的部分——镜头内质量、提示词遵循度、跨镜头一致性,共 51 项指标。指标数量本身传达了一个判断:一致性不是一个可以用单一分数概括的属性。
六、这对生成管线意味着什么
6.1 单一分数不能作为验收口径
如果验收标准是「一致性分数达到某个阈值」,那么优化会沿着阻力最小的方向进行——减少运动、弱化细节。这两个方向都能提高分数,而且都会让成片更差。这里不需要假设谁在有意取巧:只要分数是唯一的验收口径,反复调参这个动作本身就会朝这个方向收敛。
对于以相似度计算的一致性指标,可用的验收方式是成对读取:一致性分数与动态程度、外观保真度一同看,任何一项的单独提升都不计为改进。这条只针对相似度型指标;换一种计算方式的一致性指标,需要各自识别它自己的退化方向。
6.2 长程一致性的失效与镜头内画质无关
跨镜头一致性随复现间隔退化这一发现,指向的是状态维持而非生成质量:失效与镜头内画质无关,只与实体在时间轴上的分布有关。该基准中角色保真度最高的方法采用了显式的逐实体记忆——为每个实体单独保存外观状态,而不依赖模型在长序列中自行维持。三点限定必须一并给出:该方法由基准作者提出;它的领先只体现在角色保真度与出现率上,跨镜头嵌入相似度等指标由另一方法领先;这是单一基准中的结果。它提示了一个值得关注的方向,不足以确立某种实现是唯一解法。
这与本站另一篇关于编排架构的报告中的观察方向相近:长任务的门槛正在从单步质量转向跨时间跨度的状态一致性。两处目前被采用的做法形态相似——把需要长期保持的东西显式地存下来。这只是方向上的相似,两个领域各自的证据都不足以推出实现方式的定论。
6.3 难度应当按实体结构估计,而非按时长
第四节那份基准的难度分档,随镜头数、跨镜头实体数量与复现间隔同时抬升——后两项是它相对于一般视频基准新增的维度。本文由此提出一个估计方式(这是本文的建议,不是该基准的结论):估计一致性难度时,除了片长与镜头数,还应计入需要跨镜头保持的实体有多少个、以及它们的最大复现间隔有多长。两个时长相同、镜头数相近的片子,实体结构不同,一致性难度可以相差很远。
七、局限
- 本文引用的三份基准均为公开评测,本文未做自有实验,也未在自有数据上复现其结论。
- 第五节中「外观模糊也能取得高跨镜头相似度」,是本文在论文所述失败模式(近乎静止但渲染错误)之外做的推论,论文未讨论这一情形。
- 第三节所述的提示词约束,论文给出的动机是让一致性在最容易失效的条件下接受检验,并未把它表述为针对退化解的防御;「堵住靠静止拿高分」是本文对其客观效果的判断,不是论文的自述。
- 第二节的权衡观察来自该基准论文对当期模型的评测,模型能力在持续变化,该权衡是否随模型迭代而减弱,本文没有跨时间的数据。
- 本文讨论的全部指标都是自动化指标。自动指标与人类观感的一致程度,各基准自己有相关性验证,但本文未独立评估这一点。
- 本文第六节的三条工程判断由评测方法的性质推出,未经生产环境验证。评测指标的缺陷能说明验收口径该怎么定,但推不出生成架构必须采用哪种实现。
八、结论
时序一致性指标衡量的是跨帧相似度,因此存在一个退化解:减少画面变化即可提高分数。该基准的作者在论文中明确记录了这一点,并用「作弊」描述模型在这一方向上的行为;其应对是在提示词构造上强制引入运动。
跨镜头一致性上的退化解,方向与之相同,而且同样由基准论文自己写明:近乎静止但渲染错误的结果彼此高度相似,会在相似度指标上得到虚高的分数。
两处退化的成因并不相同:单镜头那个是时域信号不变,跨镜头那个是特征分辨力不足。相同的是指标的反应——无论所比对的两样东西为什么变得相像,相似度都照样给分。这是相似度型指标的共同盲区,不是这两份基准各自的实现缺陷。
该基准的应对是把保真度判定前置为计分的准入条件:只有实体外观被判定为准确的镜头,才被纳入跨镜头一致性计分。相似度不再单独构成分数,它必须先通过一道保真度关卡。这里还有一个容易被忽略的细节:单有关卡是不够的,因为方法可以让难例集体不过关来抬高剩余样本的均值;论文的做法是把被关卡跳过的实例按零分计入均值,堵住了这条路。约束的有效性不在关卡本身,而在它与聚合方式的配合。
两个案例的共同点是:当一致性以相似度计算时,提高分数存在一条不经过质量改进的路径。因此,以相似度为计算方式、且未配对抗指标的一致性分数,不宜单独作为优化目标或验收口径——它需要与那条路径上的对抗指标成对使用。对于叙事类生成,这意味着一致性分数至少要与动态程度、外观保真度同时读取。至于长程一致性的改进方向,已有研究提示显式的实体状态维持值得关注,但该提示目前只建立在单一基准的结果上,不足以排除其它路径。
参考来源
- 《VBench: Comprehensive Benchmark Suite for Video Generative Models》(arXiv:2311.17982,CVPR 2024):16 个评测维度;主体一致性以跨帧 DINO 特征相似度计算、背景一致性以跨帧 CLIP 特征相似度计算;时序一致性与动态程度之间的权衡观察,及「静止场景可以作弊取得高时序一致性分数」的原文表述;主体一致性维度的提示词要求包含执行非静止动作的可移动主体。
- 《EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation》(arXiv:2605.15199,2026-05,作者 Ruozhen He、Meng Wei、Ziyan Yang、Vicente Ordonez):取自真实叙事媒体的 140 集 2,491 个镜头;逐镜头实体调度标注;最难档含最多 50 镜头、13 个跨镜头角色、8 个地点、22 个物体、最大复现间隔 48 个镜头;三支柱评测套件共 51 项指标,含只允许准确实体外观进入跨镜头计分的保真度关卡;核心发现为跨镜头实体一致性随复现间隔急剧退化;显式的逐实体记忆方法取得最高角色保真度。
- 《VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness》(arXiv:2503.21755):面向内在保真度的下一代评测,覆盖人物保真度、可控性、创造力、物理规律与常识五个方向——该基准提出评测应从表层画质转向内在属性,本文用以说明这一方向,该转向是其倡导而非既成事实。