Orelon logoOrelon
料金

多图一致性与角色连贯性实战指南:AI视频生成器打造稳定人物与跨场景叙事

2026年9月18日 · Orelon Team 著

AI動画テンプレートを見る

着想のためにコミュニティ作品をいくつか閲覧し、任意のテンプレートを開いて Orelon で作成を続けましょう。

用多图参考、关键帧锁定与提示词结构解决 AI 视频的角色一致性问题。完整工作流、决策标准、排查清单与常见错误,帮你把同一张脸稳定地留在每个镜头里。

如果你把同一个角色放进三个连续镜头,很可能会经历这种崩溃:第一个镜头的主角你非常满意,第二个镜头脸宽了一点,第三个镜头连发色和外套都换成了另一个人。观众不会把这理解成风格化处理,他们只会得出一个结论——这不是同一个角色。

角色一致性是所有 AI 视频项目的隐形门槛。它不像画质那样一眼可见,却直接决定一段素材是「能看」还是「能用」。下面这套方法把一致性当成可拆解、可测量、可复用的工程问题来处理,而不是靠反复重抽碰运气。

角色为什么总在镜头之间变脸

生成模型的工作方式决定了它天然健忘。无论底层使用哪种架构,模型在生成当前帧时,主要依据是提示词、参考条件与邻近帧的潜空间状态。角色身份只是被压缩在数百维向量里的抽象概念,一旦运镜加速、光照突变、景别从特写跳到全景,这个向量就会被运动、纹理和背景信息稀释。表现出来就是:五官结构在几十帧内缓慢漂移,等你察觉时已经无法逐帧修复。

更棘手的是耦合关系。身份、表情、光照、焦段和风格是纠缠在一起的:你让人物笑,模型可能顺手改了颧骨;你把夜景调亮,模型可能连皮肤质感一起换掉。所以「修脸」往往牵一发而动全身,后期逐帧修补的成本远高于前期规划。

一致性问题通常有四种表现

  • 缓慢漂移:单看每一帧都正常,连起来播放就变成另一个人。
  • 身份混合:两个角色在双人镜头里越来越像,同性别、同发型时最明显。
  • 风格入侵:换一个模型补拍同一角色的镜头,写实角色忽然多了一层塑料感或描边。
  • 身份丢失:极端姿态、遮挡或高速运动时,五官被一张「平均脸」替代。

把症状分类的意义在于:不同症状对应完全不同的解法。缓慢漂移要靠参考约束,身份混合要靠分角色独立生成,风格入侵要靠风格适配层,身份丢失要靠关键帧补强。

把一致性拆成四个层级

很多人把一致性当成一个开关,其实它是四个叠加的层级,越往下越难自动化。先确认自己在哪一层出问题,再选工具,能省掉大量无效重抽。

层级 关注点 典型失败信号 主要手段
外观层 脸型、五官比例、痣与疤痕、发际线 单帧看起来像另一个人 多图参考与身份锚点
服装配饰层 服装结构、颜色、饰品位置 领口变形、纽扣数量漂移 参考图加文字锁定
表演层 微表情、姿态习惯、走路节奏 同一角色前后肢体语言割裂 动作参考与关键帧
叙事层 角色在不同场景中的视觉记忆点 观众看完记不住角色 统一光影与色彩基调

先定层级,再选工具

如果问题出在外观层,你需要的是更干净的参考图和更强的身份约束;如果出在表演层,再多参考图也救不了,你要的是动作描述和关键姿态控制。把层级搞混,是新手最常见的浪费。

可量化的一致性检查

不要用「感觉像不像」来判断,试着建立三个可观察指标:镜头间面部关键点的相对位移是否超过可接受范围;服装主色的色相是否偏移;同一角色在不同景别下的头身比例是否稳定。你不需要写代码,只要把几个镜头并排截图放大对比,问题就会暴露得非常明显。

多图参考:给角色建立视觉蓝图

单张参考图能传递的信息非常有限。它只记录了一个角度、一种光照、一个表情。一旦剧情要求角色转头、哭泣或走入逆光,模型就必须靠猜,而猜测的结果就是漂移。

多图参考的思路是:用一组图共同描述一个角色的稳定特征,让不变的部分在多数图中重复出现,把模型对「什么必须保留」的理解从概率问题变成强约束。真正起作用的不是图片数量,而是这组图覆盖了多少变化维度。

参考图清单:八到十二张就够

一套好用的角色参考集通常包含:

  1. 正面平光中景一张,作为主身份图。
  2. 左右侧四分之三角度各一张,锁定颧骨与鼻梁轮廓。
  3. 纯侧面一张,锁定额头、鼻尖、下颌线。
  4. 低角度与高角度各一张,帮助模型理解头骨的立体结构。
  5. 微笑、平静、愤怒三种表情,标明哪些变化属于表情、哪些属于身份。
  6. 一组不同色温的光照图,帮助模型把肤色的明暗变化与身份本身分开。
  7. 半身与全身各一张,锁定头身比例和服装轮廓。

生成这套图并不需要拍摄。你可以先用 Create Image 生成同一角色的多角度版本,筛掉不稳定的几张,再把留下的图作为视频阶段的参考集。这个「先建角色再拍戏」的顺序,比直接从文字跳到视频稳定得多。

什么样的参考图必须删掉

  • 脸部被头发、手或道具大面积遮挡的。
  • 动态模糊严重、五官边缘糊成一片的。
  • 强逆光导致面部结构看不清楚的。
  • 同一张图里出现两个相似人物的。
  • 风格明显不一致的(例如一张写实一张厚涂)。

参考集里混入一张糟糕的图,比少一张图伤害更大,因为它会把错误的特征也当成身份的一部分固化下来。

参考强度不是越高越好

强度过高会带来两个副作用:角色被锁死成参考图的姿势和表情,动作变得僵硬;模型为了贴合参考,会把场景一起拉向参考图的风格。常用做法是外观与服装保持较高约束,姿态、表情、光照留出自由度,再用关键帧在需要精确控制的镜头上单独加严。

关键帧锁定与动态校正

参考图解决的是「这个角色长什么样」,关键帧解决的是「在这个具体时刻,他必须长成这样」。前者是被动参考,后者是主动控制。

关键帧放在哪里最有效

优先锁定三类时刻:角色第一次出场的镜头、面部特写镜头、以及情绪转折点。这三个位置是观众注意力最集中的地方,也是漂移被察觉最快的地方。中间的运动过渡反而可以放松约束,让模型自由补全动作。

运动镜头与模糊帧的处理

高速运动、转身、甩头会产生运动模糊。模糊帧本身不是问题,问题是模型容易在模糊处「重新发明」一张脸。应对方式是缩短单次生成时长,把动作拆成起势、运动、收势三段,每段单独锚定身份,再用剪辑把接缝藏进动作最快的瞬间。

特写与全景的切换

从一个包含全身的宽景切到面部特写,是最容易暴露不一致的剪辑点,因为景别变化会让比例误差被放大。建议在同一景别内成组生成,跨景别时重新引入参考图和关键帧,而不是指望模型把全景里的脸「放大」得足够准确。

流程编排:三种生成策略怎么选

策略 适用场景 优势 风险
单次长镜头生成 角色少、动作简单、镜头不需剪辑 一致性天然存在 细节不可控,失败就要整段重来
分镜批量生成 多镜头叙事、需要精确控制 每镜头可独立修正 跨镜头漂移,需要参考集支撑
混合流程 几乎所有专业项目 关键镜头精确、过渡镜头省力 前期规划成本更高

决策标准

镜头数量超过五个、或者角色数量超过两个时,直接放弃单次长镜头生成。角色需要说台词、做特写时,把预算集中在这些镜头上,用混合流程处理。如果项目只有一两个镜头且不需要剪辑,单次生成反而是最快路径。

在真正开始批量生成前,先用 Create Video 跑一个十秒左右的测试片段,验证参考集是否足够。花十分钟验证,比生成二十个镜头后全部推翻便宜得多。

提示词与参数:把身份写进文本层

参考图是视觉约束,提示词是语义约束。两者配合才能真正稳住角色。很多漂移不是因为模型不行,而是因为提示词在不同镜头里换了说法——这一条写「短发女孩」,下一条写「年轻女性」,模型自然会把它们当成两个人。

角色描述卡模板

为每个主要角色写一张固定的描述卡,包含:年龄段与性别、发型与发色、眼睛形状与颜色、面部显著特征(痣、疤、痣的位置)、常穿服装的结构与颜色、气质关键词。之后所有镜头都从这张卡里复制粘贴,一字不改。

可复用提示词结构

把提示词固定成四段式:角色段(直接粘贴描述卡)、动作段(只描述本镜头发生的事)、镜头段(景别、焦段、机位运动)、光线与风格段。这样每次修改只动需要动的部分,身份信息永远保持一致。

负面提示与污染词

在负面提示里长期挂上这些词会省很多事:不同的脸、身份漂移、变形的五官、塑料皮肤、多余的手指、年龄变化、发色变化、服装更换。同时避免在正面提示里使用「多变」「随机造型」「不同风格」这类会把模型推向发散的表达。

如果想让风格收敛得更快,可以先从 Prompts 里找结构相似的镜头模板,改角色段而不是从零写。模板的价值不在于省时间,而在于它已经帮你把身份信息和镜头信息的比例调好了。

跨风格与跨工具的一致性

现实项目很少只用一种风格或一个模型。品牌片可能要求写实,衍生短视频可能需要插画或动漫风,而同一个角色要贯穿全部。这时候一致性必须从模型风格里被解耦出来。

风格适配的思路

不要指望同一个角色描述在所有风格下都生成同一张脸。更稳的做法是:先做一次风格迁移测试,观察角色在每个目标风格下最容易被改变的特征是什么(通常是鼻梁高度、眼睛大小、下颌宽度),然后针对每个风格准备一版微调后的描述卡。这不是妥协,而是把「角色是谁」和「角色被画成什么样」分开管理。

换工具时如何迁移身份

迁移的关键是参考集,而不是提示词。把原工具里验证过的角色参考图集带到新流程里,先用三到五个测试镜头验证漂移方向,再决定要加严还是放松约束。切换工具后立刻开大项目,是一致性事故最常见的起因。

什么时候该放弃统一

如果某个镜头只有两秒、角色在远处或处在强烈剪影中,硬追求面部一致是浪费算力。把精力留给观众真正会盯着看的镜头。

常见错误与排查清单

症状 可能原因 修复动作
角色越到后面越不像 提示词逐镜头改写 统一使用角色描述卡
双人镜头里两张脸趋同 同场景同时生成两个角色 分角色单独生成后合成
换了工具后脸型变了 只迁移提示词,未迁移参考集 带上参考图并重做测试镜头
特写镜头五官糊掉 分辨率与景别不匹配 特写单独生成,减少同段景别跨度
服装每镜头都在变 只锁脸未锁服装 服装写进描述卡并加参考图
动作激烈处脸变形 单次生成时长的动作过于复杂 拆分动作段落分别锚定

排查顺序建议

遇到不一致时,按「提示词是否统一 → 参考图是否干净 → 关键帧是否到位 → 生成时长是否过长 → 是否跨工具跨风格」的顺序检查。绝大多数问题在前两步就能定位,不要一上来就怀疑模型能力。

实战案例:三镜头品牌短片全流程

假设你要做一个二十秒的品牌短片,主角是一位戴细框眼镜、留短卷发的年轻女性,场景从咖啡馆走到雨天街道。

第一步:建立角色。 先用图像生成做十张参考图,覆盖正面、侧面、两个四分之三角度、三种表情、两种光照。筛掉遮挡和模糊的,保留九张。

第二步:写描述卡。 「二十多岁女性,短卷发,深棕色发色,细金属框眼镜,圆脸,左眉尾有一颗小痣,米色针织开衫内搭白色圆领,气质安静专注。」这段话在后续每个镜头里原样出现。

第三步:测试镜头。 先生成一个五秒的中景,让角色从桌边站起。检查五官、眼镜形状、开衫颜色三项。三项都稳定后再继续。

第四步:锁关键帧。 第一个镜头取她抬头看向窗外的瞬间作为关键帧;第三个镜头取她站在雨中的特写作为关键帧。中间的运动交给模型补全。

第五步:分段落生成。 咖啡馆、门口过渡、雨中街道各生成一段,每段控制在五秒以内,段落之间用动作最激烈的一帧作为剪辑点。

第六步:回看与修补。 把三段落连起来播放三遍,每次只盯一件事:脸、衣服、光线。发现漂移就只重生成出问题的那一段,而不是整片重做。

这个流程看起来比「直接写一段提示词生成二十秒」慢,但总耗时通常更短,因为返工被控制在一段而不是一整片。想把流程标准化,可以从 Templates 里的叙事结构起步,把角色段替换成自己的描述卡。

团队协作与角色资产管理

当项目从一个人变成三个人,一致性问题的来源会从模型转向沟通。

命名与版本规范

统一命名格式,例如「角色名_角度_光照_版本号」,参考集和成片素材分开存放。每次替换参考图都要升版本号,避免有人拿着旧图去生成新镜头。

角色资产的可复用性

把每个角色的描述卡、参考图集、验证过的关键帧、失败案例整理成一个文件夹。下次做同一个角色的续集时,你只需要读一遍旧文件就能恢复上下文,而不是重新摸索一遍。这类沉淀是从业余项目走向系列化作品的关键差别。

交接清单

交接给剪辑或客户前,附上一页说明:角色描述卡、不可变的三个视觉特征、允许变化的范围(例如允许外套颜色随场景调整,但不允许改变发型)。写得越具体,返工越少。

常见问题

为什么我上传了参考图,角色还是会变?

参考图只是约束,不是锁。它需要配合统一的提示词、合理的关键帧和受控的生成时长。三者缺一时,参考图的作用会被运动与光照信息稀释。

参考图越多越好吗?

不是。八到十二张覆盖关键角度和光照的干净图,效果通常好于三十张来源混乱的图。质量与覆盖度比数量重要,风格不一致的图会主动制造漂移。

写实角色能转成动漫风还保持同一个人吗?

可以做到「可辨识的同一角色」,但不会百分百一致。做法是保留少数强记忆点(痣、眼镜、发型轮廓、配色),接受风格本身带来的比例变化,并为每种风格维护一份微调后的描述卡。

一次生成长一点还是短一点更稳?

短一点更稳。单个片段控制在五秒左右,把复杂动作拆段,跨段用剪辑衔接。长片段一旦在尾部漂移,整段都要重做。

角色一致性会不会让画面变得僵硬?

会,如果约束过强。合理的做法是身份与服装保持强约束,姿态、表情、光影保留自由度,让模型在稳定身份的前提下有表演空间。

预算和精力应该优先投在哪里?

投在角色第一次出场、面部特写和情绪转折点这三类镜头上。远处的背影、剪影和快速闪过的一帧,不值得投入同等的控制成本。

让一致性成为默认设置

角色一致性不是某一个神秘功能,而是一套顺序:先把角色做成资产,再用参考集约束外观,用关键帧锁定时刻,用固定提示词守住身份,最后用分层检查抓出漂移。把顺序做对,抽卡式的运气成分会大幅下降。

Orelon 里,你可以先建角色再拍戏:用图像生成打磨参考集,用视频生成把角色放进分镜,把一整套流程串成可重复的工作方法。想看看别人是怎么组织镜头与提示词的,可以从 博客 的实战拆解开始,再回到自己的项目里,从三镜头测试片做起。当同一张脸稳定地出现在每个镜头中时,你的作品才真正从演示走向叙事。