AI视频工作流实战:从分镜拆解到角色一致性与成片交付

Sep 15, 2026 · By Orelon Team

Explore AI video templates

Browse a few community creations for inspiration, then open any template to continue creating in Orelon.

一套可复用的AI视频工作流:从一句话故事拆出分镜表,到选型打分、一致性资产库、提示词六段结构、声音节奏与交付规格,附排期示例、排错对照与常见问答。

把一条 45 秒的短片真正做完,卡住你的通常不是“找不到最强的模型”,而是“没有把想法拆成可以稳定生成的单元”。很多人第一次做 AI 视频都会经历同一个循环:挑一个口碑最好的引擎,把全部镜头交给它,前三个镜头惊艳,第十个镜头开始崩。问题不在工具本身,而在于我们把一件需要多种能力协作的工程,压缩成了一次单点选择。下面这条工作流从创意拆解讲起,经过选型、一致性、提示词、声音,一直到排期与交付,任何想稳定产出短视频的人都可以照着执行。

为什么“分工”比“选最强模型”更能决定成片质量

任何生成工具都有明确的能力边界。有的擅长写实人物特写,一遇到快速手部动作就开始粘连;有的画面质感极佳,但生成一次等待很久,不适合反复试错;有的对中文语境的提示理解更准,却缺少细粒度的运镜控制;还有的生成速度快、成本低,但细节经不起放大。把所有镜头压给同一个引擎,等于让同一个人同时担任概念设计、定妆、摄影、特效和调色,结果是长板被稀释,短板被放大到每一个镜头里。

更隐蔽的成本是替换成本。当一个工具更新后表现波动,或者你的项目从竖屏转为横屏、从 15 秒扩展到 60 秒,单引擎路线意味着整条产线都要重做一遍:提示词风格要改、参数习惯要改、甚至分镜逻辑都要改。而分工路线只需要替换其中一个环节,其余资产全部保留。

把生成流程当成一个剧组来排班,思路会立刻清晰:

  • 概念与分镜:快速出草图,几十张里挑三张,允许不完美,重点是探索方向。
  • 定妆与关键帧:锁定角色五官、服装结构、场景光线,这一环要慢、要稳。
  • 动作与运镜:把关键帧变成运动,处理推拉摇移和人物走位。
  • 修补与延长:局部重绘、镜头延长、分辨率提升,收拾前几环留下的瑕疵。
  • 声音与字幕:配音、音效、环境底噪、字幕叠加,最后统一进剪辑。

分工还有一个隐性收益:它让流程变得可预测。你不再依赖某个引擎“今天状态好不好”,而是知道每一步的输入输出是什么,失败了该回退到哪一环。

三类内容,对应三种编排强度

口播与解说型内容:画面是配角,节奏是主角。工作流应该极短——固定几套模板化镜头,比如抽象背景、缓慢推进的空镜、简单的数据可视化,批量生成,配音先行,画面跟着音频长度裁切。整条链路的瓶颈在脚本,不在生成。

品牌片与产品演示:对画面质感和品牌色一致性要求高。建议先用图像环节把三到五个关键画面定死,确认风格后再进入动态生成,并且额外准备两套备选镜头,方便剪辑时替换。产品出现的镜头要比人物镜头更严格,通常需要多跑几次再挑,因为观众会盯着产品细节看。

叙事短剧与角色系列:最难也最值得沉淀的一类。核心是角色一致性,需要参考图、关键帧和声音三件事同时稳定。第一集最慢,但从第二集开始,你会明显感觉更快,因为角色参考图、服装设定、常用机位和提示词前缀都变成了可复用资产。

一个简单的判断标准:如果你的内容每期都要换主角,就别在一致性上过度投入;如果你的内容有固定主角或固定场景,那么一致性资产库的投入会在第三期之后开始回本。

第一步:把一句话故事拆成可生成的分镜表

大多数失败的项目不是败在工具,而是败在“边生成边想故事”。生成单元每次只给你几秒钟画面,你必须在动手之前就把这几秒里发生什么写清楚。这一步做扎实,后面所有环节都会变快。

从一句话到三幕

先把整个片子压缩成一句话,例如“一个夜班维修工在空无一人的地铁站里发现一台仍在运转的老式收音机”。然后把它拆成三幕:

  • 建立:交代人物、地点、时间,让观众知道“这是谁,在哪里”。
  • 变化:出现异常、冲突或转折,推动观众继续看。
  • 落点:给出一个明确结果,可以是一个表情、一个动作或一句台词。

三幕各占多长,取决于成片长度。45 秒短片大致是 8 到 10 秒建立、25 秒变化、8 到 10 秒收尾。如果超过 60 秒,变化部分再拆成两个小转折,节奏会更稳。

分镜表要写哪些字段

字段 作用 示例
镜头编号 排序与文件命名 S03
景别 决定观众的信息密度 中近景
画面内容 谁在做什么,环境有什么 工人低头检查收音机旋钮
运镜 固定、推、拉、摇、跟 缓慢推近
时长 按秒计,留一点余量 4 秒
光线与色彩 主光方向、色温倾向 顶部冷白灯,暗部偏青
声音 环境音、音效、旁白 电流杂音、远处列车声
优先级 必拍或可替换 必拍

这张表最大的价值不是给团队看,而是逼你自己回答“这个镜头到底要什么”。很多互相打架的提示词,根源是需求本身没想清楚。

让镜头可生成的三个过滤问题

  1. 动作是否过于复杂:一个人同时跑、跳、转身并且手里交换物品,失败率极高。拆成两个镜头更稳。
  2. 是否需要画面内的精确文字:招牌、屏幕内容、书页文字几乎不可能一次生成正确,全部留到后期叠加。
  3. 是否超出单个镜头的合理时长:如果需要连续十几秒的复杂运动,拆成两到三段,用剪辑承担连续性,而不是指望一次生成到底。

另外,请至少留出两个“可替换镜头”——空镜、环境交代、背影过场。它们的叙事权重低,一旦某个关键镜头反复失败,你可以用它们的位置来调整节奏,而不必推翻整条剪辑结构。

第二步:选型标准——五个维度与三类场景权重

选型时最容易被画质样片带偏。画质当然重要,但决定项目能否完成的,往往是别的维度。

五个评估维度

  • 运动自然度:人物走路、转身、手部动作是否流畅,有没有肢体变形、背景漂移。
  • 提示遵循度:你写的动作、服装、机位,它是否照做,还是只抓住了一半关键词。
  • 一致性能力:能否用参考图或首尾帧稳定同一角色、同一场景。
  • 速度与稳定性:出片需要多久,是否排队长、失败多、参数被重置。
  • 可控性:能否指定运镜、时长、画幅比例,能否做局部修改与镜头延长。

把这五项按项目需求排序,你会得到很不一样的答案。日更内容里,速度与稳定性权重最高;角色短剧里,一致性能力和提示遵循度几乎决定成败;产品演示里,可控性和细节保真度优先。

用十五分钟小样测试代替盲目比较

不要凭别人的样片选型。做一次属于自己项目的小样测试:

  1. 固定同一个提示词,配同一张参考图。
  2. 用候选引擎各生成三个镜头:一个静态特写、一个中景动作、一个带运镜的镜头。
  3. 只评价三件事:脸有没有变形、动作有没有断裂、画面是否贴合提示。
  4. 记录出片耗时和失败次数。

十五分钟就能得到比任何评测都可靠的信息,而且在项目中期需要更换环节时,这个习惯能帮你快速决策。

快速引擎与高质量引擎的使用边界

一个实用原则:关键镜头用高质量引擎,过渡镜头用快速引擎。关键镜头只有三类值得多跑几次——角色首次出场、情绪转折点、成片封面或开头前三秒。其余的空镜、背影、环境交代通常只占一两秒,观众不会细看,但数量最多,用快速引擎能省下大量时间。

判断标准很简单:如果这个镜头被截成静态图发出去,你会不会觉得丢脸?会,就多跑几次;不会,就交给快速引擎。

第三步:一致性资产库——角色、场景与光线

一致性是 AI 视频里最常被低估的环节。观众可以接受画面不够华丽,但很难接受主角在第三个镜头换了张脸。

三张参考图原则

为每个主要角色准备三张参考图:

  • 正面半身:光线均匀、五官清晰,用来锁定脸型。
  • 四分之三侧面或全身:提供体态比例与服装结构信息。
  • 情绪特写:你在片中主要需要的情绪状态。

三张图的角度可以不同,但发型、服装、年龄感必须一致,否则模型会把差异当成角色特征去学习。参考图的质量比数量更重要,宁可花时间修一张干净图,也不要塞五张风格混乱的图进去。

首尾帧锚定与镜头接力

动态生成对“起点”和“终点”的理解,远强于对中间过程的想象。所以最稳的做法是:先做出该镜头的首帧,必要时连尾帧一起做,再让生成环节在两者之间补运动。

这顺便解决了镜头之间的衔接问题。上一镜头的尾帧可以直接作为下一镜头的首帧,画面连续性会明显提升,观众几乎不会察觉中间的切换。这种方法还能反过来压住“角色漂移”:只要首尾两帧是同一个角色,中间过程就很少跑偏。

角色漂移的四个原因与修复

  • 参考图之间风格不统一:统一色调和拍摄质感,必要时把参考图一起重绘成同一风格。
  • 提示词每次写法不同:把角色描述固定成一段前缀,每次复制粘贴,不要临场发挥。
  • 镜头跨度太大:从大远景直接跳到面部特写,缺少过渡信息。中间补一个中景。
  • 画面里同时出现多个角色:特征容易互相污染。让角色分别单独出现,或用明确的方位描述区分主次。

如果试过这些方法仍然漂移,最后的手段是降低运动幅度、缩短单镜头时长,把“像不像”的问题交回给剪辑节奏去解决。

场景与光线也要入库

除了角色,建议把每个主要场景也做成资产:固定主光方向、固定色温倾向、固定两三个标志性环境元素。这样即便是不同环节生成的镜头,拼在一起也像同一个晚上、同一条街。

第四步:提示词六段结构与负面约束

提示词不是写作比赛,它是给生成环节的施工图。结构清晰的短句,通常比华丽的长句更有效。

六段式顺序

  1. 主体:谁,年龄感,服装,特征。“三十多岁的男性维修工,深蓝色工装,左袖有补丁。”
  2. 动作:一个明确动词,不要同时发生两件事。“缓缓转动收音机旋钮。”
  3. 环境:地点、时间、天气、背景元素。“空荡的地铁站台,深夜,远处有微弱灯带。”
  4. 镜头:景别与运镜。“中近景,缓慢推近。”
  5. 光线:光源方向与色温。“顶部冷白荧光灯,暗部偏青。”
  6. 质感:参考的电影语言或介质。“写实纪录片质感,轻微颗粒。”

先说清“是什么”,再说“怎么拍”,最后加氛围。反过来写,模型容易只抓住形容词,而忽略动作。

可复用的负面约束

大多数工具都支持某种形式的排除描述。常用的几条:不要多余的手指、不要画面抖动、不要快速切换、不要在画面内生成文字、不要过度锐化、不要面部扭曲。把这些固定成一段可复用的负面提示,比每次临时想更可靠,也更容易排查问题来源。

镜头语言速查

想要的效果 提示用词 注意点
强调情绪 近景、固定机位 背景元素要少
交代环境 远景、缓慢横移 避免人群密集
制造悬念 中景、缓慢推近 推进幅度别太大
展示产品 特写、环绕 需要稳定参考图
表达时间流逝 固定机位、光影变化 提示里写明光线变化

常见的写法错误有四种:一句话里塞两个以上动作、用抽象词代替具体名词(“孤独感”不如“空无一人的站台”)、同一镜头混用互相矛盾的景别、以及把情绪描述写在主体之前。逐条对照修改,提示通过率会明显上升。

第五步:声音先行——节奏、时间轴与音画同步

画面做完只是完成了一半。真正让作品“像视频”的,是声音与节奏。

先定时间轴的三个好处

一个反直觉但极其有效的做法:先写旁白或选定音乐,把时间轴铺出来,再按每句话的长度去生成画面。好处有三个:镜头时长有了明确目标,不会出现“画面很好看但配不上音乐”的尴尬;剪辑时不需要为了凑长度反复拉伸镜头;分镜阶段就能判断内容是否超时,及时砍掉冗余镜头。

音画同步的三种做法

  • 先声后画:配音或音乐先完成,画面按节拍点切分。适合解说、广告、知识类内容。
  • 先画后声:画面先剪好,再配音乐与音效。适合氛围片、视觉实验。
  • 关键点对齐:只对齐三到五个关键节拍(开场、转折、结尾),中间自由处理。最省时间,效果往往也最好。

环境音是最容易被忽略的加分项。地铁的电流声、雨声、远处人声、低音量的房间底噪,能让画面立刻“落地”。哪怕只是铺一层极轻的底噪,观感都会不同。

把剪辑点也写进表里

建议在分镜表旁边再加一列:第几秒切、是硬切还是叠化、音乐在这一秒有没有鼓点。剪辑时你只需要执行,不需要现场创作,速度会快很多,也更不容易在最后一刻改结构。

第六步:一条 45 秒短片的完整排期

假设你要做一条城市夜归主题的 45 秒短片,可以这样安排时间:

  1. 0–20 分钟|概念与三幕:写出一句话概念,确定三幕内容与落点。
  2. 20–50 分钟|分镜表:列出 8 到 10 个镜头,标注景别、时长、光线与声音,至少留两个可替换镜头。
  3. 50–90 分钟|参考图:为唯一主角准备三张参考图,确定整体色调。这一步可以从 Create Image 开始做角色定妆。
  4. 90–120 分钟|提示词:为每个镜头写六段式提示,统一角色前缀与负面约束。可参考 提示词库 里的结构写法,但一定要替换成自己的角色描述。
  5. 120–180 分钟|动态镜头:开场、转折、结尾三个关键镜头多跑两次挑选,其余交给快速引擎。这一步在 Create Video 里按清单逐条执行即可。
  6. 180–210 分钟|声音:完成旁白或选定音乐,铺上环境音,确认总长度落在 45 秒左右。
  7. 210–260 分钟|剪辑与调色:按节奏表剪切,统一色调,加上字幕与片尾。字幕单独叠加,不要指望画面里生成。
  8. 260–300 分钟|检查与导出:检查角色是否漂移、字幕是否有错字、音量是否忽大忽小,然后按目标平台规格导出。

整条流程大约五小时,其中等待生成的时间可以并行做别的环节。熟练之后,同样的结构能压缩到两三小时。

批量生产:把同类任务放在一起做

效率的关键是减少上下文切换。先把所有关键帧做完,再统一生成动态镜头,最后统一配音和剪字幕。频繁在“写提示、生成、剪辑”之间来回跳,会消耗大量注意力,也更容易忘记参数设置。

文件命名与版本管理

给文件起规范名,例如 S03_中近景_维修工_v2。当项目文件夹里有三十个文件时,你会感谢自己。每次生成都保留上一版,不要覆盖,因为“哪一版更好”往往要放进整条时间轴才能判断。

交付规格:在生成前就定画幅

竖屏 9:16、方形 1:1、横屏 16:9 要在生成前就决定,事后裁切会损失构图,尤其是近景和人物特写。导出时注意码率不要压得太低,上传平台还会再做一次压缩;音频统一在 -14 LUFS 左右,避免不同片段音量忽大忽小。

常见失误与修复对照

把下面这几条贴在显示器旁边,能省下大量重做时间:

  1. 一个提示里塞了两个以上动作:模型只做其中一个,或者两个都做得很糟。一个镜头一个动作。
  2. 参考图风格不统一:角色越生成越偏,越改越乱。先统一参考图,再进入动态生成。
  3. 依赖画面内的文字:招牌、屏幕、书页上的字几乎一定出错,全部后期叠加。
  4. 忽略声音,最后才配:画面节奏和音乐互相打架。先定时间轴。
  5. 所有镜头都用最高质量设置:时间和成本翻倍,收益很小。关键镜头才值得多跑。
  6. 不做版本管理:挑不出好坏,因为找不到上一版。每次生成都按规则命名。
  7. 一次就想做到完美:应该先用低强度设置跑通全片,确认结构成立,再回头精修关键镜头。
  8. 越改越乱时继续硬调:同一问题连续失败三次,就应该回头检查分镜,而不是继续改形容词。

三次失败判断法

如果连续三次失败的原因都指向同一个问题(脸变形、动作断裂、镜头不听话),先改提示词;如果换了三种不同写法仍然失败,那就是当前环节的能力边界,应该换环节或改分镜。这个判断法能避免你在一颗镜头上耗掉整个下午。

FAQ

多个环节混用会让风格不统一吗?

会,如果缺少统一变量。解决办法是锁死三样东西:统一的参考图、统一的提示词前缀、统一的后期调色。把这三样固定住,不同环节产出的画质差异通常小于一次调色的差异。

没有美术基础能做吗?

能。你需要补的不是画技,而是“镜头意识”:知道什么时候用近景、什么时候用远景、一个镜头该持续多久。把几条喜欢的短片开头三秒拆成景别和时长,记录成表,进步会比学绘画快得多。

一个镜头生成几次才够?

关键镜头三到五次,普通镜头一到两次,只要没有明显畸形就继续往下走。把时间留给结构问题,而不是无限打磨单一镜头。

角色一致性真的能做到完全一致吗?

很难做到百分之百,但可以做到“观众不出戏”。做法是:参考图加首尾帧锚定,减少大跨度运镜,避免让角色在镜头里快速转身或长时间做复杂表情。

单个镜头应该多长?

短视频里通常 2 到 5 秒最舒服。超过 6 秒且没有新信息,观众会开始走神;低于 1.5 秒又容易看不清。把 45 秒的片子拆成 8 到 12 个镜头,是常见的平衡点。

应该先做声音还是先做画面?

如果内容以信息为主,先做声音;如果以情绪和视觉为主,可以先做画面,但要先定音乐。判断标准很简单:观众闭上眼睛能不能听懂?能,就先做声音。

什么时候该换引擎,什么时候该改提示词?

参考上面的三次失败判断法:同一原因连续三次,先改提示词;换三种写法仍失败,就换环节或改分镜。顺序不要颠倒,否则你会同时改变两个变量,永远不知道问题出在哪。

用 Orelon 把想法变成成片

工作流的意义,在于把不确定的创意变成可以重复执行的步骤。当你把分镜表、参考图、提示词前缀和节奏表固定下来,AI 视频就不再是碰运气的抽卡,而是一条你能控制的产线:哪里卡了就回退到哪一环,哪一环稳了就把它沉淀成资产。

下一步可以很简单:挑一个你一直想做的 30 秒故事,用上面的六步走一遍。需要角色定妆就从 Create Image 开始;需要动态镜头就进入 Create Video;没有灵感时先看 模板库 找结构,再看 博客 里的拆解案例。Orelon 的定位是让电影感的想法真正动起来——把工具交给流水线,把注意力留给故事。