面向出海投放团队与独立创作者的实战指南:拆解 Facebook 与 TikTok 的素材偏好,给出钩子矩阵、提示词写法、角色一致性、多画幅多语种批量产出、复盘放大的完整 AI 视频工作流与常见错误清单。
短视频出海投放里最常见的误区,是把「做一条好片子」当成目标。真正的目标其实是:在有限的预算和一周的排期里,尽量多测试几种不同的素材结构,然后只把预算压在被验证过的结构上。
这个转变听起来简单,做起来需要三件事同时成立:素材能快速产出、变量能干净拆解、赢家能系统放大。AI 视频生成的价值恰恰在这里——它把「做一支视频」的边际成本压到足够低,让后两件事有发生的可能。如果你还在用「一次拍摄定一套素材」的节奏,那么不管画面多精致,测试速度都会成为天花板。
这篇文章把 AI 视频生成放回真实的投放场景里:从钩子矩阵、提示词写法、角色一致性,到多画幅批量导出、数据复盘与放大,给出一套可以直接照做的制作流程,并附上常见错误的排查清单。工具层面会以 Orelon 为例说明操作路径,但方法论对任何 AI 视频工具都适用。
出海投放的真实逻辑:素材数量本身就是一种投放能力
Facebook 与 TikTok 的推荐系统都在做同一件事:用极小的样本快速判断一条视频值不值得推给更多人。你无法影响这个判断本身,但可以决定它有多少次判断机会。由此可以推出三个可执行的原则。
第一,数量是能力,不是浪费。 十支结构不同的素材,命中概率远高于一支精雕细琢的素材。这里说的「结构不同」不是换个滤镜、换段背景音乐,而是钩子类型、镜头顺序、卖点表达方式上的不同。把十支素材做成同一支的十个滤镜版本,等于只做了一支。
第二,一次只改一个变量。 把「首帧画面」「开场文案」「配音语言」「结尾行动指引」拆成独立变量,一次测试只动一个,数据才可解释。混着改,即使跑量了也不知道该复用哪一部分,下一次仍然是碰运气。
第三,赢家要被拆成结构,而不是被复制。 跑量的素材本身会衰减,真正能延长寿命的是它的结构:保留钩子类型、镜头顺序和节奏,替换人物、场景、卖点表达,产出五到十支「同构异形」的变体。这套动作每周跑一次,素材库会自然沉淀出一个「有效结构池」,新素材不再从零开始。
还有一个容易被忽略的前提:素材的成败判断需要足够的样本。很多团队看到一条素材首日数据一般就立刻关掉,实际上首日的学习期波动很大。更稳妥的做法是给每条素材一个固定的观察窗口和最低消耗门槛,达不到门槛就不下结论,达到门槛再决定去留。
平台差异:Facebook 与 TikTok 各自吃什么样的素材
同一个产品、同一组卖点,在两个平台需要用完全不同的方式讲。理解差异比背参数表更重要,因为它直接决定你的分镜怎么写。
TikTok:前两秒定生死,原生感优先
TikTok 的用户处在「滑走成本为零」的状态,任何一点广告腔都会触发划走动作。有效的素材通常具备这些特征:
- 首帧即冲突或悬念,不铺垫、不用品牌动画开场,直接进入使用场景或结果展示;
- 竖屏 9:16 全屏,画面主体居中偏上,避免被底部文案与按钮遮挡;
- 节奏快、镜头短,单镜头一到三秒,成片常在十五到三十秒之间;
- 口播或字幕承担信息传递,因为相当比例的用户在静音环境下浏览;
- 语气像创作者而不是品牌,第一人称、具体细节、主动承认一个小缺点,往往比完美话术更有效。
实操里最容易踩的坑,是把 Facebook 上跑量的横屏品牌片直接裁成竖屏投放。裁切之后构图被破坏、主体变小、钩子被拉长,结果两个平台的结论互相污染:你不知道是平台不吃这类内容,还是你自己把素材做坏了。
Facebook 与 Instagram:品牌叙事与转化路径并重
Meta 系的广告位更复杂,Feed、Reels、Stories 对素材的要求各不相同。整体上它比 TikTok 更容忍一点铺垫,但对转化路径的清晰度要求更高。
- 前三秒仍要给出利益点,但可以用问题、对比或数据开场,不必像 TikTok 那样极端;
- 建议同时准备 1:1、4:5、9:16 三种画幅,让系统在 Reels 与 Feed 之间自动择优;
- 视频里承诺的内容必须在落地页首屏立刻看到,这一条不一致会吃掉大量点击;
- 字幕与品牌标识的位置要避开各广告位的安全区,否则会被裁掉或压在按钮上。
把平台差异落到制作参数上
| 维度 | TikTok | Facebook / Instagram |
|---|---|---|
| 主画幅 | 9:16 竖屏 | 4:5、1:1 为主,9:16 补充 |
| 常见时长 | 15–30 秒 | 15–45 秒 |
| 开场节奏 | 首帧即钩子 | 三秒内给利益点 |
| 语气 | 原生、第一人称 | 品牌加用户证言混合 |
| 字幕风格 | 大字、逐词弹出 | 整洁、位置稳定 |
| 关键指标 | 完播率、互动率 | 点击率、转化成本 |
把这张表贴在剪辑工程里,每次导出前对照检查,能过滤掉大部分「投了三天才发现画幅不对」的低级失误。
一条完整工作流:从卖点到成片的六个步骤
下面这套流程以「一周产出二十支可投放素材」为目标设计,一人到五人的团队都能跑通。
步骤一:把卖点拆成钩子矩阵
先不要写脚本,先把产品的卖点写成一张矩阵表。横轴是卖点,纵轴是钩子类型:
- 痛点共鸣:每次出门都要带三个充电器;
- 结果前置:三分钟搞定一周的早餐;
- 反常识:为什么我不建议你买更贵的版本;
- 对比演示:左边是旧方法,右边是新方法;
- 身份认同:给所有租房的人;
- 数据冲击:实测续航四十一小时。
五个卖点乘以六种钩子,就是三十个可测试的素材方向。先挑十个组合进入制作,其余留存备用。这张矩阵是后续所有批量化生产的地图;没有它,AI 生成只会变成一台快速生产无用素材的机器。
步骤二:分镜先写清楚每个镜头的任务
一支二十秒的短视频广告通常只需要四到六个镜头,每个镜头承担一个明确任务:
- 钩子镜头(零到二秒):制造停留;
- 问题镜头(二到六秒):让用户代入;
- 产品镜头(六到十二秒):展示解决方式;
- 证据镜头(十二到十六秒):数据、证言或演示;
- 行动镜头(十六到二十秒):给出下一步动作。
把每个镜头的任务写成一句话,再转成画面描述。这一步做得越细,后面生成时试错次数越少。很多团队跳过分镜直接写提示词,结果每生成一版都要重新想「这里该出现什么」,效率极低。
步骤三:文生视频与图生视频的取舍
两种方式各有适用场景:
- 文生视频适合探索。当画面还没定型,用它快速试方向,接受较高的废片率;
- 图生视频适合量产。当产品外观、人物形象、场景风格已经确定,用一张定稿图驱动多个镜头,稳定性明显更高。
实际工作流通常是串联的:先用文生视频找出最有效的画面方向,再把胜出的画面结构固化成参考图,用图生视频批量产出变体。在 Create Video 里可以直接完成这两种模式的切换,使用同一张参考图时,不同镜头之间的风格漂移会小很多。
需要静态素材或参考图时,可以先用 Create Image 产出关键帧,再进入视频环节。这条链路对需要保持产品外观一致的商品类广告尤其重要,因为产品形状一旦被模型重新想象,观众对品牌的信任感会立刻下降。
步骤四:角色一致性与风格锁定
出海广告经常需要同一个「代言人」出现在多支素材里。AI 生成最容易翻车的就是这里:第一支片子里是短发亚洲女性,第二支变成卷发欧美男性,观众会立刻失去信任感。
解决办法是建立一张角色卡:
- 固定的外貌描述,包括年龄区间、发型、肤质、服装基调;
- 固定的参考图两到三张,分别覆盖正面、半侧、半身;
- 固定的光影与调色描述,例如柔和的窗边自然光、低饱和暖色调;
- 固定的镜头偏好,例如三十五毫米视角、轻微手持感。
每次生成都把角色卡原样附在提示词里,配合同一张参考图,一致性会显著提升。需要提醒的是,一致性不是靠一长串形容词堆出来的,而是靠「少变量」。如果一个角色同时跨越三种光线、四种景别、五种服装,崩坏几乎是必然的。
步骤五:多画幅、多语种批量导出
一条主素材生成后,进入「一变多」阶段:
- 画幅:9:16、4:5、1:1,每个版本单独检查安全区与字幕位置;
- 时长:十五秒、二十五秒、四十秒三档,用于测试不同广告位;
- 语种:按目标市场配音或配字幕,切换语言时注意口型与节奏,避免字幕压在主体上;
- 首帧:同一条素材至少准备三个不同首帧,用于测试钩子效果。
这一阶段是纯工程活,建议做成模板化流程:固定命名规则(市场_平台_卖点_钩子_版本号),固定导出目录结构。命名混乱是团队素材管理崩溃的第一原因,找一条两周前的素材花掉二十分钟,这种成本不会出现在任何报表里,但会真实拖慢整个团队的节奏。
步骤六:复盘、读数、放大赢家
素材上线后,用统一口径判断胜负,不要只看单次结果:
- TikTok 侧重点看三秒完播率、六秒完播率与互动率;
- Meta 侧重点看点击率、落地页跳出与单次转化成本;
- 交叉判断:在两个平台都跑赢均值的素材方向,值得优先放大。
放大不是简单加预算,而是把赢家素材拆解成结构模板——保留钩子类型、镜头顺序与节奏,替换人物、场景与卖点表达,再生成五到十支变体。
提示词写法:把广告卖点翻译成画面语言
AI 视频生成的质量上限,很大程度上由提示词的结构决定。有效的广告提示词通常包含六层信息,顺序可以调整,但不要省略。
六层结构
- 主体:谁或什么在画面里,包含外貌、服装、状态;
- 动作:主体在做什么,一个镜头只写一个主动作;
- 场景:地点、时间、天气、环境细节;
- 镜头语言:景别、机位、运动方式、焦段感觉;
- 光线与色调:光源方向、色温、对比度、整体氛围;
- 风格与约束:写实或风格化、画幅、帧率感、是否需要留白给字幕。
一个可复用的模板
一位三十岁左右的女性,穿着米白色针织衫,坐在清晨的厨房台面前,双手握着一只马克杯,轻轻抬头看向窗外;背景是半开的窗帘与浅木色橱柜;中近景,机位略低于视线,镜头缓慢向前推进;柔和侧逆光,暖色调,低对比;写实风格,9:16 竖屏,画面上方三分之一留白用于放置字幕。
对比一下常见写法:一个女生在厨房喝咖啡,温暖氛围。后者把六层信息压缩成一句,模型只能随机补全,产出自然不可控。
负面提示与常见崩坏修复
多数模型支持负面提示词,建议固定写入这些内容:多余的手指、变形的手部、扭曲的面部、重复肢体;文字水印、乱码标识、屏幕闪烁;画面抖动过度、主体糊掉、比例失真。
当某个镜头反复崩坏,通常不是提示词不够长,而是动作描述太复杂。把「一边走路一边喝水一边说话」拆成三个镜头,问题往往立刻消失。另一个高发问题是画面里出现了不该有的文字,解决办法是在提示词里明确写「画面中不出现任何文字」,把文字信息全部交给后期的字幕层。
需要现成的提示词思路时,Prompts 里有按风格分类的参考写法,适合作为起步脚手架,再按自己的产品做替换。Templates 里的模板结构也能帮助团队统一素材形态,减少每个人各写一套的情况。
本地化、配音与字幕的技术规范
技术规范看起来枯燥,但它决定了素材能不能被系统正常展示。
安全区。 9:16 素材的上下各约一成半容易被界面元素覆盖,主体与字幕都应避开;4:5 与 1:1 素材注意左右留白,关键信息不要贴近边缘。
时长控制。 不同广告位对时长偏好不同,建议每个方向都准备短中长三个版本。太短的版本信息不足,太长的版本在前段就流失用户。
字幕。 逐词弹出的字幕能提升静音观看的完播率,但要在导出前逐条校对断句。机翻长句读起来非常生硬,数字、价格、单位这类信息务必人工确认,错误的信息展示是不可逆的品牌损伤。
配音与语言。 优先做目标市场的母语版本,而不是先做中文再套配音。语序、幽默感、文化禁忌在不同市场差异极大,AI 配音能解决发音问题,解决不了文案本身的违和感。
音乐与音效。 确认素材使用的音乐在目标市场可商用,投放前用平台的音频检测工具过一遍,能避免素材被静音处理。
人物与场景的文化贴合。 同一个「通勤场景」,在东京可能是电车,在洛杉矶可能是自驾。用错场景不会导致素材被拒,但会显著降低代入感,进而影响转化。
七个最常见的错误与排查清单
- 首帧没有信息量。 把最精彩的画面放在第零帧,而不是品牌动画。
- 一支素材讲三个卖点。 一次只讲一个,讲透比讲全有效。
- AI 生成的画面缺少产品细节。 检查是否提供了清晰的产品参考图,以及参考图是否覆盖了正面与侧面。
- 人物在不同镜头间变了样。 检查角色卡与参考图是否每一镜都附上。
- 字幕被界面遮挡或被裁切。 导出前用平台预览工具逐画幅检查。
- 落地页与视频承诺不一致。 视频说免费试用,落地页首屏必须立刻出现对应入口。
- 只看单条素材的成败。 记录每次测试的变量与结果,否则经验无法沉淀。
把这份清单做成投放前的检查表,逐项打勾,能过滤掉大部分「明明内容不错却跑不出量」的情况。
团队节奏与素材资产管理
一人团队和五人团队的差别不在工具,而在流程是否可交接。
单人操作时,最容易忽略的是命名与归档;建议从第一天就用固定命名规则,把素材按市场、平台、卖点、版本分层存放。两人分工时,比较高效的切分是:一人负责创意与提示词,一人负责剪辑、字幕与导出。三人团队可以再加一个专门看数据、维护钩子矩阵的角色。
一个可执行的周节奏是这样的:周一更新钩子矩阵并确定本周十个测试方向;周二到周三集中生成与剪辑,把素材按画幅与语种批量导出;周四上线并观察;周五复盘,标出赢家结构,把下周的变体方向写进矩阵。循环四周之后,团队会拥有一份属于自己的「有效结构清单」,这份清单比任何工具都更难被复制。
素材资产还包括品牌视觉资产:产品参考图、角色卡、色板、字幕规范、常用镜头语汇。它们的价值在于把「审美」变成「规格」——新成员加入时不需要靠感觉模仿,照着规格执行即可。跨市场扩展时也只替换语言与人物,视觉骨架保持稳定,品牌识别度才能在多个平台累积。
工具选型:评估 AI 视频工具时该看什么
市面上的 AI 视频工具很多,评估时建议按下面五个维度打分,而不是只看生成效果演示。
一致性控制能力。 是否支持参考图、角色锁定、风格锁定。这是广告素材与个人创作最大的分水岭。
批量化效率。 能否在一次操作里生成多个变体、多画幅、多长度。手工逐条重做会迅速吞掉效率优势。
镜头语言可控性。 是否支持指定机位、运动、景别。广告需要的是可预测,而不是随机惊喜。
出片速度与稳定性。 高峰时段的排队时长、失败率、重试成本,这些在实际投放节奏里比峰值画质更重要。
协作与资产管理。 项目、素材、版本是否可共享与检索,多人团队尤其重要。
如果你正在比较不同方案,Alternatives 里有按使用场景整理的对照说明,例如面向写实人物表现方向的 Runway 替代方案对比,可以帮你快速判断哪类工具更贴合自己的投放需求。
常见问题解答
问:一天能产出多少支可投放素材比较现实?
单人操作、流程顺畅的情况下,一天三到五支成片是合理区间;两人分工可以到八到十二支。超过这个数量通常意味着质量在下降,或者测试方向开始重复。重点不在于上限,而在于能否稳定维持这个节奏四周以上。
问:AI 生成的素材能直接投付费广告吗?
可以,但建议保留人工把关环节:检查画面崩坏、文字错误、文化敏感点与产品外观准确性。多数平台的审核规则针对的是内容本身,而不是制作方式。用 AI 生成并不需要特别声明,但画面里出现扭曲的手、糊掉的脸,会直接拉低点击率。
问:为什么我的素材在 TikTok 跑量、在 Facebook 完全没量?
最常见的原因是画幅与节奏错配。TikTok 上有效的原生感素材,放到 Meta 的信息流里可能因为缺乏清晰利益点而点击率偏低。建议为两个平台分别做首帧与开场三秒,中后段可以共用,这样既能省成本,又不会让平台的判断互相干扰。
问:角色一致性始终做不好怎么办?
先降低复杂度:把一个角色压缩成「一个固定造型、一种固定光线、一种固定景别」,用同一张参考图连续生成五个镜头,确认稳定之后再扩展变化。贪多是一次性引入多个变量的典型症状。
问:多语种版本应该重做还是只换字幕?
预算有限时先换字幕验证方向,但一旦某个市场开始起量,就应制作母语配音与本地化台词的版本,因为口型与语气对完播率的影响在放大阶段会变得明显。
问:怎么判断一个素材方向值得继续投入?
用同一套指标判断:在至少两个素材变体上,前三秒留存明显高于均值,且互动率不低于基线。单条素材的偶然爆发不足以支撑方向判断,至少需要两到三次重复验证。
问:预算很紧的时候,最该砍掉哪一步?
最该砍掉的是多语种配音和长版本素材,最不该砍掉的是钩子测试。前者只是让已有方向的覆盖面变小,后者决定你有没有方向可用。
用 Orelon 开始你的第一条出海视频广告
把上面的流程压缩成今天的第一个动作:选一个卖点,配三种钩子,写出三段分镜提示词,用同一张参考图生成三个镜头,导出 9:16 与 4:5 两个版本,明天上线测试。
不需要等所有规范都写完再开始。素材库的价值来自持续累积,而不是一次性规划。你可以从 Orelon 首页 进入创作区,用 Create Video 跑通第一个镜头,再逐步把角色卡、字幕规范和命名规则补齐。想看其他团队的做法与不同场景的拆解,也可以翻一翻 Orelon 博客。
测试跑起来之后你会发现,真正稀缺的从来不是工具,而是稳定的产出节奏。让每一条素材都成为下一次投放的数据来源,出海的增长曲线就是这样一条一条堆出来的。



