Orelon logoOrelon
요금

AI動画制作の工程設計ガイド:ログライン・ショットリストから納品までの実践手順

2026년 9월 15일 · Orelon Team 작성

AI 동영상 템플릿 둘러보기

영감을 위해 커뮤니티 창작물 몇 개를 둘러본 다음, 템플릿을 열어 Orelon에서 계속 만들어 보세요.

生成AIを使った動画制作を、企画・設計・素材生成・映像化・編集・納品の6工程に分解して解説。一貫性の保ち方、モデル選びの評価軸、よくある失敗と回避策、チーム運用のルール、FAQまで実践的にまとめました。

生成AIで動画を作る行為そのものは、もはや特別な技能ではありません。テキストを数行入力すれば、数十秒後には動く映像が返ってきます。しかし、その映像を人に見せられる「作品」に仕上げるのは、まったく別の作業です。ショットごとに画風が変わる。主人公の顔が毎回別人になる。手の指が溶ける。カメラが意図しない方向へ勝手に流れる。一カ所を直すたびに全体のバランスが崩れる。

これらはすべて、モデルの性能不足が原因ではありません。工程の設計が原因です。生成モデルの性能はこの先も上がり続けますが、工程を設計しない限り、同じ壁に何度もぶつかります。本記事ではAI動画制作を「工程」として捉え直し、上流設計から納品までの判断基準、よくある失敗、回避策、チーム運用のルールを実践レベルで整理します。

なぜ「モデル探し」から「工程設計」へ関心が移ったのか

生成モデルの数は増え続けています。新しいモデルが発表されるたびに「これが決定版だ」と言われ、数週間後には別の名前が話題の中心になります。この状況でモデル名を追いかける戦略は長持ちしません。モデルは入れ替わりますが、「企画を立て、ショットに割り、一貫性を保ち、編集でまとめる」という工程はほとんど変わりません。

AI動画制作のボトルネックは、生成そのものではなく、生成の前後にある判断です。10ショットの短い映像を作る場合、作業時間の内訳はおおよそ次のようになります。

  • 上流設計(企画・ログライン・ショットリスト):全体の20%
  • キービジュアルの生成と選定:25%
  • 動画化と試行錯誤:35%
  • 編集・音・仕上げ:20%

生成速度が2倍になっても短くなるのは35%の部分だけです。体感の制作時間は1割強しか変わりません。一方で、ショットリストを先に作り、カメラの動きと秒数を決めておくと、動画化の試行回数が半分以下になることがあります。こちらのほうが削減効果は大きいのです。

この構造を理解すると、投資すべき場所が変わります。新モデルの発表を追う時間の一部を、ショットリストの設計と生成条件の記録に回す。同じツール、同じ環境でも、アウトプットの安定度は別物になります。

制作全体を6工程に分解する

安定して使えるAI動画制作は、次の6工程に分解できます。

工程 主な成果物 判断基準
1. 企画 ログライン、尺、トーン、視聴者 誰に、何を、何秒で伝えるか言えるか
2. 設計 ショットリスト、カメラ表 全カットの秒数と動きが決まっているか
3. 素材生成 キービジュアル、人物の基準画像 世界観を1枚で説明できるか
4. 映像化 各ショットのクリップ 採用に耐える動きの区間があるか
5. 編集 タイムライン、音、テロップ 音を消しても内容が伝わるか
6. 納品 書き出し、版管理、権利確認 別の人が再現・修正できるか

最も多い失敗パターンは、工程4から始めてしまうことです。「かっこいい映像を作りたい」とプロンプトを打ち始め、良いカットが数十本できたのに、それらが一本の物語としてつながらない。結果として使えるカットは3割程度しか残らず、残りは捨てることになります。

AI動画は「作る時間」より「捨てる時間」のほうが長い作業です。捨てる量を最初に減らすのが上流工程の役割であり、これは才能ではなく手順の問題です。

上流設計:ログライン・尺・ショットリスト

ログラインは一文で書く

最初に決めるのは長さです。15秒、30秒、60秒では、必要なショット数も情報密度も編集のリズムも変わります。目安は次のとおりです。

ショット数の目安 1ショットの長さ
15秒 5〜7 2〜3秒
30秒 8〜14 2〜4秒
60秒 16〜24 2〜4秒
3分 40〜60 3〜5秒

次に、映像の内容を一文で書きます。これをログラインと呼びます。「雨の夜、屋台のラーメン職人が一杯を仕上げるまでを、湯気と手元のクローズアップで描く」——この程度の具体性で十分です。「挑戦」「情熱」「つながり」といった抽象語だけでは、カメラの指示に変換できないため映像は必ず散らかります。抽象語を書いたら、必ず「では、それをどんな画で見せるのか」まで落とし込みます。

ショットリストは「動き」と「尺」の表にする

ショットリストは表計算ソフトで十分です。列は次の7つを用意します。

内容
No. ショット番号
秒数
内容 何が起きるか
カメラ 固定/パン/ドリー/手持ち
時間帯と光源の向き
セリフ、環境音、音楽の有無
状態 未着手/生成済み/採用

大切なのは、カメラの動きを先に決めることです。AI動画は静止した構図より動きのある構図のほうが破綻しやすい。逆に言えば、固定カメラで成立するショットは積極的に固定にしてリスクを下げられます。全編をドリーとパンで埋める必要はありません。不安定になりやすいのは、人物が大きく動き、同時にカメラも動き、背景も変化するカットです。この3つが重なるショットは、できるだけ分割します。

絵は描かなくていい、「変化」を書く

手描きの絵が苦手でも問題ありません。書くべきは構図の美しさではなく、ショットの始まりと終わりの差です。「握った拳が徐々に緩む」「窓の外の雨が止み、光が差し込む」「湯気の向こうから店主の顔が現れる」——こうした変化が1ショットに1つあるだけで、映像は物語として進みます。変化のないショットが3つ続くと、視聴者は離脱します。

生成モデルを選ぶ4つの評価軸

一貫性・運動表現・制御性・速度と費用

生成モデルは数多く存在し、それぞれ得意分野が違います。選定の際は、次の4軸で比較すると整理しやすくなります。

  • 一貫性:同じ人物、同じ画風を維持できるか
  • 運動表現:歩行、髪や布の揺れ、水や煙の挙動が自然か
  • 制御性:カメラワークやライティングを指示どおりに動かせるか
  • 速度と費用:1カットあたりの生成時間とコスト

商用の広告映像では一貫性と制御性の比重が高くなります。SNS向けの短尺や構図の検証では、速度と費用を優先したほうが合理的です。同じプロジェクトでも、工程によって使うべきモデルは変わります。キービジュアルは静止画に強いモデル、動きの検証は高速なモデル、本番は一貫性の高いモデル、という具合に役割を分けます。

ルックを先に決めてから候補を絞る

写実的な人物ドラマを撮るなら、肌の質感と照明の再現度が高いモデルを選びます。アニメ調やイラスト調なら、線の安定性と色彩の扱いが重要です。CG的な質感、レトロフィルム風の質感など、ルックを先に言語化してから候補を絞り込むと、後戻りが減ります。逆に「話題だから」という理由でモデルを決めると、画風が合わずに全部作り直すことになります。

複数の候補を比較したいときは、Runwayの代替のような比較ページで違いの輪郭をつかみ、そのうえで自分の題材で2〜3ショット試すのが最短です。比較記事の評価をそのまま信じるのではなく、自分の題材で試すことが重要です。

見積もりは「採用カット数×3〜5回」で出す

見積もりは「採用カット数 × 3〜5回の試行」で計算します。10ショットの映像なら30〜50回の生成が発生すると考えるのが現実的です。ここにショットリスト段階のテスト生成が加わります。

費用を抑える最大のコツは、解像度と尺を上げる前に構図を固めることです。低い設定で10パターン試し、構図が決まってから本番設定で1回だけ回す。この順番を守るだけで無駄な生成が大きく減ります。料金体系や生成量の上限は、案件の前に料金ページで確認し、想定試行回数と照らし合わせておくと安心です。

プロンプトを5層に分けて組み立てる

5つの層と記述例

プロンプトは思いつきで書かず、5つの層に分けて組み立てます。

  1. 被写体:誰が、何が、どんな状態か
  2. 動作:どのような動きを、どの速度でするか
  3. カメラ:位置、距離、動き、レンズ感
  4. :光源、方向、色温度、時間帯
  5. 雰囲気:質感、フィルムルック、天候、空気感

記述例は次のようになります。

濡れた路面に立つ40代の男性。ゆっくりと顔を上げ、遠くを見る。カメラは腰の高さからゆっくり寄り、浅い被写界深度。ネオン看板の赤と青が顔を照らす。雨上がりの夜、フィルムグレイン強め。

この形の利点は、修正が局所化できることです。「動きが速すぎる」と感じたら層2だけを書き換える。「暗すぎる」なら層4だけを調整する。全体を書き直す必要はありません。

修正は層単位で行う

生成結果が意図と外れたときは、次の順番で確認します。まず層2(動作)の指示が多すぎないか。次に層3(カメラ)の動きが複雑すぎないか。最後に層1(被写体)の情報が不足していないか。多くの場合、最初の2つで解決します。

修正のたびに全層を書き換えると、何が効いたのか分からなくなります。1回の生成につき、変える層は1つまで。これは地味ですが、最短で収束させるコツです。

指示過多よりも「矛盾」が問題

長いプロンプトが悪いわけではありません。問題は、同じ層の中で矛盾した指示を出していることです。「ゆっくり歩く」と「力強い足取り」を同時に書く。「逆光」と「正面から柔らかい光」を同時に書く。モデルは矛盾を解決できないため、どちらかを無視するか、両方を薄めて出力します。出力が不安定なときは、まずプロンプト内の矛盾を探してください。

表現の引き出しを増やしたい場合は、プロンプト集を参考に、自分の題材へ置き換えて自分用の言い回しを蓄積していくのが効率的です。

ショット間の一貫性を保つ5つの実務テクニック

一貫性はAI動画で最も難しい課題です。実務で効く方法を順に挙げます。

1. 静止画から始めて映像化する

テキストから直接動画を生成するより、まず画像を作り、それを動かすほうが制御しやすくなります。画像は構図、人物、光を完全にコントロールできます。動画生成では「その画像をどう動かすか」だけを考えればよくなります。画像生成動画生成を往復する流れは、もはや標準的なワークフローです。

2. 人物の基準画像を先に作る

主要人物については、正面・斜め・横の3方向のポートレートを先に作り、プロジェクト内で固定します。各ショットの生成時には、その画像を参照として渡します。文章で人物を説明するのは想像以上に不安定で、同じ記述でも髪型や年齢が毎回変わります。

3. 色設計を先に決める

映像全体の色を、シーンごとに決めておきます。序盤は寒色、終盤に向けて暖色へ、といった設計です。色を先に決めておくと、モデルが変わっても全体のトーンが揃い、視聴者には一貫した作品として映ります。色は「後から揃える」ものではなく、「先に決める」ものです。

4. 固定要素をリスト化する

時計、眼鏡、上着の色、鞄の形状。こうした要素は生成のたびに変わりやすい箇所です。ショットリストに「固定要素」の列を追加し、毎回プロンプトに明記します。「赤いリボンのある麦わら帽子」のように、色と形を言葉で固定しておくと安定します。

5. 生成条件を記録する

どのショットをどの設定で作ったかを記録します。似たカットを追加する必要が出たとき、記録があるだけで再現性が跳ね上がります。記録する項目は、モデル名、アスペクト比、尺、プロンプト、参照画像、採用理由の6つで十分です。

編集・音・仕上げ:生成後の工程で品質が決まる

生成されたカットは素材であって作品ではありません。ここからの工程で見え方は大きく変わります。

テンポは意味ではなく緩急で作る

カットの長さは、意味だけでなくテンポで決まる部分があります。同じ尺を機械的に並べると映像は退屈になります。1カットだけ極端に短くする、逆に1カットだけ長く置く。この緩急が視聴者の集中を保ちます。

また、生成した映像は「最も動きが自然な区間」だけを使うのが基本です。5秒生成して実際に使うのが2秒ということはよくあります。切り出しを前提に、少し長めに生成しておくのが安全です。

音は3層に分けて積む

AI動画は無音で見ると魅力の半分も伝わりません。手順としては、まずセリフと音楽を置き、次に環境音、最後に効果音を足します。逆順にすると音が過密になり、何が聞こえるべきか分からなくなります。とくに環境音は、同じカットを別物に見せる効果があります。雨音、足音、紙の擦れる音を重ねるだけで、映像の密度が変わります。

ルックを揃えて「同じ現場」に見せる

色調整で全体のトーンを揃える工程は、AI動画では特に重要です。モデルごとに微妙に異なる色味やコントラストを一つのルックにまとめることで、別々に生成したカットが同じ現場で撮影されたように見えます。粒状感、ハイライトの色、黒の締まり。この3点を揃えるだけで効果があります。

よくある失敗と回避策

失敗 原因 回避策
カットごとに画風が違う モデルやプロンプトを毎回変えている モデルとルックを固定し、色調整で揃える
人物の顔が別人になる 参照画像を渡していない 人物の基準画像を作り参照させる
動きが不自然 指示が多すぎる/抽象的 動きを1つに絞り、具体的な動詞で書く
尺が足りない 上流で尺を決めていない ショットリストに秒数を明記する
全カットが同じ速さ リズム設計の欠如 長短を意図的に混ぜる
修正で全部作り直しになる 素材と設定の記録がない 生成条件と採用理由を記録する
テロップが読めない 画面の情報量が多すぎる 余白を残して構図を設計する
音とリズムが合わない 音を最後に適当に足す 音楽の拍からカット割りを決める

特に多いのは1つ目と2つ目です。この2つは技術ではなく設計の問題であり、上流工程を丁寧にやるだけでほぼ解消します。

実践例:15秒の映像を3日で仕上げる

具体例として、15秒・6ショットの短編を3日で作る想定で進めてみます。

1日目:企画と設計 ログラインを書き、ショットリストを作ります。同時に参考映像を10本集め、色味とカメラの傾向をメモします。この日の成果物はテキストだけです。絵は不要です。

2日目:キービジュアルと動画化(前半) 人物の基準画像と、各シーンの代表カットを静止画で作ります。この段階で構図の9割を決めます。方向性を確認してから3ショットを動画化します。1ショットにつき3〜4回試行し、最も自然な区間を切り出します。

3日目:動画化(後半)と仕上げ 残りのショットを生成し、編集に入ります。音楽を先に置き、カットの長さを拍に合わせて調整します。最後に環境音と効果音を足し、色を揃えて書き出します。解像度違いと尺違いの2バージョンを用意しておくと、そのまま別の媒体にも展開できます。

このスケジュールで重要なのは、2日目に構図を確定させることです。3日目に構図を悩み始めると、3日では終わりません。制作の型を短い尺で一度通しておくと、次に作る30秒や60秒の映像が驚くほどスムーズになります。構成の雛形が必要な場合はテンプレートを出発点として使い、色設計とカメラワークで差をつけるのが現実的です。

チームで作る場合の運用ルール

個人制作では不要でも、複数人で作る場合は最初にルールを決めます。

命名規則プロジェクト名_シーン番号_ショット番号_版のように統一します。生成物は同じショットのバリエーションが数十本出るため、命名が崩れると即座に迷子になります。採用カットには_OKを付け、それ以外は定期的に整理します。

レビューの単位は「1カット単位」と「通し単位」を分けます。カット単位では構図と動きを、通しではテンポと情報量を確認します。混ぜて議論すると結論が出ません。

権利と表記は案件開始前に確認します。生成物の利用条件は使用ツールによって異なるため、商用利用の可否、再配布の条件、実在の人物に似た人物を生成しない、商標やロゴを写り込ませない、といった基本ルールをプロジェクト内で共有します。AI生成であることを明示するかどうかも、先に合意しておくと後で揉めません。

FAQ

Q. 初心者はどこから始めるべきですか。 30秒ではなく5秒から始めてください。1ショットだけを、構図・動き・光の3点を意識して作り切ります。これを10本作ると、自分の癖とモデルの癖が見えてきます。

Q. 生成した映像が不自然なときはどうすればいいですか。 まず動きの指示を減らします。次に構図を単純にします。人物が2人以上いるカットは、1人に減らすだけで安定することが多いです。それでも改善しない場合は、プロンプトではなく設計(ショットの分割)を見直します。

Q. 何回生成すればよいですか。 採用1カットあたり3〜5回が現実的な目安です。10回を超えても改善しない場合は、モデルか構図を変えたほうが早いです。

Q. 長い映像は作れますか。 生成できる尺には上限があるため、長尺はショットの積み重ねで作ります。1分を超える作品は、ショットリストの管理が品質を左右します。編集のタイムラインに置く前に、尺の合計を表で確認しておくと破綻しません。

Q. テンプレートを使うべきですか。 構成の雛形として使うのは有効です。ただし、テンプレートのままの映像は似通います。出発点として使い、色設計とカメラワークで差をつけるのが現実的です。

Q. どこまで自動化できますか。 構図の試作、バリエーション生成、ラフな編集は自動化に向いています。一方で、どのカットを採用するか、どの順番で見せるかの判断は人間の仕事として残ります。ここを手放すと作品の個性が消えます。

Q. 画風が毎回変わるのを止めたいのですが。 まずモデルを1つに固定し、参照画像を渡し、色調整でまとめる。この3つを順に試してください。多くの場合、モデルを変えていることが原因です。

まとめ:工程を設計した人から、AIは指示に従い始める

AI動画制作で成果を分けるのは、モデルの数でもプロンプトの長さでもありません。企画、設計、素材生成、映像化、編集、納品という6工程を、どの順番で、どこまで固めてから次に進むか。それだけです。

工程を設計した人にとって、生成ツールは「何が出るか分からない箱」ではなくなります。指示を出せば、そのとおりに応えてくれる撮影現場になります。逆に言えば、工程を設計しないままツールを増やしても、迷う場所が増えるだけです。

まずは5秒の1カットから始めてください。ログラインを一行書き、ショットリストを一枚作り、キービジュアルを一枚生成し、それを動かす。この小さな一周を回すと、次に作る映像のスピードが変わります。Orelonでは、画像生成と動画生成を行き来しながら、この工程をひとつの流れとして進められます。最初の一本を作り終えたとき、あなたの制作は「試す」段階から「作る」段階へと変わっているはずです。