Cohérence de personnage en image-vers-vidéo : le guide

Sep 18, 2026 · By Orelon Team

Explore AI video templates

Browse a few community creations for inspiration, then open any template to continue creating in Orelon.

Comment garder un même personnage crédible d'un plan à l'autre en génération vidéo IA : bible visuelle, keyframes, prompts, contrôle qualité et erreurs à éviter.

Faire parler une image fixe, c'est facile. Faire vivre le même personnage pendant trente secondes, sans que son visage change de structure au plan suivant, c'est un autre métier. La cohérence de personnage en image-vers-vidéo est le point où la plupart des projets IA s'arrêtent : le premier plan est superbe, le deuxième est troublant, le troisième appartient visiblement à quelqu'un d'autre.

Ce guide ne promet pas de solution magique. Il décrit un pipeline reproductible : comment préparer une identité verrouillée avant de générer quoi que ce soit, comment enchaîner les keyframes, comment écrire des prompts qui résistent au mouvement, et comment auditer le résultat avant d'assembler le montage. L'objectif final est simple : livrer une séquence où le spectateur reconnaît le personnage dès la première image, et continue de le reconnaître à la dernière.

Pourquoi la cohérence d'identité est le vrai goulot d'étranglement

La génération vidéo par IA a progressé très vite sur trois axes : le réalisme des textures, la fluidité du mouvement et la durée exploitable des clips. Ces progrès ont déplacé le problème. Aujourd'hui, obtenir une belle image animée n'est plus le défi. Le défi, c'est de la répéter.

Dans un film classique, la constance d'un personnage est garantie par des éléments physiques : le même acteur, le même maquillage, le même costume, le même chef opérateur. En génération IA, aucun de ces ancrages n'existe par défaut. Chaque inférence repart d'une distribution de probabilités, et cette distribution ne "sait" pas que la femme du plan 2 est censée être la même que celle du plan 1.

Les conséquences sont concrètes :

  • Temps de post-production explosif. Corriger un visage qui glisse sur quinze images coûte plus de temps que de générer la scène trois fois.
  • Crédibilité narrative détruite. Le spectateur tolère une texture imparfaite, mais pas un personnage qui change d'os du visage entre deux coupes.
  • Impossibilité de construire une série. Un épisode isolé passe. Une série avec un personnage récurrent devient ingérable si l'identité n'est pas industrialisée.

Autrement dit : la vitesse gagnée sur la génération se perd intégralement sur la correction. Le seul moyen de conserver l'avantage, c'est de traiter la cohérence comme une contrainte de production, pas comme un réglage créatif.

Les cinq sources de dérive d'identité (et comment les neutraliser)

La dérive n'est jamais un phénomène unique. Elle vient presque toujours d'une de ces cinq causes, souvent combinées.

1. Morphologie et proportions du visage

Largeur de mâchoire, écartement des yeux, longueur du nez, hauteur du front : ce sont les marqueurs qui déclenchent la reconnaissance. Ils glissent lentement, plan après plan, jusqu'à produire un personnage "ressemblant mais pas le même". La solution consiste à fixer ces proportions par l'image de référence, puis à les répéter explicitement dans chaque prompt sous forme d'adjectifs mesurables : visage allongé, pommettes hautes, nez droit et fin, mâchoire anguleuse.

2. Texture de peau et grain

Un modèle peut rendre une peau satinée au plan large et poreuse en gros plan, simplement parce que la résolution perçue change. Ce glissement ne détruit pas la reconnaissance, mais il casse la continuité visuelle. La parade : générer la référence à une résolution proche de celle du plan le plus serré, puis la réduire pour les plans larges, jamais l'inverse.

3. Éclairage et colorimétrie

Une identité stable éclairée à la lumière du jour puis en contre-jour nocturne semble différente, même parfaitement générée. Ce n'est pas un bug, c'est de la physique. Le travail consiste donc à décider d'une intention lumineuse par scène et à la maintenir à l'intérieur de chaque scène, en variant seulement le cadrage. Le spectateur accepte un changement de lumière à la coupe ; il ne l'accepte pas au milieu d'un plan.

4. Garde-robe et accessoires

C'est la source d'incohérence la plus visible et la plus facile à corriger. Une veste qui passe du cuir mat à un nylon brillant, une boucle d'oreille qui change de côté, un col qui apparaît puis disparaît : autant de détails qui font basculer le spectateur du récit vers l'analyse technique. Verrouillez chaque vêtement par une description courte et non négociable, répétée mot pour mot.

5. Cadrage, focale et distance

Un personnage filmé en 85 mm serré puis en 24 mm large ne présente pas les mêmes volumes. Si vous mélangez les deux dans la même scène sans intention, la dérive apparente sera forte. Choisissez une famille de focales par scène et tenez-la.

Construire une bible de personnage exploitable par la machine

Avant de générer la moindre seconde de vidéo, produisez un dossier de référence. Ce dossier remplace l'acteur et le maquilleur.

La planche d'angles

Générez ou rassemblez au minimum six vues : face, trois-quarts gauche, trois-quarts droit, profil, légère plongée, légère contre-plongée. Chaque vue sert ensuite de référence pour les plans correspondants. Un plan de trois-quarts généré à partir d'une référence de face dérivera presque toujours plus qu'un plan de trois-quarts généré à partir d'une référence de trois-quarts.

Pour produire ces vues de façon homogène, travaillez d'abord l'image fixe sur l'espace de création d'image : vous gardez le contrôle du cadrage et de la lumière avant d'introduire le mouvement, qui ajoute une couche de hasard.

La fiche écrite

Rédigez une fiche de quinze à vingt lignes, réutilisable telle quelle dans chaque prompt :

  • Silhouette : taille, carrure, posture habituelle (épaules basses, dos droit, appui sur une jambe).
  • Visage : forme, yeux, sourcils, nez, bouche, signes distinctifs (cicatrice, fossette, grain de beauté, mèche rebelle).
  • Cheveux : couleur exacte, longueur, texture, coiffure.
  • Vêtements : matière, couleur, coupe, accessoires fixes.
  • Voix et énergie : utile même pour du muet, car cela guide la gestuelle.

Cette fiche n'est pas un exercice littéraire. C'est un bloc de texte que vous collez. Sa répétition littérale est précisément ce qui réduit la variance.

Le tableau de continuité

Tenez un tableau simple, une ligne par plan : numéro, durée, cadrage, lumière, action, référence utilisée pour la keyframe. Ce tableau vous permet de repérer immédiatement où la dérive s'est introduite, au lieu de comparer mentalement quinze clips.

Le pipeline image-vers-vidéo en quatre passes

Voici un enchaînement éprouvé, applicable à la plupart des modèles de génération vidéo.

Passe 1 — Image pivot validée

Créez une image pivot unique, la plus proche possible du personnage final. Validez-la avec un œil froid : si le visage n'est pas exactement celui que vous voulez pendant deux minutes d'attention, il ne le sera pas non plus dans la vidéo. Cette image devient la référence canonique. Une bibliothèque comme les templates aide à trouver rapidement des compositions cohérentes quand vous devez produire plusieurs personnages.

Passe 2 — Keyframes multiples

Générez la première et la dernière image de chaque plan, plus une image médiane si le mouvement est ample. Ces keyframes servent de bornes : le modèle ne peut pas s'éloigner indéfiniment dans une direction s'il doit revenir à une image imposée. C'est la technique la plus efficace pour contenir la dérive sur un plan long.

Passe 3 — Animation et interpolation

Animez chaque segment depuis sa keyframe de départ, en utilisant la keyframe d'arrivée comme ancre de fin quand le moteur le permet. Le mouvement doit être décrit en termes simples : direction, amplitude, vitesse, interaction avec un objet. Trop de détails simultanés dans un segment court pousse le modèle à réinventer le personnage pour satisfaire la complexité demandée.

C'est ici qu'entre la génération vidéo : vous partez d'une image maîtrisée, vous décrivez un mouvement crédible, et vous conservez la même intention de lumière que sur la keyframe.

Passe 4 — Contrôle de continuité

Assemblez les segments sur une timeline sans montage, en coupe franche. Regardez la séquence trois fois : une fois pour l'histoire, une fois uniquement pour le visage, une fois uniquement pour les vêtements et accessoires. Ne corrigez que ce que vous avez vu lors des deux dernières passes. Les défauts que vous n'avez pas remarqués à vitesse réelle n'existent pas pour le spectateur.

Prompts : verrouiller l'identité par le texte

Un prompt de plan cohérent s'écrit en cinq blocs, toujours dans le même ordre.

  1. Rappel d'identité : la première phrase de votre fiche, mot pour mot.
  2. Cadrage et focale : plan poitrine, 50 mm, légère plongée.
  3. Lumière et ambiance : source principale, direction, dureté, température.
  4. Action : un seul verbe principal, une seule conséquence visible.
  5. Contraintes négatives : ce qu'il faut éviter (changement de vêtement, modification du visage, décor qui bascule).

Deux principes valent la peine d'être mémorisés :

  • Répéter plutôt que résumer. Un prompt court et incomplet laisse le modèle combler les trous, et il les comblera différemment à chaque fois.
  • Ne jamais introduire un nouvel élément à un moment critique. Si un objet doit apparaître, introduisez-le pendant un plan stable et court, jamais pendant un mouvement de caméra.

Pour comparer des formulations et voir ce qui tient sur la durée, parcourir une bibliothèque de prompts évite de réinventer un vocabulaire que d'autres ont déjà testé.

Choisir le bon moteur selon votre type de séquence

Le choix du moteur n'est pas idéologique : il dépend du type de contrainte dominante.

Contrainte dominante Famille de moteur à privilégier Pourquoi
Visage récurrent en gros plan Moteurs à références multiples Plusieurs images de référence réduisent la dérive faciale
Plan long avec mouvement continu Moteurs à keyframes de fin La borne finale contient l'accumulation d'erreur
Style graphique très marqué Moteurs à forte fidélité de style Le style stabilise la texture, donc l'identité
Grand volume de plans courts Moteurs rapides à faible coût de test Permet d'itérer et de jeter sans regret
Personnage signature long terme Modèles affinés sur vos propres références L'identité devient une propriété réutilisable

Un conseil pratique : ne mixez pas trois moteurs sur la même scène. Si vous devez changer d'outil, changez-le entre deux scènes, pas entre deux plans d'une même scène. Un test comparatif est utile avant de s'engager — par exemple en regardant une alternative à Runway ou d'autres approches, en gardant en tête votre contrainte principale, pas la démo la plus spectaculaire.

Erreurs classiques et correctifs

Trop de plans pour une seule référence. Si toutes vos keyframes viennent d'une seule image de face, prévoyez des vues supplémentaires. Correctif : régénérez la vue manquante avant d'animer.

Personnage décrit différemment dans chaque prompt. La variance du texte devient la variance de l'image. Correctif : copiez-collez le bloc d'identité, ne le reformulez jamais.

Décor qui monopolise l'attention du prompt. Un décor très détaillé vole de la capacité au personnage, qui devient approximatif. Correctif : un décor en trois mots, le personnage en trois phrases.

Lumière qui change au milieu d'un plan. Correctif : coupez le plan en deux segments et faites le changement de lumière à la coupe.

Correction après montage final. Vous perdez la trace de la cause. Correctif : corrigez toujours à la keyframe, jamais au segment.

Couleur de vêtement approximative. "Rouge foncé" devient brique, carmin, puis lie-de-vin. Correctif : nommez la couleur avec précision et gardez un nuancier de référence à côté du tableau de continuité.

Étude de cas : 30 secondes, un personnage, trois plans

Objectif : une femme, veste de cuir noir, cheveux courts, marche dans un couloir puis s'arrête devant une fenêtre.

  1. Préparation. Planche de six vues générée et validée. Fiche écrite de dix-huit lignes. Décision de lumière : source latérale froide, contraste moyen, pour les trois plans.
  2. Plan 1 (10 s). Keyframe de départ en plan large, keyframe de fin en plan poitrine. Mouvement : marche calme, caméra qui avance lentement. Une seule action.
  3. Plan 2 (8 s). Keyframe de départ reprise exactement de la fin du plan 1 pour la position, mais cadrage recadré en plan taille. La coupe justifie le changement de cadre, pas le changement d'identité.
  4. Plan 3 (12 s). Arrêt devant la fenêtre, contre-jour modéré pour éviter de perdre les traits du visage. Mouvement minimal, ce qui est volontaire : les derniers plans sont ceux dont on se souvient, ils doivent être les plus stables.
  5. Audit. Trois visionnages selon la méthode décrite plus haut. Deux corrections uniquement : couleur de la veste alignée, position de la mèche stabilisée sur le plan 2.

Résultat : trente secondes utilisables sans retouche manuelle image par image. Ce n'est pas spectaculaire, et c'est précisément l'objectif.

FAQ

Combien de keyframes faut-il pour un plan de dix secondes ?

Deux suffisent dans la majorité des cas : début et fin. Ajoutez une keyframe médiane si le mouvement comporte une rotation du corps ou un changement d'expression marqué, car ce sont les deux situations où la dérive s'accélère.

Faut-il générer en haute résolution dès le départ ?

Travaillez la keyframe à la résolution du plan le plus serré, puis réduisez pour les plans larges. L'inverse produit des textures qui ne correspondent plus entre les plans.

Un personnage récurrent peut-il survivre à plusieurs scènes ?

Oui, à condition de conserver la même planche de référence et la même fiche textuelle. Le changement de décor et de lumière doit être décidé scène par scène, mais l'identité textuelle ne change jamais.

Que faire quand le modèle ignore une consigne d'identité ?

Retirez de la description tout ce qui n'est pas essentiel. Les consignes d'identité passent mieux quand elles ne sont pas en concurrence avec dix détails de décor. Si le problème persiste, changez de keyframe : la référence pèse plus lourd que le texte.

Est-ce que l'entraînement sur un personnage personnel vaut le coût ?

Pour un projet unique, non : la préparation de références suffit. Pour une série ou une marque avec un personnage signature, oui : cela transforme l'identité en actif réutilisable au lieu d'un réglage à refaire chaque fois.

Comment savoir si la dérive est acceptable ?

Regardez la séquence en entier, sans pause, à la taille de diffusion réelle. Si votre œil ne s'arrête pas sur un plan, la dérive est acceptable. La cohérence parfaite au pixel près n'est pas nécessaire ; la cohérence perçue l'est.

Passer de la théorie à la séquence

La cohérence de personnage n'est pas un réglage caché dans un moteur. C'est une discipline de production : une planche de référence, une fiche textuelle figée, des keyframes comme bornes, des prompts répétés mot pour mot, un tableau de continuité et un audit en trois passes. Les créateurs qui livrent des séquences propres ne sont pas ceux qui ont trouvé le meilleur modèle ; ce sont ceux qui ont arrêté de générer avant d'avoir verrouillé l'identité.

Commencez petit : un personnage, trois plans, une lumière. Validez chaque étape avant de passer à la suivante. Puis, quand le pipeline tient, reproduisez-le à l'échelle d'une scène, puis d'un épisode.

Orelon est pensé pour ce moment précis : transformer une idée cinématographique en mouvement sans perdre l'identité de vos personnages. Générez votre première image pivot, verrouillez la référence, puis animez-la sur Orelon et jugez le résultat à vitesse réelle. Si vous cherchez d'abord des repères sur les outils disponibles, le blog rassemble les workflows détaillés pour aller plus loin.