Personnages cohérents
Mis à jour le 20 septembre 2026

Un modèle texte-vidéo génère chaque rendu de manière indépendante. Décrivez une femme d’une trentaine d’années avec une cicatrice sur un sourcil au plan 1 puis à nouveau au plan 30, et vous obtiendrez deux femmes qui correspondent à la description mais pas l’une à l’autre — les adjectifs ne suffisent pas à définir un visage. Toutes les solutions ci-dessous reposent sur la même idée, appliquée à des endroits différents : cesser de décrire le personnage et donner au modèle une image de celui-ci.
| Fiche de référence | Chaque personnage est généré une seule fois sous forme de fiche en pied au format 9:16, sur fond uni et sous un éclairage directionnel clé — une photo de casting, pas une image d’ambiance, car tout éclairage intégré à la fiche est repris dans chaque plan qui l’utilise. |
|---|---|
| Recadrages joints | Les recadrages du visage et du corps issus de cette fiche sont envoyés avec chaque segment où le personnage apparaît. Le modèle se base sur une image au lieu d’interpréter une description. |
| Liens par identifiant | Les storyboards pointent vers les ressources par identifiant, pas par nom. Deux personnages portant le même nom, ou un renommage en cours de projet, ne rompent plus la chaîne de manière silencieuse. |
| Règle du hors-champ | Un personnage qui est seulement regardé, à qui l’on parle ou vers qui l’on tend la main — et qui n’est pas dans le champ — est écrit comme une indication scénique, jamais nommé. Nommer un personnage absent est ce qui pousse le modèle à coller son visage dans un plan à une seule personne. |
Un cinquième mécanisme, plus discret : chaque personne dans un plan comporte une ou deux notes faciales distinctives tirées de sa propre description, ce qui atténue l’échec classique où deux personnages en uniforme identique échangent leurs visages au milieu du plan.
La cohérence ne peut pas signifier « ne change jamais » : un personnage qui prend feu dans l’épisode 6 doit avoir l’air brûlé dans l’épisode 7. La ligne de démarcation est tracée par la manière dont un modèle vidéo traite une image de référence : il copie le visage, les vêtements, la forme et la structure de manière quasi littérale, et applique la lumière, la météo et l’heure du jour comme des effets superposés.
Inverser la logique coûte cher dans les deux sens : une variante pour « tient la tasse » est une image que vous avez payée et que vous ne verrez jamais, et un prompt pour « après l’incendie » est une demande que le modèle ignorera poliment au profit de la pièce intacte présente dans sa référence.
L’explication par couches, avec ce que chaque couche peut et ne peut pas gérer, se trouve dans le guide de cohérence des personnages.
Les fiches de référence constituent un poste de dépense distinct, séparé de l’analyse du script (4 crédits par 3,333 caractères de texte anglais) : chaque compte reçoit 15 images de référence gratuites, et les images supplémentaires ou régénérées par la suite coûtent 7 crédits chacune sur le modèle d’image par défaut. Les variantes d’état bénéficient de leur propre petite franchise gratuite sur le premier projet et sont facturées comme des images par la suite. La vidéo elle-même commence à 10 crédits par seconde de sortie (≈ $0.06/s sur le prix du crédit le plus bas), que des références soient jointes ou non — la cohérence n’est pas un supplément. Les détails se trouvent sur la page de tarification.
La cohérence est la seule promesse de cette catégorie que vous ne devriez jamais croire sur parole, et vous n’êtes pas obligé de le faire. Un nouveau compte dispose de 50 crédits, de 15 images de référence gratuites pour les personnages, scènes et accessoires, d’un storyboard gratuit pour l’épisode 1 sur votre premier projet, et d’un aperçu gratuit d’une durée maximale de 5 secondes qui rend le plan d’ouverture de votre propre épisode à partir de vos propres fiches. C’est suffisant pour un vrai test :
Pour calibrer : le projet médian sur cette plateforme compte cinq personnages nommés, et neuf projets sur dix en comptent moins de dix. Si votre histoire en nécessite trente, le même mécanisme s’applique toujours — le coût vient des fiches, pas de la cohérence.
La langue des dialogues est définie une seule fois à l'étape 1, et l'ensemble du processus s'effectue dans cette langue ; le paramètre de région cible adapte en même temps les noms, les visages et les rues à ce marché. Chaque exemple ci-dessous a été produit de cette façon, un par langue.
Langues
Chaque série ci-dessous a été produite par le même pipeline, avec des personnages parlant la langue de manière native : l'interface, les documents de travail et les répliques sont tous dans la même langue, et rien n'est doublé. Ouvrez-en une pour écouter.
A Carta de LisboaPortuguêsDialogues natifs
윈터 프라미스한국어Dialogues natifs
El Secreto de CostaEspañolDialogues natifs
浪人の誓い日本語Dialogues natifs
Ikrar JakartaBahasa IndonesiaDialogues natifs
Зимняя коронаРусскийDialogues natifs
L’Héritier du DéfiléFrançaisDans votre langue
Il Tavolo dell'OlivaItalianoDialogues natifs
De Vuurtoren van de FjordNederlandsDialogues natifs
العهد الصحراويالعربيةDialogues natifs
Çantasındaki SözleşmeTürkçeDialogues natifs
Die Istanbul-TäuschungDeutschDialogues natifs
Останній сигналУкраїнськаDialogues natifs
問劍青雲繁體中文Dialogues natifs
The Last EnvelopeEnglishDialogues natifsLe même visage sur toute une série est l'objectif de conception, et c'est ce que l'architecture des fiches de référence offre pour les personnages de votre bibliothèque de ressources. Ce n'est pas une garantie sur chaque image : les personnages habillés de manière identique qui partagent un plan, et les personnages dont la fiche est principalement composée d'un manteau, restent des cas difficiles. Tout le reste — nombre d'épisodes, temps écoulé, nombre de plans dans lesquels un personnage apparaît — ne dégrade pas cette cohérence, car chaque plan est comparé à la même image.
Oui. Toute fiche de référence peut être remplacée par une image que vous importez, et le reste du pipeline la traite exactement comme une image générée. C'est la méthode à utiliser pour un personnage que vous avez déjà conçu ailleurs.
Techniquement, le parcours d'importation ne se soucie pas de ce que représente l'image, mais publier une vidéo IA utilisant la ressemblance d'une personne réelle pose un problème juridique dans la plupart des marchés, et notre guide de conformité le traite comme tel. Nous ne fournissons pas d'outil de remplacement de visage, et nous ne le recommandons pas.
Rien ne casse. Les storyboards font référence aux ressources par identifiant, et le renommage est propagé dans le texte stocké en même temps. Avant septembre 2026, les références étaient associées par nom, et c'est exactement le problème que ce changement a éliminé.
Non. Associer une image de référence à un segment ne modifie pas le tarif à la seconde : vous payez une fois pour chaque fiche de référence, puis rien d'autre, peu importe le nombre de plans qui l'utilisent. Ici, la cohérence est une architecture, pas une vente additionnelle.
Non, et vous ne devriez pas. Le texte du plan nomme le personnage ; l'image de référence définit son apparence. Répéter une description physique dans le texte du plan ramène le modèle vers les mots et l'éloigne de l'image, ce qui est précisément la dérive que cette conception élimine.
Oui — c'est à cela que servent les variantes d'état. Chaque apparence correspond à sa propre image de référence, et le storyboard détermine pour chaque segment laquelle s'applique, au niveau du segment individuel plutôt que de l'épisode entier.
Générez les personnages une fois ; chaque plan suivant est associé à une image, pas à une description.
Essayer SceneMixer gratuitementForfaits de crédits à partir de $1.49 · Pro $7.99/mois · Aucune carte bancaire requise pour commencer
Tarifs·Guides·Exemples·Assistance·Confidentialité·Conditions·Mentions légales·Contact·© 2026 SceneMixer