Scènes IA à plusieurs personnages
Mis à jour le 20 septembre 2026

La vidéo générée présente un défaut spécifique quand plus d’une personne apparaît dans un plan : elle ajoute un visage qui ne devrait pas être là. Une personne mentionnée dans le texte — regardée, interpellée, évoquée — apparaît à l’écran avec un visage inventé sur le champ, parce que rien n’indique au modèle la différence entre « présent » et « mentionné ».
C’est pourquoi la liste des plans l’indique pour chaque prise. Chaque plan comporte une liste explicite des personnages présents dans le cadre, et cette liste — pas le texte, pas l’état de fin du plan précédent — est la seule chose qui détermine quelles fiches de référence sont associées.
| Personnages dans le cadre | Une liste par plan. L’ensemble des personnages listés sur les plans d’un segment détermine quelles fiches de référence sont envoyées avec lui. |
|---|---|
| Personnages hors champ | Écrits sous forme d’indication — « vers la gauche du cadre », « regard vers la caméra » — et non comme un nom. Aucun visage n’est associé. |
| Plans à une personne | Marqués explicitement, afin d’indiquer au moteur de rendu que le cadre ne contient qu’une personne et de ne pas inviter de compagnie. |
| Personnage qui parle | Nommé à chaque réplique ; tous les autres personnages dans le cadre sont marqués comme ayant les lèvres fermées, afin que seule la bouche de celui qui parle bouge. |
| Foule en arrière-plan | Un état déclaré de la scène, écrit une fois dans l’en-tête du segment, ou absent — jamais déduit du son ambiant. |
| Limite pratique | Quatre personnages nommés dans un même cadre est le seuil au-delà duquel la qualité baisse. La liste des plans contourne ce problème au lieu de le forcer. |
C’est mesurable, pas théorique. Des plans nommant un antagoniste hors champ ont produit un mauvais visage ou une personne en trop dans cinq rendus sur huit. Les mêmes plans réécrits pour donner une indication au lieu d’un nom n’ont produit aucun échec de ce type en douze rendus. C’est pourquoi le pipeline les réécrit : dans un plan à une personne, un personnage qui n’existe que par un regard ou une direction de mouvement est converti en une expression spatiale et retiré de la liste du cadre.
La même logique s’applique aux morts : un personnage évoqué uniquement comme un corps dans ce segment est écrit comme un nom commun, pas comme une référence de personnage, afin que personne n’associe sa fiche de référence et ne le fasse apparaître debout.
Il n’existe exactement que deux manières de filmer cela, et la liste doit en choisir une : plan de profil à deux, ou plan par-dessus l’épaule. Ce qui ne peut pas être écrit est « A face à B, avec B en arrière-plan, flou » : pour que B soit dans la profondeur de champ de A, A doit tourner le dos à B, et cette position de caméra n’existe pas dans un plan moyen normal. Si on le demande malgré tout, le moteur place une personne de face face à la caméra et l’autre debout derrière elle. L’axe est défini dans le premier plan où les deux sont réellement présents ensemble dans le cadre.
Une salle de trois cents invités est un état visible de la scène, donc elle est écrite comme tel — une ligne dans l’en-tête du segment indiquant qui sont les personnes en arrière-plan, où elles se trouvent et ce qu’elles font. C’est cohérent sur tous les segments de cette scène. Sans cette ligne, le plan ne peut pas faire référence à une foule du tout, car un « murmure d’invités » dans l’audio ambiant n’est pas une instruction visuelle, et un moteur qui ne reçoit que cette information vous donnera des invités dans un plan et une salle vide dans le suivant.
Quand une foule est déclarée, l’instruction de cadre change avec elle : la foule reste dans la profondeur de champ, et la liste des personnages dans le cadre ne compte toujours que les personnages nommés.
Rien de supplémentaire — ce sont des propriétés de la liste des plans, qui est facturée selon la longueur du script à 1 crédit par cent caractères de la part de l’épisode. Les fiches de référence coûtent 7 crédits chacune au-delà des 15 gratuites de votre premier projet, et le rendu commence à 10 crédits par seconde de sortie. Consultez cohérence des personnages pour savoir comment les visages restent identiques d’un plan à l’autre, et la page de tarifs pour les taux.
Langues
Chaque série ci-dessous a été produite par le même pipeline, avec des personnages parlant la langue de manière native : l'interface, les documents de travail et les répliques sont tous dans la même langue, et rien n'est doublé. Ouvrez-en une pour écouter.
A Carta de LisboaPortuguêsDialogues natifs
윈터 프라미스한국어Dialogues natifs
El Secreto de CostaEspañolDialogues natifs
浪人の誓い日本語Dialogues natifs
Ikrar JakartaBahasa IndonesiaDialogues natifs
Зимняя коронаРусскийDialogues natifs
L’Héritier du DéfiléFrançaisDans votre langue
Il Tavolo dell'OlivaItalianoDialogues natifs
De Vuurtoren van de FjordNederlandsDialogues natifs
العهد الصحراويالعربيةDialogues natifs
Çantasındaki SözleşmeTürkçeDialogues natifs
Die Istanbul-TäuschungDeutschDialogues natifs
Останній сигналУкраїнськаDialogues natifs
問劍青雲繁體中文Dialogues natifs
The Last EnvelopeEnglishDialogues natifsQuatre personnages nommés est la limite pratique avant que l’identité ne commence à se dégrader, et la liste des plans est conçue pour rester en dessous — les scènes de groupe sont couvertes en plans individuels et en plans par-dessus l’épaule plutôt qu’en plans larges de groupe.
C’est exactement l’échec que la liste de présence par plan évite. Un personnage qui est seulement regardé ou à qui l’on parle est écrit comme une indication, pas comme un nom, et ne figure pas dans la liste du cadre — donc aucune fiche de référence n’est associée et aucun visage n’est inventé.
Oui, en plan de profil à deux ou en plan par-dessus l’épaule. Ce qui ne fonctionne pas, c’est l’un face à l’autre avec le second flou en arrière-plan : cette combinaison de cadrage et de profondeur est physiquement incohérente, et la demander produit une personne debout derrière quelqu’un qui parle à la caméra.
Ils sont déclarés une seule fois dans l’en-tête du segment — qui ils sont, où ils se trouvent, ce qu’ils font — et restent cohérents tout au long de la scène. Si rien n’est déclaré, le plan ne fait pas référence à une foule. Le bruit de foule ambiant seul n’est pas considéré comme une instruction visuelle.
Seul l’interlocuteur nommé de chaque réplique. Toutes les autres personnes dans le cadre sont explicitement indiquées comme ayant les lèvres fermées, ce qui empêche un auditeur de remuer silencieusement les lèvres en même temps que le dialogue.
Générez une scène de foule et comptez les visages.
Essayer SceneMixer gratuitementForfaits de crédits à partir de $1.49 · Pro $7.99/mois · Aucune carte bancaire requise pour commencer
Tarifs·Guides·Exemples·Assistance·Confidentialité·Conditions·Mentions légales·Contact·© 2026 SceneMixer