KI-Szenen mit mehreren Charakteren
Aktualisiert 20. September 2026

Generierte Videos haben einen typischen Fehler, wenn mehr als eine Person in einer Einstellung zu sehen ist: Es taucht ein Gesicht auf, das dort nicht hingehört. Jemand, der im Text erwähnt wird – den man ansieht, dem man zuruft, an den man denkt – erscheint im Bild mit einem spontan erfundenen Gesicht, weil dem Modell niemand den Unterschied zwischen „anwesend“ und „erwähnt“ mitgeteilt hat.
Deshalb gibt die Einstellungsliste das pro Einstellung an. Jede Einstellung trägt eine explizite Liste, welche Charaktere im Bild sind – und nur diese Liste, nicht der Text und nicht der Endzustand der vorherigen Einstellung, entscheidet, wessen Referenzbilder verknüpft werden.
| Wer im Bild ist | Eine Liste pro Einstellung. Die Vereinigung über alle Einstellungen eines Segments hinweg bestimmt, welche Referenzbilder mitgeschickt werden. |
|---|---|
| Wer außerhalb des Bildes ist | Wird als Regieanweisung geschrieben – „nach links im Bild“, „Blick zur Kamera“ –, nicht als Name. Dem wird kein Gesicht zugewiesen. |
| Einzeleinstellungen | Explizit markiert, damit der Renderer weiß, dass nur eine Person im Bild ist und keine weitere erfinden soll. |
| Wer spricht | Wird pro Zeile benannt; alle anderen im Bild werden als „Lippen geschlossen“ markiert, sodass sich nur der Mund des Sprechers bewegt. |
| Hintergrundmenge | Ein deklarierter Zustand der Szene, einmal im Segment-Header notiert – oder fehlend. Nie durch Umgebungsgeräusch impliziert. |
| Praktische Obergrenze | Ab vier benannten Personen in einem Bild sinkt die Qualität. Die Einstellungsliste umgeht das, statt es zu erzwingen. |
Das ist messbar, nicht theoretisch. Bei Einstellungen, die einen Antagonisten außerhalb des Bildes benannten, entstanden in fünf von acht Renderings falsche Gesichter oder eine zusätzliche Person. Dieselben Einstellungen, umgeschrieben mit einer Richtung statt eines Namens, ergaben in zwölf Renderings null solcher Fehler. Deshalb schreibt die Pipeline sie um: In einer Einzeleinstellung wird ein Charakter, der nur als Blickrichtung oder Bewegungsrichtung existiert, in eine räumliche Formulierung umgewandelt und aus der Bildliste entfernt.
Dieselbe Logik gilt für Tote: Ein Charakter, auf den in diesem Segment nur als Leiche verwiesen wird, wird als einfaches Substantiv geschrieben, nicht als Charakterreferenz – sodass niemand sein Referenzbild lädt und ihn aufstellt.
Es gibt genau zwei Möglichkeiten, das zu drehen, und die Liste muss eine wählen: eine Profil-Zweier-Einstellung oder eine Über-die-Schulter-Einstellung. Nicht geschrieben werden darf „A steht B gegenüber, B im Hintergrund unscharf“ – damit B in As Tiefenschärfe liegt, müsste A B den Rücken zukehren, und diese Kameraposition existiert in einer normalen Halbtotalen nicht. Fordert man es trotzdem, stellt der Renderer eine Person frontal zur Kamera und die andere hinter sie. Die Achse wird in der ersten Einstellung festgelegt, in der beide tatsächlich gemeinsam im Bild sind.
Ein Saal mit dreihundert Gästen ist ein sichtbarer Zustand der Szene und wird so notiert – eine Zeile im Segment-Header, die sagt, wer die Hintergrundpersonen sind, wo sie sind und was sie tun. Konsistent für alle Segmente dieser Szene. Ohne diese Zeile darf die Einstellung überhaupt keine Menge erwähnen, denn „Gemurmel von Gästen“ im Umgebungs-Ton ist keine visuelle Anweisung; ein Renderer, dem nur das mitgeteilt wird, liefert in einer Einstellung Gäste und in der nächsten einen leeren Saal.
Wenn eine Menge deklariert ist, ändert sich die Bildanweisung entsprechend: Die Menge bleibt in der Tiefenschärfe, und die Bildliste zählt weiterhin nur die benannten Charaktere.
Nichts extra – das sind Eigenschaften der Einstellungsliste, die nach Skriptlänge mit 1 Credit pro hundert Zeichen des Episodenanteils abgerechnet wird. Referenzbilder kosten 7 Credits pro Stück über die 15 kostenlosen im ersten Projekt hinaus, und das Rendering startet bei 10 Credits pro Sekunde Ausgabe. Siehe Charakterkonsistenz dazu, wie Gesichter über Einstellungen hinweg gleich bleiben, und die Preisseite für die Tarife.
Sprachen
Jede Serie unten wurde mit derselben Pipeline produziert, wobei die Darsteller die jeweilige Sprache auf muttersprachlichem Niveau sprechen: Oberfläche, Arbeitsdokumente und gesprochene Zeilen sind in einer Sprache, nichts ist synchronisiert. Öffne eine Serie, um es dir anzuhören.
A Carta de LisboaPortuguêsMuttersprachliche Dialoge
윈터 프라미스한국어Muttersprachliche Dialoge
El Secreto de CostaEspañolMuttersprachliche Dialoge
浪人の誓い日本語Muttersprachliche Dialoge
Ikrar JakartaBahasa IndonesiaMuttersprachliche Dialoge
Зимняя коронаРусскийMuttersprachliche Dialoge
L’Héritier du DéfiléFrançaisMuttersprachliche Dialoge
Il Tavolo dell'OlivaItalianoMuttersprachliche Dialoge
De Vuurtoren van de FjordNederlandsMuttersprachliche Dialoge
العهد الصحراويالعربيةMuttersprachliche Dialoge
Çantasındaki SözleşmeTürkçeMuttersprachliche Dialoge
Die Istanbul-TäuschungDeutschIn deiner Sprache
Останній сигналУкраїнськаMuttersprachliche Dialoge
問劍青雲繁體中文Muttersprachliche Dialoge
The Last EnvelopeEnglishMuttersprachliche DialogeVier benannte Personen sind die praktische Obergrenze, bevor die Identitätsdarstellung nachlässt. Die Einstellungsliste ist darauf ausgelegt, darunter zu bleiben – Ensembleszenen werden in Einzeleinstellungen und Über-die-Schulter-Einstellungen abgedeckt statt in weiten Gruppenbildern.
Genau diesen Fehler verhindert die Bildliste pro Einstellung. Ein Charakter, der nur angesehen oder angesprochen wird, wird als Richtung geschrieben, nicht als Name, und steht nicht in der Bildliste – also wird kein Referenzbild verknüpft und kein Gesicht erfunden.
Ja, als Profil-Zweier-Einstellung oder Über-die-Schulter. Was nicht funktioniert, ist eine Person frontal, die andere unscharf im Hintergrund: Diese Kombination aus Bildausschnitt und Tiefenschärfe ist physikalisch unstimmig, und die Forderung danach führt dazu, dass eine Person hinter jemandem steht und zur Kamera spricht.
Sie werden einmal im Segment-Header festgelegt – wer sie sind, wo sie sind, was sie tun – und bleiben in dieser Szene konsistent. Wenn nichts festgelegt ist, enthält die Einstellung keine Menschenmenge. Allein Umgebungsgeräusche einer Menge zählen nicht als visuelle Anweisung.
Nur der benannte Sprecher jeder Zeile. Alle anderen im Bild sind explizit mit geschlossenen Lippen markiert – das verhindert, dass ein Zuhörer leise zum Dialog mitbewegt.
Generiere eine Szene mit Menschenmenge und zähle die Gesichter.
SceneMixer kostenlos testenCredit-Pakete ab $1.49 · Pro $7.99/Monat · Keine Kreditkarte zum Start nötig
Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer