Konsistente Charaktere
Aktualisiert 30. September 2026

Ein Text-zu-Video-Modell rendert jede Generierung unabhängig voneinander. Beschreibe eine Frau um die Dreißig mit einer Narbe über einer Augenbraue in Einstellung 1 und nochmal in Einstellung 30, und du bekommst zwei Frauen, die zur Beschreibung passen, aber nicht zueinander — Adjektive reichen nicht aus, um ein Gesicht eindeutig zu bestimmen. Jede der folgenden Lösungen basiert auf derselben Idee an anderer Stelle: Hör auf, den Charakter zu beschreiben, und gib dem Modell ein Bild von ihm.
| Referenzblatt | Jeder Charakter wird einmal als Ganzkörperblatt im 9:16-Format auf einfarbigem Hintergrund unter gerichtetem Schlüssellicht erstellt — ein Casting-Foto, kein Stimmungsbild, denn alles Licht, das im Blatt festgelegt ist, wird von jeder Einstellung übernommen, die es nutzt. |
|---|---|
| Angehängte Ausschnitte | Gesichts- und Körperausschnitte aus diesem Blatt werden mit jedem Segment gesendet, in dem der Charakter vorkommt. Das Modell gleicht ein Bild ab, statt eine Beschreibung zu interpretieren. |
| Verknüpfungen per ID | Storyboards verweisen auf Assets per Kennung, nicht per Name. Zwei Charaktere mit demselben Namen oder eine Namensänderung mitten im Projekt brechen die Kette nicht mehr stillschweigend. |
| Regel für außerhalb des Bilds | Ein Charakter, der nur angeschaut, angesprochen oder nach dem gegriffen wird — und nicht im Bild ist — wird als Regieanweisung geschrieben, nie benannt. Ein abwesender Charakter zu nennen, führt dazu, dass das Modell sein Gesicht in eine Einstellung mit nur einer Person einfügt. |
Ein fünfter, kleinerer Punkt: Jede Person in einer Einstellung trägt ein oder zwei unterscheidende Gesichtsmerkmale, die aus ihrer eigenen Beschreibung stammen. Das mildert den klassischen Fehler, bei dem zwei Charaktere in derselben Uniform mitten in der Einstellung die Gesichter tauschen.
Konsistenz kann nicht „nie ändern“ bedeuten — ein Charakter, der in Folge 6 in Brand gerät, muss in Folge 7 verbrannt aussehen. Die Trennlinie ergibt sich daraus, wie ein Videomodell ein Referenzbild behandelt: Es kopiert Gesicht, Kleidung, Form und Struktur fast wörtlich, und es wendet Licht, Wetter und Tageszeit als darüber gelegte Effekte an.
Das falsch herum zu machen, kostet in beide Richtungen viel: Eine Variante für „hält die Tasse“ ist ein Bild, für das du bezahlst und das du nie sehen wirst, und ein Prompt für „nach dem Feuer“ ist eine Anfrage, die das Modell höflich ignoriert — zugunsten des sauberen Raums in seiner Referenz.
Die ausführliche Erklärung mit dem, was jede Ebene erfassen kann und was nicht, findest du in dem Leitfaden zur Charakterkonsistenz.
Referenzblätter sind ein eigener Posten, getrennt von der Skriptanalyse (4 Credits pro 3,333 Zeichen englischen Textes): Jedes Konto bekommt 15 Referenzbilder kostenlos, und zusätzliche oder neu generierte Bilder danach kosten 7 Credits pro Stück beim Standard-Bildmodell. Zustandsvarianten haben bei einem ersten Projekt ein kleines eigenes Freikontingent und werden danach als Bilder abgerechnet. Video selbst beginnt bei 10 Credits pro Sekunde Ausgabe (≈ $0.06/s bei niedrigster Credit-Preis), egal ob Referenzen angehängt sind — Konsistenz ist kein Aufpreis. Details auf der Preisseite.
Konsistenz ist die eine Behauptung in dieser Kategorie, der du nie vertrauen solltest — und das musst du auch nicht. Ein neues Konto hat 50 Credits, 15 kostenlose Referenzbilder für Charaktere, Szenen und Requisiten, ein kostenloses Folge-1-Storyboard bei deinem ersten Projekt und eine kostenlose Vorschau von bis zu 5 Sekunden, die die Eröffnungseinstellung deiner eigenen Episode mit deinen eigenen Blättern rendert. Das reicht für einen echten Test:
Zur Einordnung: Das durchschnittliche Projekt auf dieser Plattform hat fünf benannte Charaktere, und neun von zehn haben weniger als zehn. Wenn deine Geschichte dreißig braucht, funktioniert derselbe Mechanismus immer noch — die Kosten liegen in den Blättern, nicht in der Konsistenz.
Die Dialogsprache wird einmal in Schritt 1 festgelegt – der gesamte Durchlauf läuft in dieser Sprache, und die Zielregionseinstellung passt gleichzeitig Namen, Gesichter und Straßen an diesen Markt an. Jedes Beispiel unten wurde so erstellt, eines pro Sprache.
Sprachen
Jede Serie unten wurde mit derselben Pipeline produziert, wobei die Darsteller die jeweilige Sprache auf muttersprachlichem Niveau sprechen: Oberfläche, Arbeitsdokumente und gesprochene Zeilen sind in einer Sprache, nichts ist synchronisiert. Öffne eine Serie, um es dir anzuhören.
A Carta de LisboaPortuguêsMuttersprachliche Dialoge
윈터 프라미스한국어Muttersprachliche Dialoge
El Secreto de CostaEspañolMuttersprachliche Dialoge
浪人の誓い日本語Muttersprachliche Dialoge
Ikrar JakartaBahasa IndonesiaMuttersprachliche Dialoge
Зимняя коронаРусскийMuttersprachliche Dialoge
L’Héritier du DéfiléFrançaisMuttersprachliche Dialoge
Il Tavolo dell'OlivaItalianoMuttersprachliche Dialoge
De Vuurtoren van de FjordNederlandsMuttersprachliche Dialoge
العهد الصحراويالعربيةMuttersprachliche Dialoge
Çantasındaki SözleşmeTürkçeMuttersprachliche Dialoge
Die Istanbul-TäuschungDeutschIn deiner Sprache
Останній сигналУкраїнськаMuttersprachliche Dialoge
問劍青雲繁體中文Muttersprachliche Dialoge
The Last EnvelopeEnglishMuttersprachliche DialogeDasselbe Gesicht über eine gesamte Serie hinweg ist das Designziel – und das, was die Referenzblatt-Architektur für die Darsteller in deiner Asset-Bibliothek liefert. Es ist keine Garantie für jedes Einzelbild: Charaktere in identischer Kleidung, die sich eine Einstellung teilen, und Charaktere, deren Blatt hauptsächlich aus einem Mantel besteht, bleiben die schwierigen Fälle. Alles andere – Anzahl der Episoden, verstrichene Zeit, wie viele Einstellungen ein Charakter hat – beeinträchtigt die Konsistenz nicht, weil jede Einstellung mit demselben Bild abgeglichen wird.
Ja. Jedes Referenzblatt kann durch ein von dir hochgeladenes Bild ersetzt werden – der Rest der Pipeline behandelt es genau wie ein generiertes. Das ist der Weg für einen Charakter, den du bereits woanders entworfen hast.
Technisch gesehen ist es dem Upload-Pfad egal, was das Bild zeigt – aber die Veröffentlichung von KI-Videos mit dem Abbild einer echten Person ist in den meisten Märkten ein rechtliches Problem, und unser Compliance-Leitfaden behandelt es als solches. Wir bieten kein Face-Swap-Tool an und empfehlen es nicht.
Nichts geht kaputt. Storyboards verweisen auf Assets per Kennung, und die Umbenennung wird gleichzeitig im gespeicherten Text übernommen. Vor September 2026 wurden Referenzen per Namen abgeglichen – genau dieser Fehler wurde mit dieser Änderung behoben.
Nein. Das Anhängen von Referenzbildern an ein Segment ändert den Preis pro Sekunde nicht – du zahlst einmal pro Referenzblatt, dann nichts weiter, egal wie viele Einstellungen es nutzen. Konsistenz ist hier eine Architekturentscheidung, kein Upsell.
Nein, und das solltest du auch nicht. Der Einstellungstext nennt den Charakter; das Referenzbild trägt, wie er aussieht. Wenn du eine körperliche Beschreibung im Einstellungstext wiederholst, lenkst du das Modell zurück zu den Wörtern und weg vom Bild – genau diese Abweichung beseitigt dieses Design.
Ja – dafür gibt es Zustandsvarianten. Jeder Look ist ein eigenes Referenzbild, und das Storyboard legt pro Segment fest, welcher gilt – bis hin zum einzelnen Segment, nicht nur für die ganze Episode.
Generiere die Darsteller einmal; jede weitere Einstellung passt sich einem Bild an, nicht einer Beschreibung.
SceneMixer kostenlos testenCredit-Pakete ab $1.49 · Pro $7.99/Monat · Keine Kreditkarte zum Start
Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer