SceneMixer
Deutsch
Kostenlos registrieren

Leitfaden · Produktion

Charakterkonsistenz bei KI-Kurzserien (2026): Warum sich Gesichter zwischen Einstellungen ändern – und die drei Ebenen, die sie festlegen

Aktualisiert 12. September 2026

Kurze Antwort: Charakterkonsistenz bei KI-Kurzserien bedeutet, dass eine Figur über Dutzende bis Hunderte von Einstellungen einer Serie hinweg dasselbe Gesicht, dieselbe Garderobe und Requisiten sowie dieselbe künstlerische Ausrichtung behält. Im Jahr 2026 ist dies der Hauptgrund, warum Plattformen und Zuschauer KI-produzierte Serien ablehnen. Sie lässt sich nicht durch die Formulierung von Prompts lösen. Sie wird auf drei getrennten Ebenen festgelegt: dem Charakterbogen (weißer Hintergrund, gerichtetes Licht, Identitätsmerkmale zuerst), dem Szenenplate (leeres Set, drei Tiefenebenen, Lichtquelle beschrieben statt wo das Licht auftrifft) und der Einstellungskontinuität innerhalb des Storyboards (Handlungen und Positionen werden übernommen, nie Personen benannt, die nicht im Bild sind). Gesichtsdrift hat drei Hauptursachen, die jeweils einer Ebene zuzuordnen sind: Textbeschreibungen werden verwässert, Referenzen enthalten eingebranntes Licht, und zwischen Einstellungen fehlen Anker. Unten: Was auf jeder Ebene zu tun ist, eine Tabelle für Referenzeingaben und eine Checkliste zur Abnahme von 5 Einstellungen.
Standbild aus „Der Schwur des Adlers“, einer vollständig von SceneMixer generierten AI-Kurzserie (9 Charaktere, 1 Episode)
Beispiel: „Der Schwur des Adlers“ — Realistisches HD, 1 Episode, vollständig von SceneMixer aus dem Skript produziert · Episoden ansehen

Was „konsistent“ bedeutet: drei Ebenen

  1. Identitätsmerkmale: Gesichtsform, Augenbrauen und Augen, Nase und Lippen, Hautton, Haare, Statur, scheinbares Alter sowie ein sofort wiedererkennbarer Anker (eine Narbe, ein Muttermal, ein Schmuckstück, eine Frisur). Wird durch den Charakterbogen getragen.
  2. Garderobe, Make-up und Requisiten: Was diese Figur in dieser Szene trägt und hält, und was das Set enthält. Wird durch die figurenbezogene Kostümbeschreibung aus der Skriptanalyse und durch das Szenenplate getragen. Kostüme gelten pro Figur und pro sozialer Schicht, nicht als einheitlicher Style-Tag für die gesamte Serie.
  3. Licht und künstlerische Ausrichtung: Farbdisziplin, Materialien, Dichte der Set-Ausstattung, Position der Lichtquelle. Wird durch das Szenenplate und durch die Lichtangaben in jeder Einstellung getragen. Die Referenzbilder selbst müssen neutral bleiben.

Warum Gesichter driften: drei Hauptursachen

SymptomHauptursacheEbene
Dieselbe Figur bekommt alle paar Segmente ein neues Gesicht und wird langsam generischVerwässerte Beschreibung: Die Gesichtsbeschreibung steht mitten in langen Handlungs- und technischen Anweisungen, und das Modell greift auf seinen „attraktives Gesicht“-Prior zurückEbene 1: Identität steht im Bogen-Prompt nicht an erster Stelle, oder der Bogen wird nicht bei jeder Generierung als Referenz angehängt
Richtiges Gesicht, aber Licht und Farbtemperatur springen zwischen Einstellungen derselben SzeneEingebranntes Licht: Der Bogen oder das Plate enthält dramatisches Licht, das jede Einstellung übernimmt und dann mit dem eigenen Licht des Storyboards kollidiertEbene 2: Referenzen sind nicht neutral
Positionen, Handlungen und Requisiten verbinden sich nicht innerhalb eines Segments; Personen, die nicht in der Szene sind, laufen hereinKein Anker zwischen Einstellungen: Kontinuität ist nicht geschrieben, oder das Storyboard nennt abwesende Personen in negativer Formulierung („X verlässt das Bild“)Ebene 3: Kontinuität

Ebene 1: der Charakterbogen

Der Bogen dient der Wiedererkennbarkeit, nicht der Stimmung. Vier feste Regeln:

Bekannter Fehler: Figuren in langen Mänteln oder Roben werden in einem 9:16 Ganzkörperbild vom Kleidungsstück verschluckt – der Mantel füllt siebzig Prozent des Bildes und das Gesicht schrumpft. Das ist eine physische Grenze des Bildausschnitts. Die Lösung ist ein separater Halbkörperbogen, der das Gesicht trägt, auf Kosten eines weiteren Bildes pro Figur.

In SceneMixer wird das aus der Skriptanalyse erzeugte Aussehensfeld direkt zum Gegenstand des Bogen-Prompts. Jede Figur bekommt einen 9:16 Ganzkörperbogen auf Weiß, mit automatisch zugeschnittenen Gesichts- und Halbkörperausschnitten, und jede spätere Videogenerierung hängt die Referenzen dieser Figur an. Bevor du die Bogenqualität beurteilst, bestätige, welches Bildmodell ihn erzeugt hat: Ausgabegröße und Prior unterscheiden sich stark zwischen Modellen, und der Beleg sind die Bildabmessungen und der Task-Datensatz, keine Vermutung.

Ebene 2: das Szenenplate

Ein Szenenbild ist ein leeres „Plate“, auf das sich das Videomodell bezieht. Der Standard ist erneut Neutralität:

Künstlerische Ausrichtung ist eine Einstellung auf Projektebene, die in Szenenbilder, Requisitenbilder und Videoprompts einfließt, und niemals in den Charakterbogen, da sonst der weiß hinterlegte Bogen wie das Set beleuchtet wird.

Ebene 3: Kontinuität im Storyboard

Referenz-Eingaben nach Modell

ModellReferenz-EingabenClip-LängeHinweiseGeprüft
Seedance 2.0 (Volcano Engine Ark)Text plus Bild-, Video- und Audioreferenzen; Bilder können erstes Frame, letztes Frame oder Figurenreferenz sein4–15 sNativer Ton; Bilder bis 30 MB und 300–6000 px pro Seite; einer der Videopfade in SceneMixer2026-09-05, gemäß Ark API-Dokumentation
Wan 3.0 (Alibaba Cloud Model Studio)Bis zu 10 Referenzbilder, 5 Referenzvideos und 5 Referenzaudios pro Anfrage; Prompt bis 20.000 Zeichen2–30 s480P / 720P / 1080P; fehlgeschlagene Generierungen werden nicht berechnet; der andere Videopfad in SceneMixer2026-09-05, gemäß Model Studio API-Dokumentation
Andere VideomodelleDie meisten akzeptieren Bildreferenzen oder erstes/letztes FrameVariiertLimits ändern sich häufig; unabhängig vom Modell funktioniert die Methode mit weißem Blatt und neutralem Plate gleich2026-09-05

Nur verifizierte Zellen sind ausgefüllt; Leerstellen bleiben Leerstellen, keine Schätzungen. Was Konsistenz entscheidet, ist nicht, ob das Limit bei 9 Referenzen oder 50 liegt, sondern ob die wenigen, die du anhängst, neutral sind.

Abnahme-Checkliste: fünf Shots derselben Figur nebeneinander

Wenn ein Shot fehlschlägt, geh zurück zu der Ebene, der er zugeordnet ist, und korrigiere diese Ebene. „Den Prompt verstärken“ ist keine Lösung.

Weiterführende Informationen

Wie das Drehbuch selbst Konsistenz aufbaut (ein Name pro Ort, nicht mehr als drei oder vier Sets pro Folge), steht in Vertical Short Drama Script Format and Hook Structure. Regeln zu Offenlegung und Persönlichkeitsrechten findest du in AI Short Drama Compliance Checklist 2026. Um die Methode an einer fertigen Serie zu sehen, öffne die Beispieldramen: jedes zeigt das Figurenblatt sowie Skript und Video jedes Segments.

FAQ

Warum brauchen Figuren-Referenzbilder einen weißen Hintergrund?

Weil jedes Licht und jeder Hintergrund, das im Referenzbild eingebrannt ist, von jedem Shot übernommen wird, in dem die Figur auftritt. Ein Figurenblatt, das unter kaltem Nachtlicht aufgenommen wurde, lässt Tagesszenen kalt wirken; ein Requisit im Hintergrund wird als Teil der Figur neu gezeichnet. Ein weißer Hintergrund mit einem gerichteten Key Light bei etwa 75 Grad erfasst nur die Gesichtsstruktur und enthält keine Szeneninformationen, sodass die Beleuchtung jedes Shots sie überlagern kann.

Wie behebe ich inkonsistente Figuren in AI-Videos?

Diagnostiziere nach Ebenen, bevor du Prompts änderst. Unterschiedliche Gesichter zwischen Shots sind ein Problem des Figurenblatts: prüfe auf flache Beleuchtung oder ein zu klein im Bild sitzendes Gesicht. Richtiges Gesicht, aber springende Kostümbeleuchtung: da widersprechen sich das Szenen-Plate und die Shot-Beleuchtung. Positionen und Handlungen, die innerhalb eines Segments nicht zusammenpassen, liegen an fehlender Kontinuität im Storyboard. Jede Ebene hat ihre eigene Lösung; einen einzigen großen Prompt umzuschreiben, macht alle drei Probleme schlimmer.

Kann ich eine Figur konsistent halten, indem ich das Gesicht in jedem Prompt beschreibe?

Nein. Über Dutzende Generierungen hinweg wird die Beschreibung durch Handlung, Setting und Beleuchtungsanweisungen jedes Segments verwässert, und das Modell fällt auf ein generisches attraktives Gesicht zurück. Die stabile Methode ist, dasselbe Figurenblatt als Referenzbild an jede Generierung anzuhängen und den Text nur Handlung und Emotion des jeweiligen Segments tragen zu lassen.

Wie viele Referenzbilder braucht jede Figur?

Mindestens ein 9:16 Ganzkörper-Blatt auf Weiß. Hauptfiguren profitieren von einem zusätzlichen Gesichtsausschnitt für Nahaufnahmen. Figuren in langen Mänteln oder Roben gehen im Ganzkörperbild oft im Kostüm unter, da lohnt sich ein separates Halb-körper-Blatt mit sichtbarem Gesicht als zusätzliches Bild.

Die drei Ebenen sind in die Pipeline integriert

Erscheinungstext aus der Analyse wird zum Motiv des Blatts; weiße Blätter und neutrale Plates laufen mit jedem Segment mit, das du generierst.

Kostenlos anmelden

Sieh dir dieselbe Figur über mehrere Shots in den Beispieldramen an, bevor du dich entscheidest.

Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer