SceneMixer
Deutsch
Kostenlos registrieren

KI-Szenen mit mehreren Charakteren

KI-Generator für Szenen mit mehreren Charakteren

Aktualisiert 20. September 2026

Kurze Antwort: Jede Einstellung enthält eine explizite Liste, wer im Bild ist – und nur diese Liste verknüpft die Charakter-Referenzbilder. Wer nur angesehen oder angesprochen wird, taucht als Regieanweisung auf, nicht als Name, und erscheint nie mit einem erfundenen Gesicht im Bild. Nur der Mund des benannten Sprechers bewegt sich. Hintergrundmengen sind ein deklarierter Zustand der Szene oder fehlen ganz. Ab vier benannten Personen in einem Bild deckt die Liste die Szene stattdessen in Einzeleinstellungen ab.
Standbild aus „Rust City Knockout“, einer vollständig von SceneMixer generierten AI-Kurzserie (6 Charaktere, 1 Episode)
Beispiel: „Rust City Knockout“ — Malerischer Anime, 1 Episode, vollständig von SceneMixer aus dem Skript produziert · Episoden ansehen

Das Schwierige ist, wer im Bild ist – nicht wie viele

Generierte Videos haben einen typischen Fehler, wenn mehr als eine Person in einer Einstellung zu sehen ist: Es taucht ein Gesicht auf, das dort nicht hingehört. Jemand, der im Text erwähnt wird – den man ansieht, dem man zuruft, an den man denkt – erscheint im Bild mit einem spontan erfundenen Gesicht, weil dem Modell niemand den Unterschied zwischen „anwesend“ und „erwähnt“ mitgeteilt hat.

Deshalb gibt die Einstellungsliste das pro Einstellung an. Jede Einstellung trägt eine explizite Liste, welche Charaktere im Bild sind – und nur diese Liste, nicht der Text und nicht der Endzustand der vorherigen Einstellung, entscheidet, wessen Referenzbilder verknüpft werden.

Auf einen Blick

So wird eine Einstellung mit mehreren Charakteren festgelegt
Wer im Bild istEine Liste pro Einstellung. Die Vereinigung über alle Einstellungen eines Segments hinweg bestimmt, welche Referenzbilder mitgeschickt werden.
Wer außerhalb des Bildes istWird als Regieanweisung geschrieben – „nach links im Bild“, „Blick zur Kamera“ –, nicht als Name. Dem wird kein Gesicht zugewiesen.
EinzeleinstellungenExplizit markiert, damit der Renderer weiß, dass nur eine Person im Bild ist und keine weitere erfinden soll.
Wer sprichtWird pro Zeile benannt; alle anderen im Bild werden als „Lippen geschlossen“ markiert, sodass sich nur der Mund des Sprechers bewegt.
HintergrundmengeEin deklarierter Zustand der Szene, einmal im Segment-Header notiert – oder fehlend. Nie durch Umgebungsgeräusch impliziert.
Praktische ObergrenzeAb vier benannten Personen in einem Bild sinkt die Qualität. Die Einstellungsliste umgeht das, statt es zu erzwingen.

Warum die Nennung eines Charakters außerhalb des Bildes die Einstellung zerstört

Das ist messbar, nicht theoretisch. Bei Einstellungen, die einen Antagonisten außerhalb des Bildes benannten, entstanden in fünf von acht Renderings falsche Gesichter oder eine zusätzliche Person. Dieselben Einstellungen, umgeschrieben mit einer Richtung statt eines Namens, ergaben in zwölf Renderings null solcher Fehler. Deshalb schreibt die Pipeline sie um: In einer Einzeleinstellung wird ein Charakter, der nur als Blickrichtung oder Bewegungsrichtung existiert, in eine räumliche Formulierung umgewandelt und aus der Bildliste entfernt.

Dieselbe Logik gilt für Tote: Ein Charakter, auf den in diesem Segment nur als Leiche verwiesen wird, wird als einfaches Substantiv geschrieben, nicht als Charakterreferenz – sodass niemand sein Referenzbild lädt und ihn aufstellt.

Zwei Personen, die einander gegenüberstehen

Es gibt genau zwei Möglichkeiten, das zu drehen, und die Liste muss eine wählen: eine Profil-Zweier-Einstellung oder eine Über-die-Schulter-Einstellung. Nicht geschrieben werden darf „A steht B gegenüber, B im Hintergrund unscharf“ – damit B in As Tiefenschärfe liegt, müsste A B den Rücken zukehren, und diese Kameraposition existiert in einer normalen Halbtotalen nicht. Fordert man es trotzdem, stellt der Renderer eine Person frontal zur Kamera und die andere hinter sie. Die Achse wird in der ersten Einstellung festgelegt, in der beide tatsächlich gemeinsam im Bild sind.

Mengen werden deklariert – oder sie fehlen

Ein Saal mit dreihundert Gästen ist ein sichtbarer Zustand der Szene und wird so notiert – eine Zeile im Segment-Header, die sagt, wer die Hintergrundpersonen sind, wo sie sind und was sie tun. Konsistent für alle Segmente dieser Szene. Ohne diese Zeile darf die Einstellung überhaupt keine Menge erwähnen, denn „Gemurmel von Gästen“ im Umgebungs-Ton ist keine visuelle Anweisung; ein Renderer, dem nur das mitgeteilt wird, liefert in einer Einstellung Gäste und in der nächsten einen leeren Saal.

Wenn eine Menge deklariert ist, ändert sich die Bildanweisung entsprechend: Die Menge bleibt in der Tiefenschärfe, und die Bildliste zählt weiterhin nur die benannten Charaktere.

Was es nicht tut

Was es kostet

Nichts extra – das sind Eigenschaften der Einstellungsliste, die nach Skriptlänge mit 1 Credit pro hundert Zeichen des Episodenanteils abgerechnet wird. Referenzbilder kosten 7 Credits pro Stück über die 15 kostenlosen im ersten Projekt hinaus, und das Rendering startet bei 10 Credits pro Sekunde Ausgabe. Siehe Charakterkonsistenz dazu, wie Gesichter über Einstellungen hinweg gleich bleiben, und die Preisseite für die Tarife.

Sprachen

Muttersprachliche Dialoge in 15 Sprachen

Jede Serie unten wurde mit derselben Pipeline produziert, wobei die Darsteller die jeweilige Sprache auf muttersprachlichem Niveau sprechen: Oberfläche, Arbeitsdokumente und gesprochene Zeilen sind in einer Sprache, nichts ist synchronisiert. Öffne eine Serie, um es dir anzuhören.

Alle 15 Sprachen anzeigen

Häufig gestellte Fragen

Wie viele Charaktere können in einer Einstellung zu sehen sein?

Vier benannte Personen sind die praktische Obergrenze, bevor die Identitätsdarstellung nachlässt. Die Einstellungsliste ist darauf ausgelegt, darunter zu bleiben – Ensembleszenen werden in Einzeleinstellungen und Über-die-Schulter-Einstellungen abgedeckt statt in weiten Gruppenbildern.

Warum ist ein Charakter, den ich nur erwähnt habe, im Bild aufgetaucht?

Genau diesen Fehler verhindert die Bildliste pro Einstellung. Ein Charakter, der nur angesehen oder angesprochen wird, wird als Richtung geschrieben, nicht als Name, und steht nicht in der Bildliste – also wird kein Referenzbild verknüpft und kein Gesicht erfunden.

Können zwei Charaktere einander direkt ansprechen?

Ja, als Profil-Zweier-Einstellung oder Über-die-Schulter. Was nicht funktioniert, ist eine Person frontal, die andere unscharf im Hintergrund: Diese Kombination aus Bildausschnitt und Tiefenschärfe ist physikalisch unstimmig, und die Forderung danach führt dazu, dass eine Person hinter jemandem steht und zur Kamera spricht.

Wie funktionieren Hintergrundkomparsen?

Sie werden einmal im Segment-Header festgelegt – wer sie sind, wo sie sind, was sie tun – und bleiben in dieser Szene konsistent. Wenn nichts festgelegt ist, enthält die Einstellung keine Menschenmenge. Allein Umgebungsgeräusche einer Menge zählen nicht als visuelle Anweisung.

Wer bewegt den Mund?

Nur der benannte Sprecher jeder Zeile. Alle anderen im Bild sind explizit mit geschlossenen Lippen markiert – das verhindert, dass ein Zuhörer leise zum Dialog mitbewegt.

Niemand im Bild, den du nicht besetzt hast

Generiere eine Szene mit Menschenmenge und zähle die Gesichter.

SceneMixer kostenlos testen

Credit-Pakete ab $1.49 · Pro $7.99/Monat · Keine Kreditkarte zum Start nötig

Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer