SceneMixer
Deutsch
Kostenlos registrieren

KI-Dialoggenerator

KI-Dialoggenerator

Aktualisiert 20. September 2026

Kurze Antwort: SceneMixer schreibt Dialoge direkt in die Skriptanalyse, weist jede Zeile einer Einstellung mit Sprecher und kurzer Spielanweisung zu – das Videomodell führt sie aus, Bild und Ton entstehen gemeinsam, sodass der Mund genau den Satz in der gewählten Sprache formt. Einstellungslängen werden aus der Zeile berechnet, bei Englisch mit drei Wörtern pro Sekunde, sodass eine Einstellung nie zu kurz für den darin liegenden Satz ist. Das Bearbeiten einer Zeile ist kostenlos.
Standbild aus „Der gläserne Boden“, einer vollständig von SceneMixer generierten AI-Kurzserie (5 Charaktere, 1 Episode)
Beispiel: „Der gläserne Boden“ — Realistisches HD, 1 Episode, vollständig von SceneMixer aus dem Skript produziert · Episoden ansehen

Dialog ist keine Untertitelspur

Die meisten Tools, die von „KI-Dialog“ sprechen, meinen Untertitel: Text, den du über einen Clip klebst. Hier wird die Zeile gesprochen. Das Videomodell erzeugt Bild und Ton in einem Durchgang, sodass der Mund der Figur den Satz in dieser Sprache und diesem Tempo formt – es gibt keine nachträglich angeklebte separate Audiodatei und keinen Lippensynchronisations-Durchgang, der schiefgehen kann.

Daraus ergibt sich eine Konsequenz, die du verstehen solltest, bevor du etwas schreibst: Die Länge einer Zeile bestimmt die Länge einer Einstellung. Sprich sie laut aus und stoppe die Zeit – genau das macht die Pipeline.

Auf einen Blick

Was die Dialogebene erzeugt und was Änderungen kosten
Geschrieben vonDie Skriptanalyse schreibt die Zeilen in die Gliederung jeder Episode; die Einstellungsliste weist sie dann bestimmten Einstellungen mit Sprecher und Spielanweisung zu.
SpracheEinmal pro Projekt vor der Analyse gewählt. Fünfzehn Sprachen stehen zur Auswahl. Die Darsteller spielen in dieser Sprache; Oberfläche und Arbeitsdokumente folgen unabhängig davon deiner eigenen Sprache.
SpielanweisungenEine kurze Anmerkung in Klammern pro Zeile – wie etwas gesagt wird, nicht was gesagt wird. Sie erreicht das Videomodell als Spielanweisung.
Off-Screen-ZeilenExplizit markiert: Voice-Over, Erzählstimme, innere Stimme, Stimme am Telefon. Markierte Zeilen bewegen auf dem Bildschirm niemandes Mund.
EinstellungslängeAus der Zeile abgeleitet. Englisch wird mit drei Wörtern pro Sekunde getimt, Chinesisch mit fünf Zeichen pro Sekunde. Eine kurze Zeile bekommt trotzdem eine Mindestlänge, damit die Einstellung nicht abgeschnitten wirkt.
StimmenWerden aus einer voreingestellten Stimmenbibliothek zugeordnet, oder du lädst ein Sample für eine Figur hoch. Kein Klonen von Stimmen von Personen, für die du keine Rechte hast.
BearbeitungKostenlos. Schreibe jede Zeile in der Einstellungsliste um; nur die Segmente, die du berührt hast, werden neu gerendert.

Warum die Timing-Regel wichtiger ist, als sie klingt

Eine Zeile mit achtzehn englischen Wörtern braucht etwa sechs Sekunden Bildschirmzeit. Gibst du einem Videomodell eine viersekündige Einstellung mit achtzehn Wörtern, passiert eines von zwei Dingen: Die Sprechweise wird zu unverständlichem Gehetze, oder das Modell lässt die zweite Satzhälfte stillschweigend weg. Keiner der Fehler macht sich bemerkbar – du merkst es erst, wenn du den Schnitt ansiehst.

Deshalb berechnet die Einstellungsliste die Mindestlänge aus der Zeile selbst und schreibt diesen Wert in die Einstellung. Addieren sich die Einstellungen eines Segments zu mehr, als das Segment fassen kann, wird das Segment an einer Einstellungsgrenze geteilt, statt komprimiert zu werden. Du kannst jede Dauer manuell überschreiben; die Rechnung sorgt dafür, dass die Standardeinstellung nie in die Richtung falsch ist, die eine Aufnahme ruiniert.

Spielanweisungen: Regie, nicht Bühnengeschäft

Jede Zeile trägt eine kurze Anmerkung in Klammern – die Art, wie ein Regisseur sie am Tisch sagt, nicht das Adverb eines Romanautors. „Flach, bereits entschieden.“ „Versucht, nicht zur Tür zu blicken.“ Diese erreichen das Modell als Spielanweisung und verändern die Lesart merklich. Zwei Regeln, die die Pipeline durchsetzt, damit sie nützlich bleiben:

Wenn das Modell Zeilen ohne Anmerkungen zurückgibt – was unvorhersehbar vorkommt –, füllt ein separater kleiner Durchgang nur die fehlenden aus, ohne die Zeilen selbst zu berühren.

Ein Projekt, eine Dialogsprache

Die Dialogsprache ist eine Projekteinstellung, keine Einstellung pro Zeile, und wird vor der Analyse gewählt, weil sie verändert, was geschrieben wird, nicht nur, wie es gerendert wird. Ein chinesischer Webroman mit englischer Dialogeinstellung erzeugt englische Zeilen mit englischem Rhythmus – keine übersetzten chinesischen Sätze. Namen und Schauplätze passen sich an, wenn du auch eine Zielregion festlegst.

Was sich nicht ändert, ist der Preis: Ein Segment kostet in jeder Sprache gleich viele Credits, und die Arbeitsdokumente, die du liest, werden kostenlos übersetzt. Details findest du in dem Leitfaden zur Dialogsprache; nativer Dialog vs. Synchronisation erklärt, warum dies kein Synchronisationsdurchgang ist.

Was es nicht tut

Was es kostet

Dialog ist kein separater Posten – er wird von den beiden kostenpflichtigen Stufen geschrieben, die du ohnehin durchläufst. Die Skriptanalyse kostet 4 Credits pro 3,333 Zeichen englischen Text; die Einstellungsliste jeder Episode kostet 1 Credit pro 333 Zeichen dieser Episode. Das Umschreiben einer Zeile ist kostenlos; das Neuerendern des Segments, das sie enthält, kostet den Videopreis des Segments, ab 10 Credits pro Sekunde (ca. $0.06/s im niedrigster Credit-Preis). Stimmenabgleich kostet nichts. Neue Konten starten mit 50 Credits und einer kostenlosen Vorschau von bis zu 5 Sekunden – genug, um eine Zeile gesprochen zu hören, bevor du etwas bezahlst. Die vollständige Tabelle findest du auf der Preisseite.

Sprachen

Muttersprachliche Dialoge in 15 Sprachen

Jede Serie unten wurde mit derselben Pipeline produziert, wobei die Darsteller die jeweilige Sprache auf muttersprachlichem Niveau sprechen: Oberfläche, Arbeitsdokumente und gesprochene Zeilen sind in einer Sprache, nichts ist synchronisiert. Öffne eine Serie, um es dir anzuhören.

Alle 15 Sprachen anzeigen

Häufig gestellte Fragen

Kann ich den Dialog selbst schreiben, statt ihn generieren zu lassen?

Ja. Die Shotlist ist bearbeitbarer Text – ersetze eine beliebige Zeile durch deinen eigenen Text, und nur dieses Segment wird neu gerendert. Viele Nutzer fügen auch ein fertiges Drehbuch ein; in dem Fall übernimmt die Analyse die vorhandenen Zeilen, statt neue zu erfinden.

Wie steuere ich, wie eine Zeile gesprochen wird?

Über die Sprechanweisung in Klammern daneben. Halte sie kurz und beziehe dich auf die Art des Sprechens, nicht auf den Inhalt: „leise, nicht fragend“ verändert die Lesart; „sie sagt, dass sie geht“ tut das nicht, weil die Zeile das bereits aussagt.

Klingt dieselbe Figur in allen Episoden gleich?

Ja – die Stimme ist eine Eigenschaft der Figur im Projekt, wird einmal zugeordnet und wiederverwendet, genau wie das Gesicht. Wenn du für eine Figur ein eigenes Sample hochlädst, bleibt diese Auswahl dauerhaft erhalten und wird durch spätere Zuordnungen nicht überschrieben.

Was passiert mit inneren Monologen aus einem Roman?

Sie werden zu einer markierten Zeile – innere Stimme oder Erzählung –, sodass man sie hört, während das Bild etwas Sehenswertes zeigt, statt zu einer Einstellung von jemandem, der nachdenkt.

Kann die Oberfläche in einer Sprache und der Dialog in einer anderen sein?

Ja, und das ist der Normalfall: Oberfläche und Arbeitsdokumente folgen deiner Sprache, die gesprochenen Zeilen folgen der Einstellung des Projekts. Ein englischsprachiger Produzent kann eine koreanischsprachige Serie veröffentlichen und trotzdem alle Dokumente auf Englisch lesen.

Höre eine Zeile an, bevor du dafür bezahlst

Eine kostenlose Vorschau rendert die erste Einstellung deiner eigenen Episode, eingesprochen.

SceneMixer kostenlos testen

Credit-Pakete ab $1.49 · Pro $7.99/Monat · Keine Kreditkarte zum Start nötig

Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer