KI-Dialoggenerator
Aktualisiert 20. September 2026

Die meisten Tools, die von „KI-Dialog“ sprechen, meinen Untertitel: Text, den du über einen Clip klebst. Hier wird die Zeile gesprochen. Das Videomodell erzeugt Bild und Ton in einem Durchgang, sodass der Mund der Figur den Satz in dieser Sprache und diesem Tempo formt – es gibt keine nachträglich angeklebte separate Audiodatei und keinen Lippensynchronisations-Durchgang, der schiefgehen kann.
Daraus ergibt sich eine Konsequenz, die du verstehen solltest, bevor du etwas schreibst: Die Länge einer Zeile bestimmt die Länge einer Einstellung. Sprich sie laut aus und stoppe die Zeit – genau das macht die Pipeline.
| Geschrieben von | Die Skriptanalyse schreibt die Zeilen in die Gliederung jeder Episode; die Einstellungsliste weist sie dann bestimmten Einstellungen mit Sprecher und Spielanweisung zu. |
|---|---|
| Sprache | Einmal pro Projekt vor der Analyse gewählt. Fünfzehn Sprachen stehen zur Auswahl. Die Darsteller spielen in dieser Sprache; Oberfläche und Arbeitsdokumente folgen unabhängig davon deiner eigenen Sprache. |
| Spielanweisungen | Eine kurze Anmerkung in Klammern pro Zeile – wie etwas gesagt wird, nicht was gesagt wird. Sie erreicht das Videomodell als Spielanweisung. |
| Off-Screen-Zeilen | Explizit markiert: Voice-Over, Erzählstimme, innere Stimme, Stimme am Telefon. Markierte Zeilen bewegen auf dem Bildschirm niemandes Mund. |
| Einstellungslänge | Aus der Zeile abgeleitet. Englisch wird mit drei Wörtern pro Sekunde getimt, Chinesisch mit fünf Zeichen pro Sekunde. Eine kurze Zeile bekommt trotzdem eine Mindestlänge, damit die Einstellung nicht abgeschnitten wirkt. |
| Stimmen | Werden aus einer voreingestellten Stimmenbibliothek zugeordnet, oder du lädst ein Sample für eine Figur hoch. Kein Klonen von Stimmen von Personen, für die du keine Rechte hast. |
| Bearbeitung | Kostenlos. Schreibe jede Zeile in der Einstellungsliste um; nur die Segmente, die du berührt hast, werden neu gerendert. |
Eine Zeile mit achtzehn englischen Wörtern braucht etwa sechs Sekunden Bildschirmzeit. Gibst du einem Videomodell eine viersekündige Einstellung mit achtzehn Wörtern, passiert eines von zwei Dingen: Die Sprechweise wird zu unverständlichem Gehetze, oder das Modell lässt die zweite Satzhälfte stillschweigend weg. Keiner der Fehler macht sich bemerkbar – du merkst es erst, wenn du den Schnitt ansiehst.
Deshalb berechnet die Einstellungsliste die Mindestlänge aus der Zeile selbst und schreibt diesen Wert in die Einstellung. Addieren sich die Einstellungen eines Segments zu mehr, als das Segment fassen kann, wird das Segment an einer Einstellungsgrenze geteilt, statt komprimiert zu werden. Du kannst jede Dauer manuell überschreiben; die Rechnung sorgt dafür, dass die Standardeinstellung nie in die Richtung falsch ist, die eine Aufnahme ruiniert.
Jede Zeile trägt eine kurze Anmerkung in Klammern – die Art, wie ein Regisseur sie am Tisch sagt, nicht das Adverb eines Romanautors. „Flach, bereits entschieden.“ „Versucht, nicht zur Tür zu blicken.“ Diese erreichen das Modell als Spielanweisung und verändern die Lesart merklich. Zwei Regeln, die die Pipeline durchsetzt, damit sie nützlich bleiben:
Wenn das Modell Zeilen ohne Anmerkungen zurückgibt – was unvorhersehbar vorkommt –, füllt ein separater kleiner Durchgang nur die fehlenden aus, ohne die Zeilen selbst zu berühren.
Die Dialogsprache ist eine Projekteinstellung, keine Einstellung pro Zeile, und wird vor der Analyse gewählt, weil sie verändert, was geschrieben wird, nicht nur, wie es gerendert wird. Ein chinesischer Webroman mit englischer Dialogeinstellung erzeugt englische Zeilen mit englischem Rhythmus – keine übersetzten chinesischen Sätze. Namen und Schauplätze passen sich an, wenn du auch eine Zielregion festlegst.
Was sich nicht ändert, ist der Preis: Ein Segment kostet in jeder Sprache gleich viele Credits, und die Arbeitsdokumente, die du liest, werden kostenlos übersetzt. Details findest du in dem Leitfaden zur Dialogsprache; nativer Dialog vs. Synchronisation erklärt, warum dies kein Synchronisationsdurchgang ist.
Dialog ist kein separater Posten – er wird von den beiden kostenpflichtigen Stufen geschrieben, die du ohnehin durchläufst. Die Skriptanalyse kostet 4 Credits pro 3,333 Zeichen englischen Text; die Einstellungsliste jeder Episode kostet 1 Credit pro 333 Zeichen dieser Episode. Das Umschreiben einer Zeile ist kostenlos; das Neuerendern des Segments, das sie enthält, kostet den Videopreis des Segments, ab 10 Credits pro Sekunde (ca. $0.06/s im niedrigster Credit-Preis). Stimmenabgleich kostet nichts. Neue Konten starten mit 50 Credits und einer kostenlosen Vorschau von bis zu 5 Sekunden – genug, um eine Zeile gesprochen zu hören, bevor du etwas bezahlst. Die vollständige Tabelle findest du auf der Preisseite.
Sprachen
Jede Serie unten wurde mit derselben Pipeline produziert, wobei die Darsteller die jeweilige Sprache auf muttersprachlichem Niveau sprechen: Oberfläche, Arbeitsdokumente und gesprochene Zeilen sind in einer Sprache, nichts ist synchronisiert. Öffne eine Serie, um es dir anzuhören.
A Carta de LisboaPortuguêsMuttersprachliche Dialoge
윈터 프라미스한국어Muttersprachliche Dialoge
El Secreto de CostaEspañolMuttersprachliche Dialoge
浪人の誓い日本語Muttersprachliche Dialoge
Ikrar JakartaBahasa IndonesiaMuttersprachliche Dialoge
Зимняя коронаРусскийMuttersprachliche Dialoge
L’Héritier du DéfiléFrançaisMuttersprachliche Dialoge
Il Tavolo dell'OlivaItalianoMuttersprachliche Dialoge
De Vuurtoren van de FjordNederlandsMuttersprachliche Dialoge
العهد الصحراويالعربيةMuttersprachliche Dialoge
Çantasındaki SözleşmeTürkçeMuttersprachliche Dialoge
Die Istanbul-TäuschungDeutschIn deiner Sprache
Останній сигналУкраїнськаMuttersprachliche Dialoge
問劍青雲繁體中文Muttersprachliche Dialoge
The Last EnvelopeEnglishMuttersprachliche DialogeJa. Die Shotlist ist bearbeitbarer Text – ersetze eine beliebige Zeile durch deinen eigenen Text, und nur dieses Segment wird neu gerendert. Viele Nutzer fügen auch ein fertiges Drehbuch ein; in dem Fall übernimmt die Analyse die vorhandenen Zeilen, statt neue zu erfinden.
Über die Sprechanweisung in Klammern daneben. Halte sie kurz und beziehe dich auf die Art des Sprechens, nicht auf den Inhalt: „leise, nicht fragend“ verändert die Lesart; „sie sagt, dass sie geht“ tut das nicht, weil die Zeile das bereits aussagt.
Ja – die Stimme ist eine Eigenschaft der Figur im Projekt, wird einmal zugeordnet und wiederverwendet, genau wie das Gesicht. Wenn du für eine Figur ein eigenes Sample hochlädst, bleibt diese Auswahl dauerhaft erhalten und wird durch spätere Zuordnungen nicht überschrieben.
Sie werden zu einer markierten Zeile – innere Stimme oder Erzählung –, sodass man sie hört, während das Bild etwas Sehenswertes zeigt, statt zu einer Einstellung von jemandem, der nachdenkt.
Ja, und das ist der Normalfall: Oberfläche und Arbeitsdokumente folgen deiner Sprache, die gesprochenen Zeilen folgen der Einstellung des Projekts. Ein englischsprachiger Produzent kann eine koreanischsprachige Serie veröffentlichen und trotzdem alle Dokumente auf Englisch lesen.
Eine kostenlose Vorschau rendert die erste Einstellung deiner eigenen Episode, eingesprochen.
SceneMixer kostenlos testenCredit-Pakete ab $1.49 · Pro $7.99/Monat · Keine Kreditkarte zum Start nötig
Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer