Sprechende Charaktere
Aktualisiert 20. September 2026

Es gibt zwei Wege, einen Charakter auf dem Bild sprechen zu lassen. Der eine ist, ein stummes Video zu rendern und dann den Mund über eine Audiospur zu steuern – der Lippensynchron-Weg, der einen Gesichtsausschnitt und eine treibende Audiodatei braucht, ein korrekt bewegtes Gesicht erzeugt, aber einen Körper, der nicht mitspielt. Der andere ist, Bild und Ton gemeinsam zu generieren, sodass Darstellung und Mundbewegung eine einheitliche Entscheidung sind.
Diese Pipeline nutzt die zweite Methode. Die standardmäßige Video-Stufe ist audiovisuell: Das Modell erhält die Zeile, den Sprecher, die Sprechart und eine Stimmreferenz und gibt eine Einstellung zurück, in der die Zeile gesprochen wird. Nichts wird nachträglich zusammengefügt.
| Die Zeile | Wortgetreu, einmal. Genau so gesprochen, wie geschrieben – nicht umformuliert, nicht umgetimt. |
|---|---|
| Wer spricht | Namentlich genannt und an die Stimmreferenz dieses Charakters gebunden, sodass dieselbe Person über alle Episoden hinweg gleich klingt. |
| Wie es gesagt wird | Eine kurze Anweisung in Klammern – leise, noch lächelnd, gezwungen flach. Anweisung, nicht Untertitel. |
| Wer sonst noch im Bild ist | Mit „Lippen geschlossen“ markiert, damit Zuhörende nicht mitsprechen. |
| Sprache außerhalb des Bilds | Zuerst in der Klammer markiert – Voice-over, am Telefon, über die Sprechanlage –, danach werden alle sichtbaren Personen mit geschlossenem Mund beschrieben. |
| Timing | Eine Einstellung mit Dialog ist nie kürzer, als die Zeile braucht: im Englischen drei Wörter pro Sekunde, im Chinesischen fünf Zeichen pro Sekunde. |
Jedem Charakter wird eine Stimme aus einer Bibliothek vordefinierter Systemstimmen zugewiesen – du hörst ein drei bis acht Sekunden langes Beispiel vor der Auswahl, kannst neu zuordnen, eine andere Stimme aus der Auswahl wählen oder eine eigene Aufnahme hochladen. Der Grund für die Zuordnung statt einer individuellen Stimmerstellung pro Charakter sind Kosten und Stabilität: Erstellte Stimmen driften zwischen Generierungen und kosten pro Charakter, während eine Bibliotheksstimme in Folge eins und Folge zwölf dieselbe bleibt.
Wenn einem Charakter keine Stimme zugewiesen ist, greift die Einstellung auf eine schriftliche Beschreibung der Stimme zurück – Alter, Klang, Stimmlage –, die das Modell interpretiert. Das ist der Standard für neue Projekte; das Zuweisen von Stimmen ist ein bewusster Schritt, nichts, was bei jedem Charakter automatisch im Hintergrund passiert.
Eine vier Sekunden lange Einstellung kann keine sechzehn englischen Wörter fassen. Entweder wird die Sprechweise bis zur Unverständlichkeit gehetzt oder die Zeile gekürzt. Deshalb haben Dialogeinstellungen eine Untergrenze, die sich aus der Zeile ableitet: Wortzahl geteilt durch drei für Englisch, Zeichenzahl geteilt durch fünf für Chinesisch, und kurze Zeilen bekommen zusätzlich eine Pause, statt auf ihr theoretisches Minimum gequetscht zu werden. Einstellungen, die für ihre Zeile zu kurz zurückkommen, werden vor dem Rendern markiert und korrigiert – das ist günstiger, als es erst im fertigen Output zu merken.
Die Dialogsprache ist eine Projekteinstellung, die einmal gewählt wird, und sie wird dort angewendet, wo die Zeilen zuerst geschrieben werden, statt nachträglich übersetzt zu werden – also wird die Darstellung in dieser Sprache verfasst, statt eine Synchronisation zu sein. Es gibt fünfzehn Oberflächensprachen, und Dialog wird in allen unterstützt; bei einigen Sprachen kommt es auf der Standardmodellstufe gelegentlich zu Fehlaussprachen einzelner Wörter, und in der Auswahl wird darauf hingewiesen, wo das zutrifft. Die Seite zu Charakterstimmen behandelt das ausführlich.
Sprache ist im Videopreis enthalten – es gibt keine separate Audiogebühr. Video kostet ab 10 Credits pro Sekunde Ausgabe (≈ $0.06/s im niedrigster Credit-Preis) und reicht bis $0.47/s auf der schärfsten Stufe; die Zusammenstellung kostet 1 Credit pro Sekunde. Die Stimmzuordnung aus der Bibliothek kostet nichts. Neue Konten erhalten 50 Credits und eine kostenlose Vorschau von bis zu 5 Sekunden – genug, um einen Charakter sprechen zu hören, bevor du dich entscheidest. Die Preise stehen auf der Preisseite.
Sprachen
Jede Serie unten wurde mit derselben Pipeline produziert, wobei die Darsteller die jeweilige Sprache auf muttersprachlichem Niveau sprechen: Oberfläche, Arbeitsdokumente und gesprochene Zeilen sind in einer Sprache, nichts ist synchronisiert. Öffne eine Serie, um es dir anzuhören.
A Carta de LisboaPortuguêsMuttersprachliche Dialoge
윈터 프라미스한국어Muttersprachliche Dialoge
El Secreto de CostaEspañolMuttersprachliche Dialoge
浪人の誓い日本語Muttersprachliche Dialoge
Ikrar JakartaBahasa IndonesiaMuttersprachliche Dialoge
Зимняя коронаРусскийMuttersprachliche Dialoge
L’Héritier du DéfiléFrançaisMuttersprachliche Dialoge
Il Tavolo dell'OlivaItalianoMuttersprachliche Dialoge
De Vuurtoren van de FjordNederlandsMuttersprachliche Dialoge
العهد الصحراويالعربيةMuttersprachliche Dialoge
Çantasındaki SözleşmeTürkçeMuttersprachliche Dialoge
Die Istanbul-TäuschungDeutschIn deiner Sprache
Останній сигналУкраїнськаMuttersprachliche Dialoge
問劍青雲繁體中文Muttersprachliche Dialoge
The Last EnvelopeEnglishMuttersprachliche DialogeNein. Bild und Sprache werden gemeinsam in einem Durchgang generiert, sodass Mundbewegung und Darstellung eine einheitliche Entscheidung sind. Es gibt keine separate Audiospur, die an ein stummes Rendering angepasst wird, und keine Möglichkeit, ein Foto oder ein hochgeladenes Video zu steuern.
Du kannst eine Aufnahme als Stimmreferenz für einen Charakter hochladen. Das Klonen der Stimme einer anderen Person wird nicht angeboten.
Das sollten sie nicht – jeder nicht sprechende Charakter im Bild wird ausdrücklich mit geschlossenen Lippen markiert, das ist die Anweisung, die verhindert, dass ein Zuhörer die Zeile mitspricht.
Die Markierung für außerhalb des Bilds steht zuerst in der Sprechanweisung, danach werden alle sichtbaren Personen in der Einstellung mit geschlossenem Mund beschrieben – also ist die Zeile zu hören, ohne dass jemand sichtbar spricht.
Weil die Zeile die Zeit braucht. Einstellungen mit Dialog haben eine Untergrenze von etwa drei Wörtern pro Sekunde im Englischen, fünf Zeichen pro Sekunde im Chinesischen, mit einer zusätzlichen Pause für sehr kurze Zeilen. Eine Einstellung, die für ihre Zeile zu kurz ist, wird vor dem Rendern korrigiert, nicht danach.
Die kostenlose Vorschau reicht für eine Dialogzeile.
SceneMixer kostenlos testenCredit-Pakete ab $1.49 · Pro $7.99/Monat · Keine Kreditkarte zum Start nötig
Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer