SceneMixer
Deutsch
Kostenlos registrieren

Sprechende Charaktere

KI-Video mit sprechenden Charakteren

Aktualisiert 20. September 2026

Kurze Antwort: Sprache wird gemeinsam mit dem Bild in einem Durchgang generiert, nicht per Lippensynchronisation auf ein stummes Rendering aufgebracht. Jede Einstellung enthält die Zeile wortgetreu, der benannte Sprecher ist an eine stabile Bibliotheksstimme gebunden, ergänzt um eine kurze Sprechanweisung und den ausdrücklichen Hinweis, dass alle anderen Personen im Bild die Lippen geschlossen halten. Dialogeinstellungen haben eine zeitliche Untergrenze – im Englischen drei Wörter pro Sekunde –, sodass eine Zeile nie in eine zu kurze Einstellung gequetscht wird.
Standbild aus „Starfall Command“, einer vollständig von SceneMixer generierten AI-Kurzserie (7 Charaktere, 1 Episode)
Beispiel: „Starfall Command“ — Realistisches HD, 1 Episode, vollständig von SceneMixer aus dem Skript produziert · Episoden ansehen

Die Stimme entsteht im selben Generierungsdurchgang wie das Bild

Es gibt zwei Wege, einen Charakter auf dem Bild sprechen zu lassen. Der eine ist, ein stummes Video zu rendern und dann den Mund über eine Audiospur zu steuern – der Lippensynchron-Weg, der einen Gesichtsausschnitt und eine treibende Audiodatei braucht, ein korrekt bewegtes Gesicht erzeugt, aber einen Körper, der nicht mitspielt. Der andere ist, Bild und Ton gemeinsam zu generieren, sodass Darstellung und Mundbewegung eine einheitliche Entscheidung sind.

Diese Pipeline nutzt die zweite Methode. Die standardmäßige Video-Stufe ist audiovisuell: Das Modell erhält die Zeile, den Sprecher, die Sprechart und eine Stimmreferenz und gibt eine Einstellung zurück, in der die Zeile gesprochen wird. Nichts wird nachträglich zusammengefügt.

Auf einen Blick

Was bei einer sprechenden Einstellung mitgeschickt wird
Die ZeileWortgetreu, einmal. Genau so gesprochen, wie geschrieben – nicht umformuliert, nicht umgetimt.
Wer sprichtNamentlich genannt und an die Stimmreferenz dieses Charakters gebunden, sodass dieselbe Person über alle Episoden hinweg gleich klingt.
Wie es gesagt wirdEine kurze Anweisung in Klammern – leise, noch lächelnd, gezwungen flach. Anweisung, nicht Untertitel.
Wer sonst noch im Bild istMit „Lippen geschlossen“ markiert, damit Zuhörende nicht mitsprechen.
Sprache außerhalb des BildsZuerst in der Klammer markiert – Voice-over, am Telefon, über die Sprechanlage –, danach werden alle sichtbaren Personen mit geschlossenem Mund beschrieben.
TimingEine Einstellung mit Dialog ist nie kürzer, als die Zeile braucht: im Englischen drei Wörter pro Sekunde, im Chinesischen fünf Zeichen pro Sekunde.

Stimmen werden zugeordnet, nicht pro Charakter synthetisiert

Jedem Charakter wird eine Stimme aus einer Bibliothek vordefinierter Systemstimmen zugewiesen – du hörst ein drei bis acht Sekunden langes Beispiel vor der Auswahl, kannst neu zuordnen, eine andere Stimme aus der Auswahl wählen oder eine eigene Aufnahme hochladen. Der Grund für die Zuordnung statt einer individuellen Stimmerstellung pro Charakter sind Kosten und Stabilität: Erstellte Stimmen driften zwischen Generierungen und kosten pro Charakter, während eine Bibliotheksstimme in Folge eins und Folge zwölf dieselbe bleibt.

Wenn einem Charakter keine Stimme zugewiesen ist, greift die Einstellung auf eine schriftliche Beschreibung der Stimme zurück – Alter, Klang, Stimmlage –, die das Modell interpretiert. Das ist der Standard für neue Projekte; das Zuweisen von Stimmen ist ein bewusster Schritt, nichts, was bei jedem Charakter automatisch im Hintergrund passiert.

Die Timing-Regel und warum es sie gibt

Eine vier Sekunden lange Einstellung kann keine sechzehn englischen Wörter fassen. Entweder wird die Sprechweise bis zur Unverständlichkeit gehetzt oder die Zeile gekürzt. Deshalb haben Dialogeinstellungen eine Untergrenze, die sich aus der Zeile ableitet: Wortzahl geteilt durch drei für Englisch, Zeichenzahl geteilt durch fünf für Chinesisch, und kurze Zeilen bekommen zusätzlich eine Pause, statt auf ihr theoretisches Minimum gequetscht zu werden. Einstellungen, die für ihre Zeile zu kurz zurückkommen, werden vor dem Rendern markiert und korrigiert – das ist günstiger, als es erst im fertigen Output zu merken.

Sprache

Die Dialogsprache ist eine Projekteinstellung, die einmal gewählt wird, und sie wird dort angewendet, wo die Zeilen zuerst geschrieben werden, statt nachträglich übersetzt zu werden – also wird die Darstellung in dieser Sprache verfasst, statt eine Synchronisation zu sein. Es gibt fünfzehn Oberflächensprachen, und Dialog wird in allen unterstützt; bei einigen Sprachen kommt es auf der Standardmodellstufe gelegentlich zu Fehlaussprachen einzelner Wörter, und in der Auswahl wird darauf hingewiesen, wo das zutrifft. Die Seite zu Charakterstimmen behandelt das ausführlich.

Was es nicht tut

Was es kostet

Sprache ist im Videopreis enthalten – es gibt keine separate Audiogebühr. Video kostet ab 10 Credits pro Sekunde Ausgabe (≈ $0.06/s im niedrigster Credit-Preis) und reicht bis $0.47/s auf der schärfsten Stufe; die Zusammenstellung kostet 1 Credit pro Sekunde. Die Stimmzuordnung aus der Bibliothek kostet nichts. Neue Konten erhalten 50 Credits und eine kostenlose Vorschau von bis zu 5 Sekunden – genug, um einen Charakter sprechen zu hören, bevor du dich entscheidest. Die Preise stehen auf der Preisseite.

Sprachen

Muttersprachliche Dialoge in 15 Sprachen

Jede Serie unten wurde mit derselben Pipeline produziert, wobei die Darsteller die jeweilige Sprache auf muttersprachlichem Niveau sprechen: Oberfläche, Arbeitsdokumente und gesprochene Zeilen sind in einer Sprache, nichts ist synchronisiert. Öffne eine Serie, um es dir anzuhören.

Alle 15 Sprachen anzeigen

Häufig gestellte Fragen

Ist das Lippensynchronisation?

Nein. Bild und Sprache werden gemeinsam in einem Durchgang generiert, sodass Mundbewegung und Darstellung eine einheitliche Entscheidung sind. Es gibt keine separate Audiospur, die an ein stummes Rendering angepasst wird, und keine Möglichkeit, ein Foto oder ein hochgeladenes Video zu steuern.

Kann ich meine eigene Stimme verwenden?

Du kannst eine Aufnahme als Stimmreferenz für einen Charakter hochladen. Das Klonen der Stimme einer anderen Person wird nicht angeboten.

Bewegen Zuhörende in der Einstellung den Mund?

Das sollten sie nicht – jeder nicht sprechende Charakter im Bild wird ausdrücklich mit geschlossenen Lippen markiert, das ist die Anweisung, die verhindert, dass ein Zuhörer die Zeile mitspricht.

Was passiert bei Voice-over und Telefonaten?

Die Markierung für außerhalb des Bilds steht zuerst in der Sprechanweisung, danach werden alle sichtbaren Personen in der Einstellung mit geschlossenem Mund beschrieben – also ist die Zeile zu hören, ohne dass jemand sichtbar spricht.

Warum ist meine Dialogeinstellung länger, als ich sie geschrieben habe?

Weil die Zeile die Zeit braucht. Einstellungen mit Dialog haben eine Untergrenze von etwa drei Wörtern pro Sekunde im Englischen, fünf Zeichen pro Sekunde im Chinesischen, mit einer zusätzlichen Pause für sehr kurze Zeilen. Eine Einstellung, die für ihre Zeile zu kurz ist, wird vor dem Rendern korrigiert, nicht danach.

Höre einen Charakter, bevor du eine Episode freigibst

Die kostenlose Vorschau reicht für eine Dialogzeile.

SceneMixer kostenlos testen

Credit-Pakete ab $1.49 · Pro $7.99/Monat · Keine Kreditkarte zum Start nötig

Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer