KI-Charakterstimmen
Aktualisiert 30. September 2026

Die meisten KI-Video-Workflows behandeln Audio als zweite Aufgabe: Erst wird stilles Footage erzeugt, dann werden Zeilen synthetisiert, und dann kämpft man mit dem Lippensync. Die hier verwendeten Videomodelle erzeugen Audio und Bild in einem Durchgang — das macht den Kampf überflüssig, ändert aber, was eine „Stimmeinstellung“ ist. Es ist keine Text-to-Speech-Engine, der du ein Skript fütterst — es ist eine Referenz, auf die der Generierungsdurchgang konditioniert wird.
| Schriftliche Beschreibung | Alter, Klangfarbe, Gewicht, Vortrag — wird zusammen mit allem anderen zur Figur aus dem Skript erzeugt und vom Videomodell gesprochen. |
|---|---|
| Passende Voreinstellung | Eine Stimme aus einer Bibliothek mit Systemstimmen, jede mit einem kurzen Audio-Sample zum Anhören. Ein Modellaufruf schlägt pro Figur eine Passung nach Geschlecht, Sprache und Alter vor; du kannst neu zuordnen oder manuell eine andere wählen. |
| Dein eigenes Sample | Lade Audio für eine Figur hoch, und es wird die Referenzstimme dieser Figur für jedes Segment, in dem sie spricht. |
Was auch immer angehängt ist, wird konsistent verwendet: Dieselbe Figur spricht in jedem Segment und jeder Folge mit derselben Stimme — aus demselben Grund, aus dem ihr Gesicht gleich bleibt: Die Referenz wandert mit ihr mit.
Es gibt hier kein Tool, um eine Stimme aus einer Aufnahme einer anderen Person zu klonen. Das ist eine bewusste Lücke, kein Punkt auf der Roadmap: Die Veröffentlichung einer synthetischen Darstellung der Stimme einer echten Person ist in den meisten Märkten, die wir bedienen, ein Persönlichkeitsrechtsproblem — und ein Produkt, das das mit einem Klick ermöglicht, macht es zur Routine. Unsere eigene Compliance-Checkliste behandelt Ähnlichkeit — Gesicht wie Stimme gleichermaßen — als etwas, für das du vor der Veröffentlichung die Nutzungsrechte haben musst.
Zwei Dinge, die daraus folgen und klar gesagt sein sollten:
Die Dialogsprache wird in Schritt 1 gewählt und gilt für das gesamte Projekt: Die Zeilen werden in dieser Sprache in der Analysephase verfasst, wortgetreu in das Storyboard übernommen und darin gesprochen. Das ist keine Synchronisation über einem englischen Original — es gibt kein englisches Original. Besetzung, Namen und Schauplätze können über die Zielregion-Einstellung gleichzeitig an den passenden Markt angepasst werden. Fünfzehn Sprachen werden unterstützt, und das Argument gegen Synchronisation erläutert, warum das Erzeugen der Zeile besser ist als das Retimen.
Stimmenabgleich ist ein kostenloser Modellaufruf — er verbraucht keine Credits und zählt nicht gegen dein Limit für gleichzeitige Aufgaben. Das Hochladen deines eigenen Samples ist kostenlos. Das Audio selbst ist Teil der Videogenerierung, die bei 10 Credits pro Sekunde Ausgabe beginnt (≈ $0.06/s bei der niedrigster Credit-Preis); es gibt keine separate Gebühr pro Wort oder pro Figur für Sprache. Siehe die Preisübersicht oder die Generator-Übersicht, wo die Stimme im Ablauf sitzt.
Die Dialogsprache wird einmal in Schritt 1 festgelegt, und der gesamte Lauf wird darin gesprochen — während die Zielregion-Einstellung Namen, Gesichter und Straßen gleichzeitig an diesen Markt anpasst. Jedes Sample unten wurde so erstellt, eines pro Sprache.
Sprachen
Jede Serie unten wurde mit derselben Pipeline produziert, wobei die Darsteller die jeweilige Sprache auf muttersprachlichem Niveau sprechen: Oberfläche, Arbeitsdokumente und gesprochene Zeilen sind in einer Sprache, nichts ist synchronisiert. Öffne eine Serie, um es dir anzuhören.
A Carta de LisboaPortuguêsMuttersprachliche Dialoge
윈터 프라미스한국어Muttersprachliche Dialoge
El Secreto de CostaEspañolMuttersprachliche Dialoge
浪人の誓い日本語Muttersprachliche Dialoge
Ikrar JakartaBahasa IndonesiaMuttersprachliche Dialoge
Зимняя коронаРусскийMuttersprachliche Dialoge
L’Héritier du DéfiléFrançaisMuttersprachliche Dialoge
Il Tavolo dell'OlivaItalianoMuttersprachliche Dialoge
De Vuurtoren van de FjordNederlandsMuttersprachliche Dialoge
العهد الصحراويالعربيةMuttersprachliche Dialoge
Çantasındaki SözleşmeTürkçeMuttersprachliche Dialoge
Die Istanbul-TäuschungDeutschIn deiner Sprache
Останній сигналУкраїнськаMuttersprachliche Dialoge
問劍青雲繁體中文Muttersprachliche Dialoge
The Last EnvelopeEnglishMuttersprachliche DialogeNein. Stimmen werden aus einer Bibliothek mit gesampelten Voreinstellungen zugeordnet oder von dir als Upload deiner eigenen Audio bereitgestellt. Es gibt keinen Weg, eine Stimme aus einer Aufnahme einer anderen Person nachzubilden — und das ist absichtlich so, keine unfertige Funktion.
Nein. Die Videomodelle erzeugen Bild und Audio in demselben Durchgang, sodass Vortrag und Mundbewegung aus einer Generation stammen. Deshalb bedeutet das Ändern einer Zeile auch, dass du das Segment regenerierst, statt eine Audiospur neu zu schneiden.
Ja. Lade ein Sample für eine Figur hoch, und es wird die Referenzstimme dieser Figur für jedes Segment, in dem sie spricht.
Die Dialogsprache ist eine Einstellung auf Projektebene, also ja innerhalb eines Projekts — aber die Sprache wird unabhängig von der Sprache gewählt, in der du das Skript geschrieben hast, und unabhängig von deiner Oberflächensprache. Ein Skript kann für mehrere Märkte produziert werden, indem es mit unterschiedlichen Einstellungen ausgeführt wird.
Ja, aus demselben Grund wie das Gesicht: Welche Stimme auch immer an eine Figur angehängt ist, sie ist auf Projektebene verknüpft und wandert in jedes Segment, in dem diese Figur spricht.
Bild und Vortrag aus einem Durchgang, in der Sprache deines Publikums.
SceneMixer kostenlos testenCredit-Pakete ab $1.49 · Pro $7.99/Monat · Keine Kreditkarte zum Starten
Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer