SceneMixer
Deutsch
Kostenlos registrieren

KI-Charakterstimmen

KI-Charakterstimmen

Aktualisiert 30. September 2026

Kurze Antwort: In SceneMixer wird die gesprochene Zeile nicht nachträglich nachsynchronisiert — das Videomodell erzeugt Bild und Sprache gemeinsam, sodass Mund und Text einer Figur aus demselben Durchgang stammen. Was du steuerst, ist welche Stimme: Jede Figur hat entweder eine schriftliche Beschreibung von Klangfarbe und Vortrag, ein passendes Sample aus einer voreingestellten Stimmenbibliothek oder ein von dir hochgeladenes Sample. Was wir nicht anbieten: eine Möglichkeit, eine Stimme zu klonen, die dir nicht gehört.
Standbild aus „Neon Debt“, einer vollständig von SceneMixer generierten AI-Kurzserie (7 Charaktere, 1 Episode)
Beispiel: „Neon Debt“ — Spielengine-Realismus, 1 Episode, vollständig von SceneMixer aus dem Skript produziert · Episoden ansehen

Wo die Stimme eigentlich herkommt

Die meisten KI-Video-Workflows behandeln Audio als zweite Aufgabe: Erst wird stilles Footage erzeugt, dann werden Zeilen synthetisiert, und dann kämpft man mit dem Lippensync. Die hier verwendeten Videomodelle erzeugen Audio und Bild in einem Durchgang — das macht den Kampf überflüssig, ändert aber, was eine „Stimmeinstellung“ ist. Es ist keine Text-to-Speech-Engine, der du ein Skript fütterst — es ist eine Referenz, auf die der Generierungsdurchgang konditioniert wird.

Drei Möglichkeiten, wie eine Figur eine Stimme erhält
Schriftliche BeschreibungAlter, Klangfarbe, Gewicht, Vortrag — wird zusammen mit allem anderen zur Figur aus dem Skript erzeugt und vom Videomodell gesprochen.
Passende VoreinstellungEine Stimme aus einer Bibliothek mit Systemstimmen, jede mit einem kurzen Audio-Sample zum Anhören. Ein Modellaufruf schlägt pro Figur eine Passung nach Geschlecht, Sprache und Alter vor; du kannst neu zuordnen oder manuell eine andere wählen.
Dein eigenes SampleLade Audio für eine Figur hoch, und es wird die Referenzstimme dieser Figur für jedes Segment, in dem sie spricht.

Was auch immer angehängt ist, wird konsistent verwendet: Dieselbe Figur spricht in jedem Segment und jeder Folge mit derselben Stimme — aus demselben Grund, aus dem ihr Gesicht gleich bleibt: Die Referenz wandert mit ihr mit.

Was wir nicht tun, und warum

Es gibt hier kein Tool, um eine Stimme aus einer Aufnahme einer anderen Person zu klonen. Das ist eine bewusste Lücke, kein Punkt auf der Roadmap: Die Veröffentlichung einer synthetischen Darstellung der Stimme einer echten Person ist in den meisten Märkten, die wir bedienen, ein Persönlichkeitsrechtsproblem — und ein Produkt, das das mit einem Klick ermöglicht, macht es zur Routine. Unsere eigene Compliance-Checkliste behandelt Ähnlichkeit — Gesicht wie Stimme gleichermaßen — als etwas, für das du vor der Veröffentlichung die Nutzungsrechte haben musst.

Zwei Dinge, die daraus folgen und klar gesagt sein sollten:

Sprache ist eine separate Einstellung

Die Dialogsprache wird in Schritt 1 gewählt und gilt für das gesamte Projekt: Die Zeilen werden in dieser Sprache in der Analysephase verfasst, wortgetreu in das Storyboard übernommen und darin gesprochen. Das ist keine Synchronisation über einem englischen Original — es gibt kein englisches Original. Besetzung, Namen und Schauplätze können über die Zielregion-Einstellung gleichzeitig an den passenden Markt angepasst werden. Fünfzehn Sprachen werden unterstützt, und das Argument gegen Synchronisation erläutert, warum das Erzeugen der Zeile besser ist als das Retimen.

Was es kostet

Stimmenabgleich ist ein kostenloser Modellaufruf — er verbraucht keine Credits und zählt nicht gegen dein Limit für gleichzeitige Aufgaben. Das Hochladen deines eigenen Samples ist kostenlos. Das Audio selbst ist Teil der Videogenerierung, die bei 10 Credits pro Sekunde Ausgabe beginnt (≈ $0.06/s bei der niedrigster Credit-Preis); es gibt keine separate Gebühr pro Wort oder pro Figur für Sprache. Siehe die Preisübersicht oder die Generator-Übersicht, wo die Stimme im Ablauf sitzt.

Was du noch nicht tun kannst

Jede Folge, in fünfzehn Sprachen

Die Dialogsprache wird einmal in Schritt 1 festgelegt, und der gesamte Lauf wird darin gesprochen — während die Zielregion-Einstellung Namen, Gesichter und Straßen gleichzeitig an diesen Markt anpasst. Jedes Sample unten wurde so erstellt, eines pro Sprache.

Sprachen

Muttersprachliche Dialoge in 15 Sprachen

Jede Serie unten wurde mit derselben Pipeline produziert, wobei die Darsteller die jeweilige Sprache auf muttersprachlichem Niveau sprechen: Oberfläche, Arbeitsdokumente und gesprochene Zeilen sind in einer Sprache, nichts ist synchronisiert. Öffne eine Serie, um es dir anzuhören.

Alle 15 Sprachen anzeigen

Häufig gestellte Fragen

Kann SceneMixer eine Stimme klonen?

Nein. Stimmen werden aus einer Bibliothek mit gesampelten Voreinstellungen zugeordnet oder von dir als Upload deiner eigenen Audio bereitgestellt. Es gibt keinen Weg, eine Stimme aus einer Aufnahme einer anderen Person nachzubilden — und das ist absichtlich so, keine unfertige Funktion.

Wird die Sprache nach dem Video nachsynchronisiert?

Nein. Die Videomodelle erzeugen Bild und Audio in demselben Durchgang, sodass Vortrag und Mundbewegung aus einer Generation stammen. Deshalb bedeutet das Ändern einer Zeile auch, dass du das Segment regenerierst, statt eine Audiospur neu zu schneiden.

Kann ich meine eigene Stimme hochladen?

Ja. Lade ein Sample für eine Figur hoch, und es wird die Referenzstimme dieser Figur für jedes Segment, in dem sie spricht.

Müssen alle Figuren dieselbe Sprache sprechen?

Die Dialogsprache ist eine Einstellung auf Projektebene, also ja innerhalb eines Projekts — aber die Sprache wird unabhängig von der Sprache gewählt, in der du das Skript geschrieben hast, und unabhängig von deiner Oberflächensprache. Ein Skript kann für mehrere Märkte produziert werden, indem es mit unterschiedlichen Einstellungen ausgeführt wird.

Bleibt die Stimme über Folgen hinweg gleich?

Ja, aus demselben Grund wie das Gesicht: Welche Stimme auch immer an eine Figur angehängt ist, sie ist auf Projektebene verknüpft und wandert in jedes Segment, in dem diese Figur spricht.

Sprechende Figuren, keine Clips, die du synchronisierst

Bild und Vortrag aus einem Durchgang, in der Sprache deines Publikums.

SceneMixer kostenlos testen

Credit-Pakete ab $1.49 · Pro $7.99/Monat · Keine Kreditkarte zum Starten

Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer