
Öffne eine Figur in Schritt 2, dann findest du das Feld Stimmbeschreibung unten im Dialog unter der Erscheinungsbeschreibung. Genau in diesem einzigen Feld wird der Akzent hinterlegt.
Nichts an der Stimme wird nachträglich aufgenommen, synchronisiert oder zusammengesetzt. Wenn ein Segment generiert wird, rendert das Videomodell Bild und spricht die Zeilen in einem Durchgang – und die Beschreibung jeder sprechenden Figur wird ihm als Vorgabe für diese Stimme übergeben. Deshalb passen die Mundformen zu den Wörtern: Die Stimme ist Teil der Generierung, keine nachträglich hinzugefügte Ebene. Dialog und Ton in einer Generierung.
Die Akzentangaben werden nicht gefiltert, gekürzt oder entfernt: „weich und hauchig, leichtes taiwanesisches Mandarin, gelassen“ wird bei jeder Zeile mitgeführt, die diese Figur spricht, in jedem Segment – und niemand fragt, ob du das so meinst. Wenn du Mandarin mit Hongkong-Akzent willst, schreibst du einfach Mandarin mit Hongkong-Akzent.
Das Einzige, was die Stimmbibliothek nicht kann, sind Akzente. Sie ist nach Sprache gegliedert – Chinesisch, Englisch, Kantonesisch – und eine passende Stimme wird nach Geschlecht, Altersgruppe und Ausdrucksweise ausgewählt. Es gibt keinen Eintrag für taiwanesischen Akzent, keinen für schottischen, keinen für Brooklyn-Akzent – und die Akzentwörter in deiner Beschreibung spielen bei der Auswahl keine Rolle. Akzente kommen aus der Beschreibung; die Bibliothek sorgt dafür, dass die Stimme konsistent bleibt. So funktionieren Charakterstimmen.
Zwei Stellen zeigen, in welchem der beiden Modi sich eine Figur befindet. Auf der Figurenkarte in Schritt 2 sitzt ein kleines Lautsprechersymbol neben dem Namen, wenn eine Audiostimme zugeordnet ist – kein Symbol bedeutet, dass die Beschreibung maßgeblich ist. Im Storyboard-Editor hat das @-Menü einen Tab Stimme mit der Liste der Sprecher: Jede Figur hat ein Sprechersymbol, und eine ohne Audio bekommt zusätzlich ein kleines Tag Nur Text daneben. Wenn du mit der Maus über das Symbol fährst, steht dort, welcher Modus aktiv ist – Stimme zugewiesen oder Nur Stimmbeschreibung (kein Audio). Das Symbol ohne Tag ist das grüne Licht; der Lautsprecher bedeutet, dass ein Audiomuster zugeordnet ist und die Beschreibung – inklusive Akzent – nicht umgesetzt wird.
Wenn du im falschen Zustand bist, öffne die Figur und nutze Stimme löschen – die Bestätigung sagt, dass die entfernte Datei behalten wird, also geht nichts verloren und du kannst später wieder eine Stimme auswählen. Es ist kostenlos und wirkt sich auf das nächste Segment aus, das du generierst. Dann sind deine Akzentangaben wieder wirksam.
Sag, welcher Akzent es ist und wie stark er ausgeprägt ist. „Ein Akzent“ ist keine Beschreibung; „leichtes taiwanesisches Mandarin“ schon. Das ist dasselbe einzeilige Format, das die Beschreibung bereits nutzt, nur mit angefügtem Akzent:
| Was du schreibst | Was du damit anforderst |
|---|---|
| Tief und warm, gelassen, leichtes taiwanesisches Mandarin | Mandarin mit taiwanesischem Akzent, sanft und ohne Eile gesprochen |
| Hell und schnell, Mandarin mit Hongkong-Akzent, abgehackte Enden | Hongkong-Einschlag bei Mandarin, mit dem dazugehörigen abgehackten Rhythmus |
| Entspannt und ein wenig heiser, Sichuan-Akzent, gesprächig | Mandarin mit Sichuan-Einschlag, eher lässig als performend |
| Neutrales Standard-Mandarin mit nur einem Hauch nordöstlicher Färbung | Standard-Mandarin mit der schwächsten regionalen Einfärbung |
| Gemessen und rauchig, sanfter schottischer Einschlag, gelassen | Englisch mit sanftem schottischen Akzent |
| Warm und langsam, sanfter südamerikanischer Drawl | Englisch mit den gedehnten Vokalen des amerikanischen Südens |
| Flach und müde, Londoner Akzent, abgehackt | Englisch, das nach London klingt, knapp und müde |
| Leicht und schnell, Englisch mit leichtem französischen Akzent | Englisch gesprochen von jemandem, dessen Muttersprache Französisch ist |
Drei Gewohnheiten sorgen dafür, dass es funktioniert.
Drei verschiedene Dinge – drei verschiedene Stellen, wo sie hingehören. Wenn man sie vermischt, funktioniert ein Akzent meistens “nicht”.
| Was du willst | Wo es hingehört |
|---|---|
| Die Sprecher:innen sprechen die Dialogsprache des Projekts mit regionaler Färbung – Taiwanesisch, Hongkong-Stil, Sichuan, Nordostchina, Shanghai, Peking-typisches Erhua, ein ländlicher englischer Drawl | In der Stimmbeschreibung der Figur. Die Zeilen bleiben in der Dialogsprache des Projekts und tragen den regionalen Einschlag oben drauf |
| Die Zeilen selbst sind in der Idiomatik dieser Region verfasst – echte regionale Ausdrücke statt Standardformulierungen | Im Dialog selbst, im Skript oder in der Storyboard-Zeile. Wortwahl plus Akzent zusammen machen einen Dialekt authentisch |
| Die Sprecher:innen sprechen eine ganz andere Sprache – Kantonesisch, Englisch, Japanisch | In der Einstellung zur Dialogsprache des Projekts, nicht in der Beschreibung. Kantonesisch ist dort als reine Dialog-Option verfügbar. So legst du die Dialogsprache fest |
| Diese eine Zeile ist wütend, geflüstert, eilig oder betont ein bestimmtes Wort | Die Sprechanmerkung in Klammern am Anfang dieser Zeile. Wiederhole den Akzent dort nicht – er ist bereits bei der Figur hinterlegt. Dialog im Storyboard |
Der entscheidende Unterschied: Ein Akzent verändert wie die Sprache gesprochen wird, eine Dialekteinstellung verändert was gesprochen wird. Beides an einer Stelle zu verlangen, beißt sich: Wenn du in einem Projekt mit Mandarin als Dialogsprache “spricht Kantonesisch” in die Beschreibung schreibst, hat das Modell zwei widersprüchliche Anweisungen für denselben Satz. Wenn du Kantonesisch willst, leg Kantonesisch als Dialogsprache fest und füge regionale Färbung oben drauf in die Beschreibung.
| Was du siehst | Woran es liegt | Was du tun kannst |
|---|---|---|
| Nach dem Speichern ändert sich überhaupt nichts | Die Figur hat eine Audiodatei angehängt, also wird nicht die Beschreibung umgesetzt | Prüfe das Kennzeichen; nutze auf der Karte Stimme löschen und generiere das Segment dann neu |
| Der Akzent ist da, aber zu schwach | Das Wort für die Stärke war vage, oder die Region wurde nur allgemein genannt | Nenne es genauer und staffele es – “ein klarer, unverkennbarer Sichuan-Akzent” – dann generiere das Segment neu |
| Alte Episoden klingen immer noch genauso wie vorher | Fertige Segmente behalten die Stimme, mit der sie erstellt wurden; das macht eine abgeschlossene Episode stabil | Generiere die Segmente neu, bei denen du den Akzent haben willst. Das kostet genauso viel wie die erste Erstellung. Was jede Clip-Korrektur kostet |
| Der Akzent fehlt in einem Clip, den du nachträglich korrigiert hast | Das Stimm-Panel für fertige Clips synthetisiert Sprache mit voreingestellten Stimmen aus der Bibliothek, also kommt ein in der Beschreibung geschriebener Akzent dort nicht heraus | Generiere das Segment neu, statt es nachzusynchronisieren. Stimme in einem bereits vorhandenen Clip ändern |
| Die Stimme passt, aber sie schwankt zwischen den Segmenten | Der Beschreibungsmodus tauscht ein bisschen Konsistenz gegen Freiheit – jede Generierung spricht die Worte neu ein | Akzeptiere es, oder weise dieser Figur eine voreingestellte Stimme aus der Bibliothek zu und verzichte für diese Figur auf den geschriebenen Akzent |
| Die Stimme der Figur passt, aber eine Zeile einer fremden Person klingt seltsam | Zeilen von Personen außerhalb der Besetzung übernehmen keine Figurbeschreibung | Gib dieser Sprecher:in eine eigene Figurenkarte und schreibe ihren Akzent auch dort auf, oder lass es bei einer einmaligen Zeile |
Eine Sache, die du wissen solltest, bevor du eine hochgeladene Stimme zur Lösung nutzt: Eine angehängte Aufnahme und ein geschriebener Akzent sind Alternativen, keine Partner. Wenn du Audio anhängst, wird die Beschreibung nicht mehr umgesetzt – auch keine Akzentangaben. Mitglieder, die eine bestimmte regionale Stimme wollen, nutzen den Upload bewusst als Ersatz für die Beschreibung. So funktionieren Figurenstimmen.
Ja. Die Stimmbeschreibung wird bei jeder Zeile, die diese Figur spricht, mitgeführt und wie geschrieben umgesetzt: Das Videomodell spricht die Zeile und rendert die Einstellung in einem Durchgang, also gibt es keinen separaten Synchronisationsschritt, bei dem sie verloren gehen könnte. Was es nicht gibt, ist eine Stärkeneinstellung – wenn ein Akzent zu schwach rüberkommt, sag es expliziter und generiere das Segment neu.
Fast immer, weil die Figur eine Audiodatei angehängt hat: eine voreingestellte Stimme, die du zugeordnet hast, oder eine hochgeladene Aufnahme. Wenn Audio vorhanden ist, setzt das Modell nicht die Beschreibung um. Nutze auf der Figurenkarte Stimme löschen, um zurück zur Beschreibung zu gelangen, dann generiere das Segment neu.
Ja, und alles, was du ab dann generierst, nutzt ihn. Segmente, die du bereits erstellt hast, behalten die Stimme, mit der sie erstellt wurden; generiere die neu, bei denen du den Akzent hören willst – zu den üblichen Kosten für eine Segmentgenerierung.
Nein. Dieses Panel synthetisiert Sprache mit voreingestellten Stimmen aus der Bibliothek, also kommt ein in der Beschreibung geschriebener Akzent dort nicht heraus. Ein Akzent taucht nur in einem Segment auf, das neu generiert wird.
Nein. Die Bibliothek ist nach Sprache gegliedert – Chinesisch, Englisch, Kantonesisch – und eine passende Stimme wird nach Geschlecht, Altersgruppe und Sprechweise ausgewählt, nicht nach den Akzentwörtern in deiner Beschreibung. Der Akzent stammt ausschließlich aus der Beschreibung.
Nein. Ein Akzent oder Dialekt behält die Dialogsprache des Projekts bei und verleiht ihr eine regionale Note – also gehört er in die Stimmbeschreibung. Um die Sprache selbst zu ändern, stell die Dialogsprache des Projekts ein; Kantonesisch ist dort als reine Dialogoption verfügbar. Wenn du in der Beschreibung schreibst, dass jemand Kantonesisch spricht, die Dialogsprache aber auf Mandarin bleibt, forderst du zwei Dinge gleichzeitig, die sich widersprechen.
Nein. Er ist eine Eigenschaft der Figur, wird einmal in der Stimmbeschreibung notiert und gilt für alle Zeilen, die sie spricht. Was sich zeilenweise ändert – Stimmung, Tempo, ein betontes Wort – gehört in die Sprechanmerkung in Klammern am Anfang der jeweiligen Zeile.
Beides geht. Jede Figur hat ihre eigene Stimmbeschreibung, also beeinträchtigen Akzente einander nicht. Nur-stimmliche Figuren – Erzähler, die Person am anderen Ende der Telefonleitung – haben ebenfalls eine Stimmbeschreibung, und der Akzent wirkt bei ihren Zeilen genauso.
Öffne eine Figur, prüfe das Badge und füge der Stimmbeschreibung einen Satz zum Akzent hinzu.
Aktualisiert am 10. Oktober 2026
Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·Partnerprogramm·© 2026 SceneMixer