SceneMixer
Deutsch
Kostenlos registrieren

Remake: Wie gesprochene Zeilen und Musik aus dem Clip ausgelesen werden – und was in deiner Episode landet

Kurze Antwort: Jede Einstellung des Clips wird zweimal angehört: zuerst von einer Spracherkennung, die prüft, ob jemand spricht und was gesagt wurde, dann von dem Modell, das die Einstellung beschreibt – und das die erkannten Wörter als Grundlage bekommt. Zeilen werden also zitiert, nicht von Lippenbewegungen erraten; eine Einstellung, in der niemand spricht, wird als still markiert. Enthält der Clip Musik, wird ihr Charakter in der Auslesung notiert, und jeder von dir generierte Clip erhält die gleiche kurze Musikvorgabe, so wie bei Werbespots. Die Dialogsprache wird im Upload-Bildschirm ausgewählt und ist fest, sobald die Auslesung startet: Zeilen werden in dieser Sprache notiert und übersetzt, falls die Ausgangssprache eine andere ist. Eine Zeile, die die Erkennung nicht verstehen konnte, fehlt einfach; vergleiche sie mit deinem Clip und füge sie nach der Generierung des Storyboards im Editor zur Einstellung hinzu.
Standbild aus „Neon Debt“, einer vollständig von SceneMixer generierten AI-Kurzserie (7 Charaktere, 1 Episode)
Beispiel: „Neon Debt“ — Spielengine-Realismus, 1 Episode, vollständig von SceneMixer aus dem Skript produziert · Episoden ansehen

Nach einer Auslesung öffne die Episode in Schritt 3 und lies die Gliederung: Jeder Szenenblock listet seine Zeilen in der Form „Sprecher: Text“ auf.

Wie Zeilen erkannt werden

Die Spracherkennung läuft auf dem Ton jeder einzelnen Einstellung. Was sie hört, wird der Einstellungsbeschreibung übergeben mit dem Hinweis „Diese Wörter wurden hier gesprochen“; der Beschreiber benennt dann den Sprecher anhand der Gesichter und schreibt die Zeile in die Einstellung. Musik unter Sprache wird verarbeitet; Schreie über einer Menschenmenge, starke Akzente und sehr leise Zeilen sind Fälle, in denen sie versagt – diese werden weggelassen, statt erfunden. Die Zeilen erscheinen dann in der Gliederung wie in einem Drehbuch: Schreibe Dialoge so, dass sie erkannt werden.

A storyboard segment: location, time and weather fields, then numbered shots with durations, asset chips and spoken lines
Jede Einstellung wird angehört; das Gehörte wird in die Auslesung zitiert und landet als Zeilen in der Gliederung.

Warum zitieren statt raten

Einem Sehmodell, das man allein fragt „Was wird hier gesagt?“, gelingt das manchmal, manchmal nicht – selbst bei der gleichen Einstellung – und es erfindet plausible Zeilen, wenn es unsicher ist. Erkannte Wörter, die fest in die Beschreibung eingebunden werden, verhindern beides; bei jeder Beschreibung der Einstellung werden die gleichen Wörter verwendet.

Musik

Die Auslesung prüft einmal, ob der Clip Musik enthält und welche Art. Falls ja, erhält jedes von dir generierte Segment eine einzeilige Musikvorgabe, die dazu passt, sodass die generierten Segmente Musik mit dem gleichen Charakter haben; der Originalton selbst wird nie verwendet. Umgebungsgeräusche werden notiert, aber nicht übernommen. Woher die Musik kommt.

Dialogsprache

Sie wird im Upload-Bildschirm ausgewählt, standardmäßig auf deine Oberflächensprache gesetzt (die chinesische Seite ist immer Chinesisch) und ist fest, sobald die Auslesung startet. Zeilen, die in einer anderen Sprache zu hören sind, werden in diese Sprache übersetzt. Sie kann nachträglich bei einem Remake nicht geändert werden, deshalb bietet Schritt 1 das Dropdown-Menü nicht an. Nach der Auslesung.

Wenn eine Zeile fehlt oder falsch ist

Die Gliederung selbst kann nicht bearbeitet werden, und das Storyboard übernimmt ihre Zeilen wortwörtlich. Generiere das Storyboard, öffne dann das Segment, zu dem die Zeile gehört, und füge sie dort mit ihrem Sprecher hinzu oder korrigiere sie; eine Zeile, die der falschen Person zugeordnet wurde, wird auf die gleiche Weise korrigiert. Die Bearbeitung ist kostenlos. Storyboard generieren.

Im ClipIn der AuslesungIn deiner Episode
Eine klare gesprochene ZeileZitiert, Sprecher benanntEine Zeile in der Gliederung
Niemand sprichtEinstellung als still markiertKeine Zeile
Unklare SpracheWeggelassenFüge sie manuell im Segment hinzu
MusikCharakter notiertMusik mit gleichem Charakter in jedem Segment
UmgebungsgeräuschNotiertNicht übernommen; das Storyboard erstellt ein eigenes

FAQ

Warum fehlt eine Zeile?

Die Erkennung konnte sie nicht verstehen. Vergleiche mit deinem Clip und füge sie im Segment hinzu, sobald das Storyboard existiert.

Werden die Originalstimmen verwendet?

Nein. Die Stimmen kommen aus den Stimmeinstellungen der Besetzung, wie in jedem Projekt.

Kann das Remake eine andere Sprache sprechen als das Original?

Ja; wähle die Dialogsprache im Upload-Bildschirm, und die Zeilen werden bei der Auslesung übersetzt.

Wird die Originalmusik wiederverwendet?

Nein. Ihr Charakter wird beschrieben, und die Segmente generieren ihre eigene Musik.

Warum bekommt ein Ruf in der Menge keine Zeile?

Gruppenlärm wird als Hintergrundgeräusch behandelt, nicht als Dialog.

Gehört, zitiert, geschrieben

Was im Clip gesagt wurde, ist das, was deine Episode sagt.

Ein Remake starten

Aktualisiert am 27. September 2026

Preise·Anleitungen·Beispiele·Support·Datenschutz·AGB·Rechtliches·Kontakt·© 2026 SceneMixer