SceneMixer
Italiano
Registrati gratis

Remake: come vengono rilevati dialoghi e musica dal clip e cosa finisce nel tuo episodio

Risposta rapida: ogni inquadratura del clip viene ascoltata due volte: prima da un sistema di riconoscimento vocale che stabilisce «se qualcuno sta parlando e cosa ha detto», poi dal modello che descrive l’inquadratura, al quale vengono passate le parole riconosciute come base di lavoro. Le battute vengono quindi riportate fedelmente, non indovinate dai movimenti delle labbra, e un’inquadratura in cui nessuno parla viene segnata come silenziosa. Se il clip ha musica, l’analisi ne annota il carattere e ogni segmento generato riporta la stessa breve indicazione musicale, come succede nelle pubblicità. La lingua dei dialoghi viene scelta nella schermata di caricamento e rimane fissa una volta avviata l’analisi: le battute vengono scritte in quella lingua, tradotte se la sorgente parla un’altra lingua. Una battuta che il riconoscitore non è riuscito a capire viene semplicemente omessa; confrontala con il tuo clip e aggiungila all’inquadratura nell’editor dopo aver generato lo storyboard.
Fotogramma da “Neon Debt”, un cortometraggio AI generato end-to-end da SceneMixer (7 personaggi, 1 episodio)
Esempio: “Neon Debt” — Realismo da motore di gioco, 1 episodio, prodotto end-to-end da SceneMixer a partire dalla sceneggiatura · guarda gli episodi

Dopo l’analisi, apri l’episodio nel Passaggio 3 e leggi la sua struttura: ogni blocco scena elenca le battute nel formato «personaggio: battuta».

Come vengono ascoltate le battute

Il riconoscimento vocale viene eseguito sull’audio di ogni singola inquadratura. Quello che viene rilevato viene passato alla descrizione dell’inquadratura come «queste parole sono state pronunciate qui»; il sistema di descrizione identifica quindi chi parla dai volti e inserisce la battuta nell’inquadratura. La musica sotto i dialoghi viene gestita correttamente; le urla in mezzo alla folla, gli accenti marcati e le battute molto sommesse sono i casi in cui il sistema fallisce, e in quei casi preferisce omettere invece di inventare. Le battute appaiono quindi nella struttura come in un copione: Scrivi i dialoghi in modo che vengano rilevati.

A storyboard segment: location, time and weather fields, then numbered shots with durations, asset chips and spoken lines
Ogni inquadratura viene ascoltata; quello che viene rilevato viene riportato nell’analisi e finisce come battuta nella struttura.

Perché riportare e non indovinare

Lasciato a sé stesso, un modello di visione a cui si chiede «cosa viene detto qui» a volte sente e a volte no, sulla stessa inquadratura, e inventa battute plausibili quando non è sicuro. Le parole riconosciute, fissate nella descrizione, evitano entrambi i problemi: le stesse parole vengono usate ogni volta che l’inquadratura viene descritta.

Musica

L’analisi chiede una sola volta se il clip ha musica e di che tipo. Se sì, ogni segmento generato riporta un’indicazione musicale di una riga che la corrisponde, così i segmenti generati hanno musica dello stesso carattere; la traccia sorgente non viene mai usata. I suoni ambientali vengono annotati ma non riportati. Da dove viene la musica.

Lingua dei dialoghi

Viene scelta nella schermata di caricamento, con impostazione predefinita sulla lingua dell’interfaccia (il sito cinese è sempre in cinese), e rimane fissa una volta avviata l’analisi. Le battute ascoltate in un’altra lingua vengono tradotte in quella scelta. Non può essere modificata dopo per un remake, motivo per cui il Passaggio 1 non mostra il menu a discesa. Dopo l’analisi.

Quando una battuta è mancante o sbagliata

La struttura in sé non può essere modificata, e lo storyboard copia le sue battute parola per parola. Genera lo storyboard, poi apri il segmento a cui appartiene la battuta e aggiungila o correggila lì, indicando chi parla; una battuta assegnata alla persona sbagliata si corregge allo stesso modo. La modifica è gratuita. Genera lo storyboard.

Nel clipNell’analisiNel tuo episodio
Una battuta pronunciata chiaramenteRiportata, con nome di chi parlaUna battuta nella struttura
Nessuno parlaInquadratura segnata come silenziosaNessuna battuta
Dialogo poco chiaroOmessoAggiungilo a mano nel segmento
MusicaCarattere annotatoMusica dello stesso carattere in ogni segmento
Suono ambientaleAnnotatoNon riportato; lo storyboard ne crea uno proprio

Domande frequenti

Perché manca una battuta?

Il riconoscitore non è riuscito a capirla. Confrontala con il tuo clip e aggiungila nel segmento dopo aver creato lo storyboard.

Vengono usate le voci originali?

No. Le voci provengono dalle impostazioni vocali del cast, come in qualsiasi progetto.

Il remake può parlare una lingua diversa da quella sorgente?

Sì; scegli la lingua dei dialoghi nella schermata di caricamento e le battute verranno tradotte durante l’analisi.

La musica originale viene riutilizzata?

No. Il suo carattere viene descritto e i segmenti generano la propria musica.

Perché un grido di folla non ha battute?

Il rumore di gruppo viene trattato come suono di sfondo, non come dialogo.

Ascoltato, riportato, scritto

Quello che viene detto nel clip è quello che dice il tuo episodio.

Avvia un remake

Aggiornato il 27 settembre 2026

Prezzi·Guide·Esempi·Supporto·Privacy·Termini·Note legali·Contatti·© 2026 SceneMixer