Personaggi che parlano
Aggiornato il 20 settembre 2026

Ci sono due modi per far parlare un personaggio sullo schermo. Uno è generare un video muto e poi animare la bocca con una traccia audio: è il metodo del lip-sync, che richiede un ritaglio del volto e un file audio di riferimento, produce un volto che si muove correttamente ma un corpo che non recita. L'altro è generare immagine e suono insieme, così la performance e la bocca sono un'unica scelta.
Questa pipeline usa il secondo metodo. Il livello video predefinito è audiovisivo: al modello vengono passati la battuta, chi la dice, come la dice e un riferimento vocale, e restituisce un'inquadratura con la battuta pronunciata al suo interno. Niente viene assemblato dopo.
| La battuta | Parola per parola, una sola volta. Pronunciata esattamente come scritta: non parafrasata, non ri-temporizzata. |
|---|---|
| Chi la dice | Indicato per nome, e associato al riferimento vocale di quel personaggio così la stessa persona ha la stessa voce in tutti gli episodi. |
| Come viene detta | Una breve indicazione tra parentesi: a bassa voce, sempre sorridendo, con tono piatto forzato. È un'indicazione di recitazione, non un sottotitolo. |
| Chi altro c'è nell'inquadratura | Contrassegnato con labbra chiuse, così chi ascolta non muove la bocca a tempo. |
| Discorso fuori campo | Indicato per primo nella parentesi — voce fuori campo, al telefono, dall'interfono — e poi tutti i personaggi visibili sono descritti con la bocca chiusa. |
| Temporizzazione | Un'inquadratura con dialogo non è mai più corta di quanto serva alla battuta: tre parole al secondo in inglese, cinque caratteri al secondo in cinese. |
A ogni personaggio viene assegnata una voce da una libreria di voci di sistema predefinite: puoi ascoltare un campione da tre a otto secondi prima di scegliere, riabbinare la voce, sceglierne una diversa dal selettore o caricare una tua registrazione. Il motivo per cui si abbina invece di creare una voce per ogni personaggio è costo e stabilità: le voci create ad hoc variano tra le generazioni e hanno un costo per personaggio, mentre una voce della libreria è la stessa nell'episodio uno e nell'episodio dodici.
Se un personaggio non ha una voce assegnata, l'inquadratura usa come fallback una descrizione scritta della voce — età, timbro, registro — che il modello interpreta. È il comportamento predefinito per i nuovi progetti; assegnare le voci è un passaggio deliberato, non qualcosa che avviene automaticamente per tutti i personaggi.
Un'inquadratura di quattro secondi non può contenere sedici parole in inglese. O la recitazione è così veloce da risultare incomprensibile, o la battuta viene tagliata. Per questo le inquadrature con dialogo hanno una durata minima calcolata sulla battuta: numero di parole diviso tre per l'inglese, numero di caratteri diviso cinque per il cinese, e alle battute corte viene aggiunta una pausa invece di comprimerle al minimo teorico. Le inquadrature che risultano troppo corte per la loro battuta vengono segnalate e corrette prima del rendering, cosa più economica che accorgersene nel risultato finale.
La lingua dei dialoghi è un'impostazione del progetto, scelta una sola volta, e viene applicata nel momento in cui le battute vengono scritte, non tradotta dopo: così la performance è creata direttamente in quella lingua, non è un doppiaggio. Sono disponibili quindici lingue per l'interfaccia e i dialoghi sono supportati in tutte; un paio di lingue occasionalmente pronunciano male singole parole sul livello modello predefinito, e il selettore lo segnala dove succede. La pagina delle voci dei personaggi spiega questo nel dettaglio.
La voce è inclusa nel prezzo del video: non ci sono costi audio separati. Il video parte da 10 crediti al secondo di output (≈ $0.06/s sul livello prezzo più basso per credito) e arriva a $0.47/s sul livello più definito; l'assemblaggio costa 1 credit al secondo. Abbinare una voce dalla libreria è gratis. I nuovi account ricevono 50 crediti e un'anteprima gratuita fino a 5 secondi, abbastanza per ascoltare un personaggio parlare prima di decidere. Le tariffe sono sulla pagina dei prezzi.
Lingue
Ogni serie qui sotto è stata prodotta con la stessa pipeline, con il cast che parla la lingua in modo nativo: interfaccia, documenti di lavoro e battute sono tutti nella stessa lingua, niente doppiaggio. Aprila per ascoltarla.
A Carta de LisboaPortuguêsDialoghi nativi
윈터 프라미스한국어Dialoghi nativi
El Secreto de CostaEspañolDialoghi nativi
浪人の誓い日本語Dialoghi nativi
Ikrar JakartaBahasa IndonesiaDialoghi nativi
Зимняя коронаРусскийDialoghi nativi
L’Héritier du DéfiléFrançaisDialoghi nativi
Il Tavolo dell'OlivaItalianoNella tua lingua
De Vuurtoren van de FjordNederlandsDialoghi nativi
العهد الصحراويالعربيةDialoghi nativi
Çantasındaki SözleşmeTürkçeDialoghi nativi
Die Istanbul-TäuschungDeutschDialoghi nativi
Останній сигналУкраїнськаDialoghi nativi
問劍青雲繁體中文Dialoghi nativi
The Last EnvelopeEnglishDialoghi nativiNo. Immagine e voce vengono generate insieme in un solo passaggio, quindi bocca e performance sono un'unica scelta. Non c'è una traccia audio separata abbinata a un rendering muto, e non c'è modo di animare una foto o un video caricato.
Puoi caricare una registrazione come riferimento vocale di un personaggio. Clonare la voce di qualcun altro non è previsto.
Non dovrebbe: ogni personaggio che non parla nell'inquadratura è esplicitamente contrassegnato con le labbra chiuse, l'istruzione che impedisce a chi ascolta di muovere la bocca a tempo con la battuta.
L'indicazione di fuori campo viene scritta per prima nella nota di recitazione, e poi tutti i personaggi visibili nell'inquadratura sono descritti con la bocca chiusa: così la battuta si sente senza che nessuno sembri pronunciarla.
Perché alla battuta serve quel tempo. Le inquadrature con dialogo hanno una durata minima di circa tre parole al secondo in inglese, cinque caratteri al secondo in cinese, con una pausa aggiuntiva per le battute molto corte. Un'inquadratura troppo corta per la sua battuta viene corretta prima del rendering, non dopo.
L'anteprima gratuita è abbastanza lunga per una riga di dialogo.
Prova SceneMixer gratisPacchetti di crediti da $1.49 · Pro $7.99/mese · Nessuna carta di credito per iniziare
Prezzi·Guide·Esempi·Supporto·Privacy·Termini·Note legali·Contatti·© 2026 SceneMixer