SceneMixer
Italiano
Registrati gratis

Personaggi che parlano

Video AI con personaggi che parlano

Aggiornato il 20 settembre 2026

Risposta rapida: la voce viene generata insieme all'immagine in un solo passaggio, non sincronizzata a posteriori su un video muto. Ogni inquadratura riporta la battuta parola per parola, l'oratore indicato è associato a una voce stabile della libreria, con una breve indicazione di recitazione e una nota esplicita che tutti gli altri personaggi nell'inquadratura tengono le labbra chiuse. Le inquadrature con dialogo hanno una durata minima: tre parole al secondo in inglese, quindi una battuta non viene mai compressa in un'inquadratura troppo corta.
Fotogramma da “Starfall Command”, un cortometraggio AI generato end-to-end da SceneMixer (7 personaggi, 1 episodio)
Esempio: “Starfall Command” — Realistico HD, 1 episodio, prodotto end-to-end da SceneMixer a partire dalla sceneggiatura · guarda gli episodi

La voce viene generata insieme all'immagine

Ci sono due modi per far parlare un personaggio sullo schermo. Uno è generare un video muto e poi animare la bocca con una traccia audio: è il metodo del lip-sync, che richiede un ritaglio del volto e un file audio di riferimento, produce un volto che si muove correttamente ma un corpo che non recita. L'altro è generare immagine e suono insieme, così la performance e la bocca sono un'unica scelta.

Questa pipeline usa il secondo metodo. Il livello video predefinito è audiovisivo: al modello vengono passati la battuta, chi la dice, come la dice e un riferimento vocale, e restituisce un'inquadratura con la battuta pronunciata al suo interno. Niente viene assemblato dopo.

In sintesi

Cosa viene inviato con un'inquadratura parlata
La battutaParola per parola, una sola volta. Pronunciata esattamente come scritta: non parafrasata, non ri-temporizzata.
Chi la diceIndicato per nome, e associato al riferimento vocale di quel personaggio così la stessa persona ha la stessa voce in tutti gli episodi.
Come viene dettaUna breve indicazione tra parentesi: a bassa voce, sempre sorridendo, con tono piatto forzato. È un'indicazione di recitazione, non un sottotitolo.
Chi altro c'è nell'inquadraturaContrassegnato con labbra chiuse, così chi ascolta non muove la bocca a tempo.
Discorso fuori campoIndicato per primo nella parentesi — voce fuori campo, al telefono, dall'interfono — e poi tutti i personaggi visibili sono descritti con la bocca chiusa.
TemporizzazioneUn'inquadratura con dialogo non è mai più corta di quanto serva alla battuta: tre parole al secondo in inglese, cinque caratteri al secondo in cinese.

Le voci vengono abbinate, non sintetizzate per ogni personaggio

A ogni personaggio viene assegnata una voce da una libreria di voci di sistema predefinite: puoi ascoltare un campione da tre a otto secondi prima di scegliere, riabbinare la voce, sceglierne una diversa dal selettore o caricare una tua registrazione. Il motivo per cui si abbina invece di creare una voce per ogni personaggio è costo e stabilità: le voci create ad hoc variano tra le generazioni e hanno un costo per personaggio, mentre una voce della libreria è la stessa nell'episodio uno e nell'episodio dodici.

Se un personaggio non ha una voce assegnata, l'inquadratura usa come fallback una descrizione scritta della voce — età, timbro, registro — che il modello interpreta. È il comportamento predefinito per i nuovi progetti; assegnare le voci è un passaggio deliberato, non qualcosa che avviene automaticamente per tutti i personaggi.

La regola di temporizzazione, e perché esiste

Un'inquadratura di quattro secondi non può contenere sedici parole in inglese. O la recitazione è così veloce da risultare incomprensibile, o la battuta viene tagliata. Per questo le inquadrature con dialogo hanno una durata minima calcolata sulla battuta: numero di parole diviso tre per l'inglese, numero di caratteri diviso cinque per il cinese, e alle battute corte viene aggiunta una pausa invece di comprimerle al minimo teorico. Le inquadrature che risultano troppo corte per la loro battuta vengono segnalate e corrette prima del rendering, cosa più economica che accorgersene nel risultato finale.

Lingua

La lingua dei dialoghi è un'impostazione del progetto, scelta una sola volta, e viene applicata nel momento in cui le battute vengono scritte, non tradotta dopo: così la performance è creata direttamente in quella lingua, non è un doppiaggio. Sono disponibili quindici lingue per l'interfaccia e i dialoghi sono supportati in tutte; un paio di lingue occasionalmente pronunciano male singole parole sul livello modello predefinito, e il selettore lo segnala dove succede. La pagina delle voci dei personaggi spiega questo nel dettaglio.

Cosa non fa

Quanto costa

La voce è inclusa nel prezzo del video: non ci sono costi audio separati. Il video parte da 10 crediti al secondo di output (≈ $0.06/s sul livello prezzo più basso per credito) e arriva a $0.47/s sul livello più definito; l'assemblaggio costa 1 credit al secondo. Abbinare una voce dalla libreria è gratis. I nuovi account ricevono 50 crediti e un'anteprima gratuita fino a 5 secondi, abbastanza per ascoltare un personaggio parlare prima di decidere. Le tariffe sono sulla pagina dei prezzi.

Lingue

Dialoghi nativi in 15 lingue

Ogni serie qui sotto è stata prodotta con la stessa pipeline, con il cast che parla la lingua in modo nativo: interfaccia, documenti di lavoro e battute sono tutti nella stessa lingua, niente doppiaggio. Aprila per ascoltarla.

Vedi tutte le 15 lingue

Domande frequenti

È lip-sync?

No. Immagine e voce vengono generate insieme in un solo passaggio, quindi bocca e performance sono un'unica scelta. Non c'è una traccia audio separata abbinata a un rendering muto, e non c'è modo di animare una foto o un video caricato.

Posso usare la mia voce?

Puoi caricare una registrazione come riferimento vocale di un personaggio. Clonare la voce di qualcun altro non è previsto.

Chi ascolta nell'inquadratura muove la bocca?

Non dovrebbe: ogni personaggio che non parla nell'inquadratura è esplicitamente contrassegnato con le labbra chiuse, l'istruzione che impedisce a chi ascolta di muovere la bocca a tempo con la battuta.

Cosa succede con le voci fuori campo e le telefonate?

L'indicazione di fuori campo viene scritta per prima nella nota di recitazione, e poi tutti i personaggi visibili nell'inquadratura sono descritti con la bocca chiusa: così la battuta si sente senza che nessuno sembri pronunciarla.

Perché la mia inquadratura con dialogo è più lunga di come l'ho scritta?

Perché alla battuta serve quel tempo. Le inquadrature con dialogo hanno una durata minima di circa tre parole al secondo in inglese, cinque caratteri al secondo in cinese, con una pausa aggiuntiva per le battute molto corte. Un'inquadratura troppo corta per la sua battuta viene corretta prima del rendering, non dopo.

Ascolta un personaggio prima di confermare un episodio

L'anteprima gratuita è abbastanza lunga per una riga di dialogo.

Prova SceneMixer gratis

Pacchetti di crediti da $1.49 · Pro $7.99/mese · Nessuna carta di credito per iniziare

Prezzi·Guide·Esempi·Supporto·Privacy·Termini·Note legali·Contatti·© 2026 SceneMixer