Scene AI con più personaggi
Aggiornato il 20 settembre 2026

I video generati hanno un difetto specifico quando nell’inquadratura c’è più di una persona: aggiungono una faccia che non dovrebbe esserci. Qualcuno menzionato nel testo — guardato, chiamato a voce, pensato — appare sullo schermo con una faccia inventata sul momento, perché niente dice al modello la differenza tra “presente” e “nominato”.
Per questo l’elenco delle inquadrature lo specifica per ogni shot. Ogni inquadratura porta un elenco esplicito di quali personaggi sono visibili, e solo quell’elenco — non la prosa, non lo stato finale dell’inquadratura precedente — decide quali riferimenti dei personaggi vengono allegati.
| Chi è visibile nell’inquadratura | Un elenco per ogni shot. L’unione di tutti gli elenchi dei shot di un segmento decide quali fogli di riferimento vengono inviati. |
|---|---|
| Chi è fuori campo | Viene scritto come direzione — “verso sinistra”, “sguardo verso la camera” — non come nome. Nessuna faccia viene allegata. |
| Inquadrature di una sola persona | Sono marcate esplicitamente, così il renderer sa che nell’inquadratura c’è una persona sola e non deve inventare compagnia. |
| Chi parla | Viene nominato per ogni battuta; tutti gli altri nell’inquadratura sono marcati a labbra chiuse, così muove la bocca solo chi parla. |
| Folla sullo sfondo | È uno stato dichiarato della scena, scritto una sola volta nell’intestazione del segmento, oppure non c’è — non viene mai dedotto dal suono ambientale. |
| Limite pratico | Oltre quattro personaggi nominati nella stessa inquadratura la qualità cala. L’elenco delle inquadrature lo evita, invece di forzarlo. |
È un fatto misurabile, non teorico. Inquadrature che nominavano un antagonista fuori campo hanno prodotto la faccia sbagliata o una persona in più in cinque render su otto. Le stesse inquadrature riscritte usando una direzione al posto del nome hanno dato zero errori in dodici render. Per questo la pipeline le riscrive: in uno shot di una sola persona, un personaggio che esiste solo come direzione di sguardo o di movimento viene convertito in una frase spaziale e rimosso dall’elenco dei presenti.
La stessa logica vale per i morti: un personaggio citato solo come cadavere in questo segmento viene scritto come un nome comune, non come riferimento a un personaggio, così nessuno allega la sua scheda di riferimento e lo fa rialzare.
Ci sono esattamente due modi di girarlo, e l’elenco deve sceglierne uno: due figure di profilo, oppure over-the-shoulder. Quello che non si può scrivere è “A di fronte a B, con B sullo sfondo sfocato”: perché B sia nella profondità di campo di A, A dovrebbe dare le spalle a B, e quella posizione di camera non esiste in un normale campo medio. Se lo chiedi comunque, il renderer mette una persona di fronte alla camera e l’altra in piedi dietro di lei. L’asse viene fissato nel primo shot in cui entrambi sono effettivamente visibili insieme.
Una sala con trecento invitati è uno stato visibile della scena, quindi viene scritto come tale: una riga nell’intestazione del segmento che dice chi sono le persone sullo sfondo, dove sono e cosa fanno. In modo coerente in tutti i segmenti di quella scena. Senza quella riga, l’inquadratura non può parlare di folla, perché il “mormorio degli invitati” nell’audio ambientale non è un’istruzione visiva, e un renderer che riceve solo quello ti mette gli invitati in uno shot e la sala vuota nel successivo.
Quando una folla è dichiarata, l’istruzione dell’inquadratura cambia di conseguenza: la folla resta nella profondità di campo, e l’elenco dei presenti conta solo i personaggi nominati.
Niente di extra: sono proprietà dell’elenco delle inquadrature, che viene fatturato in base alla lunghezza del testo a 1 credito ogni cento caratteri della parte di episodio. Le schede di riferimento costano 7 crediti ciascuna oltre le 15 gratuite del primo progetto, e il rendering parte da 10 crediti al secondo di output. Vedi coerenza dei personaggi per come le facce restano uguali tra gli shot, e la pagina dei prezzi per le tariffe.
Lingue
Ogni serie qui sotto è stata prodotta con la stessa pipeline, con il cast che parla la lingua in modo nativo: interfaccia, documenti di lavoro e battute sono tutti nella stessa lingua, niente doppiaggio. Aprila per ascoltarla.
A Carta de LisboaPortuguêsDialoghi nativi
윈터 프라미스한국어Dialoghi nativi
El Secreto de CostaEspañolDialoghi nativi
浪人の誓い日本語Dialoghi nativi
Ikrar JakartaBahasa IndonesiaDialoghi nativi
Зимняя коронаРусскийDialoghi nativi
L’Héritier du DéfiléFrançaisDialoghi nativi
Il Tavolo dell'OlivaItalianoNella tua lingua
De Vuurtoren van de FjordNederlandsDialoghi nativi
العهد الصحراويالعربيةDialoghi nativi
Çantasındaki SözleşmeTürkçeDialoghi nativi
Die Istanbul-TäuschungDeutschDialoghi nativi
Останній сигналУкраїнськаDialoghi nativi
問劍青雲繁體中文Dialoghi nativi
The Last EnvelopeEnglishDialoghi nativiQuattro persone nominate è il limite pratico prima che l’identità cominci a degradare, e l’elenco delle inquadrature è costruito per stare sotto quel limite: le scene di gruppo sono coperte con primi piani e over-the-shoulder invece che campi larghi di gruppo.
È esattamente il difetto che l’elenco dei presenti per ogni shot previene. Un personaggio che viene solo guardato o a cui si parla è scritto come direzione, non come nome, e non compare nell’elenco dei presenti — quindi non viene allegata nessuna scheda di riferimento e non viene inventata nessuna faccia.
Sì, come due figure di profilo o in over-the-shoulder. Quello che non funziona è uno di fronte all’altro con l’altro sfocato sullo sfondo: quella combinazione di inquadratura e profondità è fisicamente incoerente, e chiederla produce una persona in piedi dietro a qualcuno che parla alla camera.
Vengono dichiarati una sola volta nell'intestazione del segmento — chi sono, dove si trovano, cosa stanno facendo — e rimangono coerenti per tutta la scena. Se non viene dichiarato nulla, l'inquadratura non include una folla. Il solo rumore ambientale di folla non viene considerato un'istruzione visiva.
Solo il personaggio indicato come parlante per ogni battuta. Tutti gli altri nell'inquadratura sono esplicitamente marcati con le labbra chiuse, per evitare che chi ascolta muova la bocca a tempo con il dialogo.
Genera una scena affollata e conta i volti.
Prova SceneMixer gratisPacchetti di crediti da $1.49 · Pro $7.99/mese · Nessuna carta di credito per iniziare
Prezzi·Guide·Esempi·Supporto·Privacy·Termini·Note legali·Contatti·© 2026 SceneMixer