Personajes que hablan
Actualizado el 20 de septiembre de 2026

Hay dos formas de hacer que un personaje hable en pantalla. Una es renderizar un vídeo mudo y luego mover la boca con una pista de audio: la vía de la sincronización labial, que requiere un recorte del rostro y un archivo de audio de referencia, y produce una cara que se mueve correctamente pero un cuerpo que no actúa. La otra es generar imagen y sonido a la vez, de modo que la interpretación y la boca son una sola decisión.
Este flujo usa la segunda opción. El nivel de vídeo predeterminado es audiovisual: al modelo se le da la frase, quién la dice, cómo se dice y una referencia de voz, y devuelve un plano con la frase dicha en él. No se cose nada después.
| La frase | Literal, una sola vez. Se dice exactamente como está escrita: sin parafrasear, sin reajustar el tiempo. |
|---|---|
| Quién la dice | Con nombre, y vinculado a la referencia de voz de ese personaje para que la misma persona suene igual en todos los episodios. |
| Cómo se dice | Una indicación corta entre corchetes: entre dientes, todavía sonriendo, forzando un tono plano. Es dirección de interpretación, no subtítulo. |
| Quién más está en plano | Marcado con labios cerrados, para que quienes escuchan no muevan la boca al compás. |
| Habla fuera de plano | Se marca primero en el corchete — voz en off, al teléfono, por el interfono — y luego se describe a todos los visibles con la boca cerrada. |
| Tiempo | Un plano con diálogo nunca es más corto de lo que la frase necesita: tres palabras por segundo en inglés, cinco caracteres por segundo en chino. |
A cada personaje se le asigna una voz de una biblioteca de voces del sistema preconstruidas: escuchas una muestra de tres a ocho segundos antes de elegir, puedes reasignar, elegir otra desde el selector o subir tu propia grabación. La razón de emparejar en lugar de diseñar voces por personaje es el coste y la estabilidad: las voces diseñadas varían entre generaciones y tienen coste por personaje, mientras que una voz de biblioteca es la misma voz en el episodio uno y en el doce.
Si un personaje no tiene voz asignada, el plano recurre a una descripción escrita de la voz — edad, textura, registro — que el modelo interpreta. Ese es el valor predeterminado para proyectos nuevos; asignar voces es un paso deliberado, no algo que ocurre automáticamente con cada personaje.
Un plano de cuatro segundos no puede contener dieciséis palabras en inglés. O la interpretación se apura hasta volverse ininteligible o la frase se corta. Por eso los planos con diálogo tienen un mínimo derivado de la frase: número de palabras dividido entre tres para inglés, número de caracteres dividido entre cinco para chino, y a las frases cortas se les añade una pausa en lugar de comprimirlas a su mínimo teórico. Los planos que vuelven demasiado cortos para su frase se marcan y corrigen antes de renderizar nada, lo que es más barato que descubrirlo en el resultado.
El idioma del diálogo es un ajuste del proyecto, elegido una vez, y se aplica donde se escriben las frases por primera vez en lugar de traducirse después; así la interpretación se crea en ese idioma en lugar de ser un doblaje. Hay quince idiomas de interfaz disponibles y el diálogo se admite en todos ellos; un par de idiomas pronuncian mal alguna que otra palabra en el nivel de modelo predeterminado, y el selector lo indica cuando ocurre. La página de voces de personajes lo trata con detalle.
El habla está incluida en el precio del vídeo: no hay cargo de audio separado. El vídeo empieza en 10 créditos por segundo de salida (aprox. $0.06/s en el precio más bajo por crédito) y llega a $0.47/s en el nivel más nítido; el montaje cuesta 1 crédito por segundo. El emparejamiento de voz desde la biblioteca es gratuito. Las cuentas nuevas reciben 50 créditos y una previsualización gratuita de hasta 5 segundos: suficiente para oír hablar a un personaje antes de decidir. Las tarifas están en la página de precios.
Idiomas
Cada serie a continuación se ha producido con el mismo flujo de trabajo y el reparto habla ese idioma de forma nativa: la interfaz, los documentos de trabajo y las líneas habladas están en un mismo idioma, y no hay doblaje. Abre una para escucharlo.
A Carta de LisboaPortuguêsDiálogo nativo
윈터 프라미스한국어Diálogo nativo
El Secreto de CostaEspañolEn tu idioma
浪人の誓い日本語Diálogo nativo
Ikrar JakartaBahasa IndonesiaDiálogo nativo
Зимняя коронаРусскийDiálogo nativo
L’Héritier du DéfiléFrançaisDiálogo nativo
Il Tavolo dell'OlivaItalianoDiálogo nativo
De Vuurtoren van de FjordNederlandsDiálogo nativo
العهد الصحراويالعربيةDiálogo nativo
Çantasındaki SözleşmeTürkçeDiálogo nativo
Die Istanbul-TäuschungDeutschDiálogo nativo
Останній сигналУкраїнськаDiálogo nativo
問劍青雲繁體中文Diálogo nativo
The Last EnvelopeEnglishDiálogo nativoNo. La imagen y el habla se generan juntas en un solo paso, así que la boca y la interpretación son la misma decisión. No hay una pista de audio separada que se ajuste a un render mudo, ni forma de animar una foto o un vídeo subido.
Puedes subir una grabación como referencia de voz de un personaje. No se ofrece clonar la voz de otra persona.
No deberían: cada personaje que no habla en plano se marca explícitamente con los labios cerrados, que es la instrucción que evita que quien escucha mueva la boca al compás de la frase.
La marca de fuera de plano se escribe primero en la nota de interpretación, y luego se describe a todos los visibles en el plano con la boca cerrada; así se oye la frase sin que nadie parezca decirla.
Porque la frase necesita ese tiempo. Los planos con diálogo tienen un mínimo de unas tres palabras por segundo en inglés, cinco caracteres por segundo en chino, con una pausa añadida para frases muy cortas. Un plano demasiado corto para su frase se corrige antes del renderizado, no después.
La vista previa gratuita dura lo suficiente para una línea de diálogo.
Prueba SceneMixer gratisPaquetes de créditos desde $1.49 · Pro $7.99/mes · No necesitas tarjeta de crédito para empezar
Precios·Guías·Ejemplos·Soporte·Privacidad·Términos·Aviso legal·Contacto·© 2026 SceneMixer