SceneMixer
Español
Regístrate gratis

Personajes que hablan

Vídeo con IA de personajes que hablan

Actualizado el 20 de septiembre de 2026

Respuesta rápida: el habla se genera junto con la imagen en un solo paso, no se sincronizan los labios sobre un render mudo. Cada plano contiene la frase literalmente, el personaje que habla vinculado a una voz estable de la biblioteca, una indicación breve de interpretación y una nota explícita de que todos los demás personajes en plano mantienen los labios cerrados. Los planos con diálogo tienen una duración mínima: tres palabras por segundo en inglés, así que ninguna frase se comprime en un plano demasiado corto para ella.
Imagen de “Starfall Command”, un drama corto con IA generado de principio a fin por SceneMixer (7 personajes, 1 episodio)
Ejemplo: “Starfall Command” — HD realista, 1 episodio, producido de principio a fin por SceneMixer a partir del guion · ver los episodios

La voz sale de la misma generación que la imagen

Hay dos formas de hacer que un personaje hable en pantalla. Una es renderizar un vídeo mudo y luego mover la boca con una pista de audio: la vía de la sincronización labial, que requiere un recorte del rostro y un archivo de audio de referencia, y produce una cara que se mueve correctamente pero un cuerpo que no actúa. La otra es generar imagen y sonido a la vez, de modo que la interpretación y la boca son una sola decisión.

Este flujo usa la segunda opción. El nivel de vídeo predeterminado es audiovisual: al modelo se le da la frase, quién la dice, cómo se dice y una referencia de voz, y devuelve un plano con la frase dicha en él. No se cose nada después.

De un vistazo

Qué se envía con un plano de habla
La fraseLiteral, una sola vez. Se dice exactamente como está escrita: sin parafrasear, sin reajustar el tiempo.
Quién la diceCon nombre, y vinculado a la referencia de voz de ese personaje para que la misma persona suene igual en todos los episodios.
Cómo se diceUna indicación corta entre corchetes: entre dientes, todavía sonriendo, forzando un tono plano. Es dirección de interpretación, no subtítulo.
Quién más está en planoMarcado con labios cerrados, para que quienes escuchan no muevan la boca al compás.
Habla fuera de planoSe marca primero en el corchete — voz en off, al teléfono, por el interfono — y luego se describe a todos los visibles con la boca cerrada.
TiempoUn plano con diálogo nunca es más corto de lo que la frase necesita: tres palabras por segundo en inglés, cinco caracteres por segundo en chino.

Las voces se emparejan, no se sintetizan por personaje

A cada personaje se le asigna una voz de una biblioteca de voces del sistema preconstruidas: escuchas una muestra de tres a ocho segundos antes de elegir, puedes reasignar, elegir otra desde el selector o subir tu propia grabación. La razón de emparejar en lugar de diseñar voces por personaje es el coste y la estabilidad: las voces diseñadas varían entre generaciones y tienen coste por personaje, mientras que una voz de biblioteca es la misma voz en el episodio uno y en el doce.

Si un personaje no tiene voz asignada, el plano recurre a una descripción escrita de la voz — edad, textura, registro — que el modelo interpreta. Ese es el valor predeterminado para proyectos nuevos; asignar voces es un paso deliberado, no algo que ocurre automáticamente con cada personaje.

La regla de tiempo y por qué existe

Un plano de cuatro segundos no puede contener dieciséis palabras en inglés. O la interpretación se apura hasta volverse ininteligible o la frase se corta. Por eso los planos con diálogo tienen un mínimo derivado de la frase: número de palabras dividido entre tres para inglés, número de caracteres dividido entre cinco para chino, y a las frases cortas se les añade una pausa en lugar de comprimirlas a su mínimo teórico. Los planos que vuelven demasiado cortos para su frase se marcan y corrigen antes de renderizar nada, lo que es más barato que descubrirlo en el resultado.

Idioma

El idioma del diálogo es un ajuste del proyecto, elegido una vez, y se aplica donde se escriben las frases por primera vez en lugar de traducirse después; así la interpretación se crea en ese idioma en lugar de ser un doblaje. Hay quince idiomas de interfaz disponibles y el diálogo se admite en todos ellos; un par de idiomas pronuncian mal alguna que otra palabra en el nivel de modelo predeterminado, y el selector lo indica cuando ocurre. La página de voces de personajes lo trata con detalle.

Lo que no hará

Cuánto cuesta

El habla está incluida en el precio del vídeo: no hay cargo de audio separado. El vídeo empieza en 10 créditos por segundo de salida (aprox. $0.06/s en el precio más bajo por crédito) y llega a $0.47/s en el nivel más nítido; el montaje cuesta 1 crédito por segundo. El emparejamiento de voz desde la biblioteca es gratuito. Las cuentas nuevas reciben 50 créditos y una previsualización gratuita de hasta 5 segundos: suficiente para oír hablar a un personaje antes de decidir. Las tarifas están en la página de precios.

Idiomas

Diálogos nativos en 15 idiomas

Cada serie a continuación se ha producido con el mismo flujo de trabajo y el reparto habla ese idioma de forma nativa: la interfaz, los documentos de trabajo y las líneas habladas están en un mismo idioma, y no hay doblaje. Abre una para escucharlo.

Ver los 15 idiomas

Preguntas frecuentes

¿Esto es sincronización labial?

No. La imagen y el habla se generan juntas en un solo paso, así que la boca y la interpretación son la misma decisión. No hay una pista de audio separada que se ajuste a un render mudo, ni forma de animar una foto o un vídeo subido.

¿Puedo usar mi propia voz?

Puedes subir una grabación como referencia de voz de un personaje. No se ofrece clonar la voz de otra persona.

¿Los personajes que escuchan en el plano mueven la boca?

No deberían: cada personaje que no habla en plano se marca explícitamente con los labios cerrados, que es la instrucción que evita que quien escucha mueva la boca al compás de la frase.

¿Qué pasa con la voz en off y las llamadas telefónicas?

La marca de fuera de plano se escribe primero en la nota de interpretación, y luego se describe a todos los visibles en el plano con la boca cerrada; así se oye la frase sin que nadie parezca decirla.

¿Por qué mi plano con diálogo es más largo de lo que escribí?

Porque la frase necesita ese tiempo. Los planos con diálogo tienen un mínimo de unas tres palabras por segundo en inglés, cinco caracteres por segundo en chino, con una pausa añadida para frases muy cortas. Un plano demasiado corto para su frase se corrige antes del renderizado, no después.

Escucha a un personaje antes de comprometer un episodio

La vista previa gratuita dura lo suficiente para una línea de diálogo.

Prueba SceneMixer gratis

Paquetes de créditos desde $1.49 · Pro $7.99/mes · No necesitas tarjeta de crédito para empezar

Precios·Guías·Ejemplos·Soporte·Privacidad·Términos·Aviso legal·Contacto·© 2026 SceneMixer