SceneMixer
Español
Regístrate gratis

Generador de diálogos por IA

Generador de diálogos por IA

Actualizado el 20 de septiembre de 2026

Respuesta rápida: SceneMixer escribe los diálogos en el análisis del guion, asigna cada frase a una toma con un personaje y una nota breve de interpretación, y el modelo de vídeo lo representa: imagen y audio se generan a la vez, así que la boca pronuncia esa frase en el idioma que elegiste. La duración de las tomas se calcula a partir de la frase, a razón de tres palabras por segundo en español, para que ninguna toma quede demasiado corta para la oración que contiene. Editar una frase es gratis.
Imagen de “El suelo de cristal”, un drama corto con IA generado de principio a fin por SceneMixer (5 personajes, 1 episodio)
Ejemplo: “El suelo de cristal” — HD realista, 1 episodio, producido de principio a fin por SceneMixer a partir del guion · ver los episodios

El diálogo no es una pista de subtítulos

La mayoría de herramientas que dicen ofrecer «diálogo por IA» se refieren a subtítulos: texto que pegas sobre un clip. Aquí la frase se pronuncia. El modelo de vídeo genera imagen y audio en un solo paso, así que la boca del personaje forma esa oración, en ese idioma, con ese ritmo: no hay un archivo de voz separado pegado después ni un paso de sincronización labial que pueda fallar.

Esto tiene una consecuencia que conviene entender antes de escribir nada: la longitud de una frase decide la duración de la toma. Dilo en voz alta y cronométralo, porque el proceso hace exactamente eso.

De un vistazo

Qué produce la capa de diálogo y qué cuesta cambiarlo
Redactado porEl análisis del guion escribe las frases en el esquema de cada episodio; después, la lista de tomas las asigna a tomas concretas con un personaje y una nota de interpretación.
IdiomaSe elige una vez por proyecto, antes del análisis. Hay quince para elegir. El reparto actúa en ese idioma; la interfaz y los documentos de trabajo siguen tu propio idioma de forma independiente.
Notas de interpretaciónUna nota breve entre paréntesis por cada frase: cómo se dice, no qué se dice. Llega al modelo de vídeo como dirección de interpretación.
Frases fuera de campoSe marcan explícitamente: voz en off, narración, voz interior, voz al teléfono. Las frases marcadas no hacen que nadie abra la boca en pantalla.
Duración de la tomaSe deriva de la frase. En inglés se calcula a tres palabras por segundo; en chino, a cinco caracteres por segundo. Una frase corta siempre tiene una duración mínima para que la toma no se sienta cortada.
VocesSe asignan desde una biblioteca de voces preestablecida, o puedes subir una muestra para un personaje. No se clonan voces de personas de las que no tengas permiso.
EdiciónGratis. Reescribe cualquier frase en la lista de tomas; solo se vuelven a renderizar los segmentos que hayas modificado.

Por qué la regla del tiempo importa más de lo que parece

Una frase de dieciocho palabras en inglés necesita unos seis segundos de pantalla. Si pides al modelo de vídeo una toma de cuatro segundos y le das dieciocho palabras, pasa una de dos cosas: la interpretación se acelera hasta volverse ininteligible, o el modelo omite silenciosamente la segunda mitad de la oración. Ninguno de estos fallos se anuncia; solo lo notas al ver el montaje.

Por eso la lista de tomas calcula la duración mínima a partir de la propia frase y escribe ese número en la toma. Si las tomas de un segmento suman más de lo que el segmento puede contener, el segmento se divide en un límite de toma en lugar de comprimirse. Puedes ajustar cualquier duración manualmente; el cálculo existe para que el valor por defecto nunca falle de la forma que arruina una toma.

Notas de interpretación: dirección, no descripción literaria

Cada frase lleva una nota breve entre paréntesis, del tipo que un director daría en una mesa de lectura, no un adverbio de novelista. «Seco, ya lo ha decidido». «Intentando no mirar a la puerta». Estas notas llegan al modelo como instrucciones de interpretación y cambian la lectura de forma notable. El proceso aplica dos reglas para que sigan siendo útiles:

Cuando el modelo devuelve frases sin notas —lo cual ocurre de forma impredecible—, un paso pequeño adicional rellena solo las que faltan, sin tocar las propias frases.

Un proyecto, un idioma de diálogo

El idioma del diálogo es un ajuste de proyecto, no de cada frase, y se elige antes del análisis porque cambia lo que se escribe, no solo cómo se renderiza. Una novela web china con diálogo en inglés produce frases en inglés con ritmo inglés, no oraciones chinas traducidas. Los nombres y los escenarios se adaptan si también estableces una región de destino.

Lo que no cambia es el precio: un segmento cuesta los mismos créditos en cualquier idioma, y los documentos de trabajo que lees se traducen gratis. Los detalles están en la guía de idioma de diálogo; diálogo nativo frente a doblaje explica por qué esto no es un paso de doblaje.

Lo que no hará

Qué cuesta

El diálogo no es un cargo separado: lo escriben las dos etapas de pago que ya ejecutas. El análisis de guion cuesta 4 créditos por 3,333 caracteres de texto en inglés; la lista de tomas de cada episodio cuesta 1 crédito por 333 caracteres de ese episodio. Reescribir una frase es gratis; volver a renderizar el segmento que la contiene cuesta el coste de vídeo del segmento, desde 10 créditos por segundo (aprox. $0.06/s en el plan precio más bajo por crédito). La coincidencia de voz no cuesta nada. Las cuentas nuevas empiezan con 50 créditos y una vista previa gratuita de hasta 5 segundos, suficiente para escuchar una frase interpretada antes de pagar nada. La tabla completa está en la página de precios.

Idiomas

Diálogos nativos en 15 idiomas

Cada serie a continuación se ha producido con el mismo flujo de trabajo y el reparto habla ese idioma de forma nativa: la interfaz, los documentos de trabajo y las líneas habladas están en un mismo idioma, y no hay doblaje. Abre una para escucharlo.

Ver los 15 idiomas

Preguntas frecuentes

¿Puedo escribir yo mismo el diálogo en lugar de generarlo?

Sí. La lista de planos es texto editable: sustituye cualquier línea por la tuya y solo se volverá a renderizar ese segmento. Mucha gente también pega un guion ya terminado; en ese caso, el análisis conserva las líneas existentes en lugar de inventar otras nuevas.

¿Cómo controlo la forma de decir una línea?

Con la nota de interpretación entre paréntesis al lado. Mantenla breve y centrada en el modo, no en el significado: «en voz baja, sin preguntar» cambia la lectura; «dice que se va» no lo hace, porque la línea ya dice eso.

¿El mismo personaje sonará igual en todos los episodios?

Sí: la voz es una propiedad del personaje en el proyecto, se ajusta una vez y se reutiliza, igual que el rostro. Si subes tu propia muestra para un personaje, esa subida es una elección persistente y no se sobrescribe con ajustes posteriores.

¿Qué pasa con el monólogo interior de una novela?

Se convierte en una línea marcada —voz interior o narración—, de modo que se escucha mientras la imagen muestra algo que vale la pena ver, en lugar de convertirse en un plano de alguien pensando.

¿Puede la interfaz estar en un idioma y el diálogo en otro?

Sí, y es el caso más habitual: la interfaz y los documentos de trabajo siguen tu propio idioma, y las líneas habladas siguen la ambientación del proyecto. Un productor de habla inglesa puede lanzar una serie en coreano y seguir leyendo todos los documentos en inglés.

Escucha una línea antes de pagar por ella

Una vista previa gratuita renderiza el plano inicial de tu propio episodio, con la interpretación incluida.

Prueba SceneMixer gratis

Paquetes de créditos desde $1.49 · Pro $7.99/mes · No necesitas tarjeta de crédito para empezar

Precios·Guías·Ejemplos·Soporte·Privacidad·Términos·Aviso legal·Contacto·© 2026 SceneMixer