Generador de diálogos por IA
Actualizado el 20 de septiembre de 2026

La mayoría de herramientas que dicen ofrecer «diálogo por IA» se refieren a subtítulos: texto que pegas sobre un clip. Aquí la frase se pronuncia. El modelo de vídeo genera imagen y audio en un solo paso, así que la boca del personaje forma esa oración, en ese idioma, con ese ritmo: no hay un archivo de voz separado pegado después ni un paso de sincronización labial que pueda fallar.
Esto tiene una consecuencia que conviene entender antes de escribir nada: la longitud de una frase decide la duración de la toma. Dilo en voz alta y cronométralo, porque el proceso hace exactamente eso.
| Redactado por | El análisis del guion escribe las frases en el esquema de cada episodio; después, la lista de tomas las asigna a tomas concretas con un personaje y una nota de interpretación. |
|---|---|
| Idioma | Se elige una vez por proyecto, antes del análisis. Hay quince para elegir. El reparto actúa en ese idioma; la interfaz y los documentos de trabajo siguen tu propio idioma de forma independiente. |
| Notas de interpretación | Una nota breve entre paréntesis por cada frase: cómo se dice, no qué se dice. Llega al modelo de vídeo como dirección de interpretación. |
| Frases fuera de campo | Se marcan explícitamente: voz en off, narración, voz interior, voz al teléfono. Las frases marcadas no hacen que nadie abra la boca en pantalla. |
| Duración de la toma | Se deriva de la frase. En inglés se calcula a tres palabras por segundo; en chino, a cinco caracteres por segundo. Una frase corta siempre tiene una duración mínima para que la toma no se sienta cortada. |
| Voces | Se asignan desde una biblioteca de voces preestablecida, o puedes subir una muestra para un personaje. No se clonan voces de personas de las que no tengas permiso. |
| Edición | Gratis. Reescribe cualquier frase en la lista de tomas; solo se vuelven a renderizar los segmentos que hayas modificado. |
Una frase de dieciocho palabras en inglés necesita unos seis segundos de pantalla. Si pides al modelo de vídeo una toma de cuatro segundos y le das dieciocho palabras, pasa una de dos cosas: la interpretación se acelera hasta volverse ininteligible, o el modelo omite silenciosamente la segunda mitad de la oración. Ninguno de estos fallos se anuncia; solo lo notas al ver el montaje.
Por eso la lista de tomas calcula la duración mínima a partir de la propia frase y escribe ese número en la toma. Si las tomas de un segmento suman más de lo que el segmento puede contener, el segmento se divide en un límite de toma en lugar de comprimirse. Puedes ajustar cualquier duración manualmente; el cálculo existe para que el valor por defecto nunca falle de la forma que arruina una toma.
Cada frase lleva una nota breve entre paréntesis, del tipo que un director daría en una mesa de lectura, no un adverbio de novelista. «Seco, ya lo ha decidido». «Intentando no mirar a la puerta». Estas notas llegan al modelo como instrucciones de interpretación y cambian la lectura de forma notable. El proceso aplica dos reglas para que sigan siendo útiles:
Cuando el modelo devuelve frases sin notas —lo cual ocurre de forma impredecible—, un paso pequeño adicional rellena solo las que faltan, sin tocar las propias frases.
El idioma del diálogo es un ajuste de proyecto, no de cada frase, y se elige antes del análisis porque cambia lo que se escribe, no solo cómo se renderiza. Una novela web china con diálogo en inglés produce frases en inglés con ritmo inglés, no oraciones chinas traducidas. Los nombres y los escenarios se adaptan si también estableces una región de destino.
Lo que no cambia es el precio: un segmento cuesta los mismos créditos en cualquier idioma, y los documentos de trabajo que lees se traducen gratis. Los detalles están en la guía de idioma de diálogo; diálogo nativo frente a doblaje explica por qué esto no es un paso de doblaje.
El diálogo no es un cargo separado: lo escriben las dos etapas de pago que ya ejecutas. El análisis de guion cuesta 4 créditos por 3,333 caracteres de texto en inglés; la lista de tomas de cada episodio cuesta 1 crédito por 333 caracteres de ese episodio. Reescribir una frase es gratis; volver a renderizar el segmento que la contiene cuesta el coste de vídeo del segmento, desde 10 créditos por segundo (aprox. $0.06/s en el plan precio más bajo por crédito). La coincidencia de voz no cuesta nada. Las cuentas nuevas empiezan con 50 créditos y una vista previa gratuita de hasta 5 segundos, suficiente para escuchar una frase interpretada antes de pagar nada. La tabla completa está en la página de precios.
Idiomas
Cada serie a continuación se ha producido con el mismo flujo de trabajo y el reparto habla ese idioma de forma nativa: la interfaz, los documentos de trabajo y las líneas habladas están en un mismo idioma, y no hay doblaje. Abre una para escucharlo.
A Carta de LisboaPortuguêsDiálogo nativo
윈터 프라미스한국어Diálogo nativo
El Secreto de CostaEspañolEn tu idioma
浪人の誓い日本語Diálogo nativo
Ikrar JakartaBahasa IndonesiaDiálogo nativo
Зимняя коронаРусскийDiálogo nativo
L’Héritier du DéfiléFrançaisDiálogo nativo
Il Tavolo dell'OlivaItalianoDiálogo nativo
De Vuurtoren van de FjordNederlandsDiálogo nativo
العهد الصحراويالعربيةDiálogo nativo
Çantasındaki SözleşmeTürkçeDiálogo nativo
Die Istanbul-TäuschungDeutschDiálogo nativo
Останній сигналУкраїнськаDiálogo nativo
問劍青雲繁體中文Diálogo nativo
The Last EnvelopeEnglishDiálogo nativoSí. La lista de planos es texto editable: sustituye cualquier línea por la tuya y solo se volverá a renderizar ese segmento. Mucha gente también pega un guion ya terminado; en ese caso, el análisis conserva las líneas existentes en lugar de inventar otras nuevas.
Con la nota de interpretación entre paréntesis al lado. Mantenla breve y centrada en el modo, no en el significado: «en voz baja, sin preguntar» cambia la lectura; «dice que se va» no lo hace, porque la línea ya dice eso.
Sí: la voz es una propiedad del personaje en el proyecto, se ajusta una vez y se reutiliza, igual que el rostro. Si subes tu propia muestra para un personaje, esa subida es una elección persistente y no se sobrescribe con ajustes posteriores.
Se convierte en una línea marcada —voz interior o narración—, de modo que se escucha mientras la imagen muestra algo que vale la pena ver, en lugar de convertirse en un plano de alguien pensando.
Sí, y es el caso más habitual: la interfaz y los documentos de trabajo siguen tu propio idioma, y las líneas habladas siguen la ambientación del proyecto. Un productor de habla inglesa puede lanzar una serie en coreano y seguir leyendo todos los documentos en inglés.
Una vista previa gratuita renderiza el plano inicial de tu propio episodio, con la interpretación incluida.
Prueba SceneMixer gratisPaquetes de créditos desde $1.49 · Pro $7.99/mes · No necesitas tarjeta de crédito para empezar
Precios·Guías·Ejemplos·Soporte·Privacidad·Términos·Aviso legal·Contacto·© 2026 SceneMixer