Voces de personajes con IA
Actualizado el 16 de septiembre de 2026

La mayoría de flujos de trabajo de vídeo con IA tratan el audio como un paso separado: generan metraje mudo, sintetizan las líneas y luego luchan por sincronizar los labios. Los modelos de vídeo que usamos aquí generan audio e imagen en un solo paso, lo que elimina ese problema pero cambia lo que es un «ajuste de voz». No es un motor de texto a voz al que le pasas un guion: es una referencia sobre la que se condiciona el proceso de generación.
| Descripción escrita | Edad, timbre, peso, forma de hablar: se genera a partir del guion junto con todo lo demás del personaje, y el modelo de vídeo la interpreta. |
|---|---|
| Preestablecida coincidente | Una voz elegida de una biblioteca de voces del sistema, cada una con una muestra de audio corta que puedes escuchar. Una llamada al modelo propone una coincidencia por personaje según género, idioma y edad; puedes volver a buscar coincidencia o elegir otra manualmente. |
| Tu propia muestra | Sube un audio para un personaje y se convertirá en la referencia de voz de ese personaje en cada segmento en el que hable. |
La voz que se asigne se usa de forma coherente: el mismo personaje habla con la misma voz en todos los segmentos y todos los episodios, por la misma razón por la que su cara se mantiene igual: la referencia viaja con él.
Aquí no hay ninguna herramienta para clonar la voz de otra persona a partir de una grabación. Es una ausencia deliberada, no algo pendiente de desarrollo: publicar una interpretación sintética de la voz de una persona real es un problema de derecho de imagen en la mayoría de mercados en los que operamos, y un producto que lo haga con un clic es un producto que lo convierte en algo habitual. Nuestra propia lista de comprobación de cumplimiento trata la imagen —tanto la cara como la voz— como algo para lo que debes tener derechos de uso antes de publicar.
Dos consecuencias de esto que vale la pena decir claramente:
El idioma de los diálogos se elige en el Paso 1 y se aplica a todo el proyecto: las líneas se escriben en ese idioma en la fase de análisis, se copian literalmente al storyboard y se interpretan en él. No es un doblaje sobre un original en inglés: no hay ningún original en inglés. El reparto, los nombres y los escenarios pueden adaptarse al mercado correspondiente al mismo tiempo mediante el ajuste de región de destino. Se admiten quince idiomas, y los argumentos contra el doblaje explican por qué generar la línea es mejor que reajustar su tiempo.
La coincidencia de voces es una llamada al modelo gratuita: no consume credits y no cuenta para tu límite de tareas simultáneas. Subir tu propia muestra es gratis. El audio en sí forma parte de la generación de vídeo, que empieza en 10 credits por segundo de salida (aprox. $0.06/s en el plan precio más bajo por crédito); no hay ningún cargo separado por palabra o por personaje para el habla. Consulta la página de precios, o la descripción general del generador para ver dónde encaja la voz en la ejecución.
El idioma de los diálogos se configura una vez en el Paso 1 y toda la ejecución se interpreta en él, mientras que el ajuste de región de destino adapta nombres, caras y calles a ese mercado al mismo tiempo. Cada muestra a continuación se produjo de esa forma, una por idioma.
Idiomas
Cada serie a continuación se ha producido con el mismo flujo de trabajo y el reparto habla ese idioma de forma nativa: la interfaz, los documentos de trabajo y las líneas habladas están en un mismo idioma, y no hay doblaje. Abre una para escucharlo.
A Carta de LisboaPortuguêsDiálogo nativo
윈터 프라미스한국어Diálogo nativo
El Secreto de CostaEspañolEn tu idioma
浪人の誓い日本語Diálogo nativo
Ikrar JakartaBahasa IndonesiaDiálogo nativo
Зимняя коронаРусскийDiálogo nativo
L’Héritier du DéfiléFrançaisDiálogo nativo
Il Tavolo dell'OlivaItalianoDiálogo nativo
De Vuurtoren van de FjordNederlandsDiálogo nativo
العهد الصحراويالعربيةDiálogo nativo
Çantasındaki SözleşmeTürkçeDiálogo nativo
Die Istanbul-TäuschungDeutschDiálogo nativo
Останній сигналУкраїнськаDiálogo nativo
問劍青雲繁體中文Diálogo nativo
The Last EnvelopeEnglishDiálogo nativoNo. Las voces se seleccionan de una biblioteca de voces preestablecidas muestreadas, o las proporcionas tú subiendo tu propio audio. No hay forma de reproducir la voz de otra persona a partir de una grabación, y es algo intencional, no una función pendiente.
No. Los modelos de vídeo generan imagen y audio en el mismo paso, por lo que la interpretación y el movimiento de la boca salen de una sola generación. Esa es también la razón por la que cambiar una línea implica regenerar ese segmento en lugar de volver a editar una pista de audio.
Sí. Sube una muestra para un personaje y se convertirá en la referencia de voz de ese personaje en cada segmento en el que hable.
El idioma de los diálogos es un ajuste de nivel de proyecto, así que sí dentro de un mismo proyecto, pero el idioma se elige independientemente del idioma en el que hayas escrito el guion y de forma independiente al idioma de tu interfaz. Un mismo guion se puede producir para varios mercados ejecutándolo con ajustes diferentes.
Sí, por la misma razón que la cara: cualquier voz asignada a un personaje se adjunta a nivel de proyecto y está presente en cada segmento en el que ese personaje hable.
Imagen e interpretación en un solo paso, en el idioma que habla tu audiencia.
Prueba SceneMixer gratisPaquetes de credits desde $1.49 · Pro $7.99/mes · No necesitas tarjeta de crédito para empezar
Precios·Guías·Ejemplos·Soporte·Privacidad·Términos·Aviso legal·Contacto·© 2026 SceneMixer