
Las descripciones de voz se ven en el panel de personaje de cualquier proyecto. Abre un ejemplo, haz clic en un personaje y la línea de voz aparece debajo de la descripción de apariencia.
La lectura del guion da a cada personaje una descripción breve de voz, igual que le da una apariencia. Esa línea pasa al prompt de vídeo y el modelo la interpreta. No se adjunta ningún archivo de muestra; no se genera nada por adelantado.
Este es el modo predeterminado porque es gratis, instantáneo y para la mayoría de los personajes es suficiente. El coste es la consistencia: dos tomas del mismo personaje pueden salir ligeramente distintas.

Abre un personaje y pide una coincidencia de voz. Un pase corto y gratuito lee la descripción y elige una voz de la biblioteca integrada, prefiriendo una que hable el idioma correcto. Obtienes una muestra para reproducir y un selector para elegir otra si la coincidencia no encaja.
Una vez asignada, la muestra se convierte en referencia de audio en todas las tomas en las que hable ese personaje, lo que hace que la voz se mantenga a lo largo del episodio.
La biblioteca es un conjunto fijo de voces del sistema con una muestra prerenderizada para cada una, así que probar coincidencias no cuesta nada, ni tampoco cambiar de opinión.
Puedes subir un clip y usarlo como voz del personaje. Se recorta a una referencia corta y se usa igual que un ajuste predefinido coincidente. Una voz subida es una elección fija: los pases de coincidencia posteriores no la sobrescribirán. Subir archivos es una función para miembros — los dos primeros modos son gratuitos para todo el mundo.
Solo sube una voz que tengas derecho a usar. Una grabación de una persona real pertenece a esa persona, y la plataforma no ayudará a usar una sin su permiso.
La voz cubre el timbre y la interpretación. No decide qué se dice: las líneas vienen del storyboard y se dicen palabra por palabra. Tampoco se aplica a la narración: las líneas marcadas como fuera de campo o voz en off se tratan como audio off, y las personas en cuadro mantienen la boca cerrada.
Si una toma no tiene diálogo, no se usa ninguna voz: lo que oyes es la pista ambiental escrita en esa toma.
Volver a buscar coincidencia, elegir otro ajuste predefinido y volver a la descripción de texto son acciones gratuitas y surten efecto en la siguiente toma que generes. Los segmentos que ya hayas grabado mantienen la voz con la que se grabaron; regenera un segmento si quieres que use la nueva.
| Modo | Coste | Consistencia |
|---|---|---|
| Descripción con palabras | Gratis, automático | Buena, varía ligeramente por toma |
| Ajuste predefinido coincidente | Gratis para coincidir y cambiar | Se mantiene en todo el episodio |
| Tu propio archivo subido | Función para miembros | Se mantiene; no se sobrescribe al volver a coincidir |
No. Sin una voz coincidente, la descripción se interpreta directamente, y ese es el valor predeterminado en cada proyecto.
Sí: cada ajuste predefinido de la biblioteca tiene una muestra que puedes reproducir en el selector.
No. El pase de coincidencia es gratuito, y cambiar de opinión también.
Esas líneas se tratan como audio fuera de campo: se oyen, pero las personas en pantalla no mueven los labios.
Los miembros pueden subir un clip que tengan derecho a usar. No ofrecemos clonación de una persona concreta por nombre, y no se permite subir la voz de otra persona sin permiso.
Abre un personaje, asigna una voz y reproduce la muestra antes de grabar nada.
Actualizado el 21 de septiembre de 2026
Precios·Guías·Ejemplos·Soporte·Privacidad·Términos·Aviso legal·Contacto·© 2026 SceneMixer