Vozes de personagens por IA
Atualizado em 16 de setembro de 2026

A maioria dos fluxos de trabalho de vídeo por IA trata o áudio como uma segunda etapa: gerar cenas mudas, sintetizar falas e depois lutar com a sincronia labial. Os modelos de vídeo aqui geram áudio e imagem em uma única etapa, o que elimina essa luta, mas muda o que é uma “configuração de voz”. Não é um mecanismo de texto para fala onde você insere um roteiro — é uma referência que guia a etapa de geração.
| Descrição escrita | Idade, timbre, peso, entrega — gerados a partir do roteiro junto com todo o resto do personagem, e interpretados pelo modelo de vídeo. |
|---|---|
| Predefinição correspondida | Uma voz escolhida de uma biblioteca de vozes do sistema, cada uma com uma amostra de áudio curta que você pode ouvir. Uma chamada de modelo propõe uma correspondência por personagem com base em gênero, idioma e idade; você pode corresponder de novo ou escolher outra manualmente. |
| Sua própria amostra | Envie um áudio para um personagem e ele se torna a referência de voz daquele personagem em todos os segmentos em que ele falar. |
O que estiver anexado é usado de forma consistente: o mesmo personagem fala com a mesma voz em todos os segmentos e todos os episódios, pelo mesmo motivo que o rosto dele permanece o mesmo — a referência viaja com ele.
Não há ferramenta aqui para clonar uma voz a partir de uma gravação de outra pessoa. Essa lacuna é proposital, não um item do roadmap: publicar uma performance sintética da voz de uma pessoa real é um problema de direito de imagem na maioria dos mercados em que atuamos, e um produto que faz isso com um clique é um produto que torna isso rotineiro. Nossa própria lista de verificação de conformidade trata a imagem — rosto e voz da mesma forma — como algo que você precisa ter direito de usar antes de publicar.
Duas coisas que decorrem disso, que vale a pena dizer claramente:
O idioma do diálogo é escolhido na Etapa 1 e se aplica a todo o projeto: as falas são escritas nesse idioma na etapa de análise, copiadas literalmente para o storyboard e interpretadas nele. Isso não é uma dublagem sobre um original em inglês — não existe um original em inglês. O elenco, os nomes e os cenários podem ser adaptados ao mercado correspondente ao mesmo tempo por meio da configuração de região alvo. Quinze idiomas são suportados, e os argumentos contra a dublagem explicam por que gerar a fala é melhor do que ajustar o tempo dela.
A correspondência de voz é uma chamada de modelo gratuita — ela não consome créditos e não conta contra o seu limite de tarefas simultâneas. Enviar sua própria amostra é gratuito. O áudio em si faz parte da geração de vídeo, que começa em 10 créditos por segundo de saída (≈ $0.06/s no plano menor preço por crédito); não há cobrança separada por palavra ou por personagem para a fala. Consulte a página de preços ou a visão geral do gerador para ver onde a voz se encaixa na execução.
O idioma do diálogo é definido uma vez na Etapa 1 e toda a execução é feita nele, com a configuração de região alvo adaptando nomes, rostos e ruas para esse mercado ao mesmo tempo. Cada amostra abaixo foi produzida dessa forma, uma por idioma.
Idiomas
Cada série abaixo foi produzida pelo mesmo fluxo, com o elenco falando o idioma de forma nativa: a interface, os documentos de trabalho e as falas estão todos no mesmo idioma, e nada é dublado. Abra uma para ouvir.
A Carta de LisboaPortuguêsNo seu idioma
윈터 프라미스한국어Diálogo nativo
El Secreto de CostaEspañolDiálogo nativo
浪人の誓い日本語Diálogo nativo
Ikrar JakartaBahasa IndonesiaDiálogo nativo
Зимняя коронаРусскийDiálogo nativo
L’Héritier du DéfiléFrançaisDiálogo nativo
Il Tavolo dell'OlivaItalianoDiálogo nativo
De Vuurtoren van de FjordNederlandsDiálogo nativo
العهد الصحراويالعربيةDiálogo nativo
Çantasındaki SözleşmeTürkçeDiálogo nativo
Die Istanbul-TäuschungDeutschDiálogo nativo
Останній сигналУкраїнськаDiálogo nativo
問劍青雲繁體中文Diálogo nativo
The Last EnvelopeEnglishDiálogo nativoNão. As vozes são correspondidas a partir de uma biblioteca de vozes predefinidas amostradas, ou fornecidas por você por meio de upload do seu próprio áudio. Não há caminho para reproduzir uma voz a partir de uma gravação de outra pessoa, e isso é intencional, não um recurso inacabado.
Não. Os modelos de vídeo geram imagem e áudio na mesma etapa, então a performance e o movimento da boca vêm de uma única geração. Esse também é o motivo pelo qual alterar uma fala significa regenerar aquele segmento em vez de reeditar uma faixa de áudio.
Sim. Envie uma amostra para um personagem e ela se torna a referência de voz daquele personagem em todos os segmentos em que ele falar.
O idioma do diálogo é uma configuração de nível de projeto, então sim dentro de um projeto — mas o idioma é escolhido independentemente do idioma em que você escreveu o roteiro e independentemente do idioma da sua interface. Um mesmo roteiro pode ser produzido para vários mercados executando-o com configurações diferentes.
Sim, pelo mesmo motivo que o rosto permanece: qualquer voz anexada a um personagem é anexada no nível do projeto e viaja para todos os segmentos em que aquele personagem fala.
Imagem e performance em uma única etapa, no idioma que o seu público fala.
Experimente o SceneMixer gratuitamentePacotes de créditos a partir de $1.49 · Pro $7.99/mês · Não precisa de cartão de crédito para começar
Preços·Guias·Amostras·Suporte·Privacidade·Termos·Aviso legal·Contato·© 2026 SceneMixer