SceneMixer
Português
Cadastre-se grátis

Personagens que falam

Vídeo de IA com personagens que falam

Atualizado em 20 de setembro de 2026

Resposta rápida: a fala é gerada junto com a imagem em um único passo, não é sincronia labial aplicada em um vídeo mudo. Cada tomada contém a fala na íntegra, o personagem que fala está vinculado a uma voz estável da biblioteca, com uma direção curta de interpretação e uma nota explícita de que todas as outras pessoas no quadro mantêm os lábios fechados. Tomadas com diálogo têm um tempo mínimo — três palavras por segundo em inglês — para que uma fala nunca seja espremida em uma tomada curta demais para ela.
Frame de “Comando Starfall”, um curta de drama com IA gerado de ponta a ponta pelo SceneMixer (7 personagens, 1 episódio)
Exemplo: “Comando Starfall” — HD Realista, 1 episódio, produzido de ponta a ponta pelo SceneMixer a partir do roteiro · assistir aos episódios

A voz sai da mesma geração que a imagem

Existem duas maneiras de fazer um personagem falar na tela. Uma é renderizar um vídeo mudo e depois mover a boca com uma faixa de áudio — o caminho da sincronia labial, que precisa de um recorte do rosto, um arquivo de áudio de referência, e produz um rosto que se move corretamente, mas um corpo que não atua. A outra é gerar imagem e som juntos, para que a atuação e a boca sejam uma única decisão.

Este fluxo usa a segunda opção. O nível padrão de vídeo é audiovisual: o modelo recebe a fala, quem a diz, como é dita e uma referência de voz, e retorna uma tomada com a fala já nela. Nada é costurado depois.

Visão geral

O que é enviado com uma tomada de fala
A falaLiteral, uma vez. Dita exatamente como escrita — sem paráfrases, sem reajuste de tempo.
Quem falaNomeado, e vinculado à referência de voz daquele personagem para que a mesma pessoa soe igual entre os episódios.
Como é ditaUma direção curta entre colchetes — baixinho, ainda sorrindo, forçando um tom neutro. É direção de atuação, não legenda.
Quem mais está no quadroMarcado com lábios fechados, para que quem ouve não mexa a boca junto.
Fala fora de quadroMarcada primeiro no colchete — voz over, ao telefone, pelo interfone — e depois todos os visíveis são descritos com a boca fechada.
TempoUma tomada com diálogo nunca é mais curta do que a fala precisa: três palavras por segundo em inglês, cinco caracteres por segundo em chinês.

Vozes são combinadas, não sintetizadas por personagem

Cada personagem recebe uma voz de uma biblioteca de vozes de sistema prontas — você ouve uma amostra de três a oito segundos antes de escolher, pode trocar a combinação, escolher outra no seletor ou enviar sua própria gravação. O motivo de combinar em vez de criar uma voz por personagem é custo e estabilidade: vozes criadas mudam entre gerações e têm custo por personagem, enquanto uma voz da biblioteca é a mesma voz no episódio um e no episódio doze.

Se um personagem não tiver voz atribuída, a tomada usa como apoio uma descrição escrita da voz — idade, textura, registro — que o modelo interpreta. Esse é o padrão para projetos novos; atribuir vozes é um passo deliberado, não algo que acontece silenciosamente com cada personagem.

A regra de tempo e por que ela existe

Uma tomada de quatro segundos não consegue conter dezesseis palavras em inglês. Ou a fala fica acelerada até ficar ininteligível ou a linha é cortada. Por isso tomadas de diálogo têm um piso derivado da fala: contagem de palavras dividida por três para inglês, contagem de caracteres dividida por cinco para chinês, e falas curtas ganham uma pausa extra em vez de serem espremidas até o mínimo teórico. Tomadas que voltam curtas demais para a fala são sinalizadas e corrigidas antes de qualquer renderização — o que é mais barato do que descobrir o problema no resultado final.

Idioma

O idioma do diálogo é uma configuração do projeto, escolhida uma vez, e aplicada onde as falas são escritas pela primeira vez, em vez de ser traduzido depois — assim a atuação é criada naquele idioma, em vez de ser uma dublagem. Quinze idiomas de interface estão disponíveis e o diálogo tem suporte em todos eles; alguns idiomas ocasionalmente pronunciam mal palavras individuais no nível padrão do modelo, e o seletor avisa quando isso acontece. A página de vozes de personagens cobre isso em detalhes.

O que ele não faz

Quanto custa

A fala está incluída no preço do vídeo — não há cobrança separada de áudio. O vídeo começa em 10 credits por segundo de saída (≈ $0.06/s no menor preço por crédito) e chega a $0.47/s no nível mais nítido; a montagem custa 1 crédito por segundo. A combinação de voz da biblioteca não custa nada. Contas novas recebem 50 credits e uma prévia gratuita de até 5 segundos — o suficiente para ouvir um personagem falar antes de decidir. As tarifas estão na página de preços.

Idiomas

Diálogos nativos em 15 idiomas

Cada série abaixo foi produzida pelo mesmo fluxo, com o elenco falando o idioma de forma nativa: a interface, os documentos de trabalho e as falas estão todos no mesmo idioma, e nada é dublado. Abra uma para ouvir.

Ver todos os 15 idiomas

Perguntas frequentes

Isso é sincronia labial?

Não. Imagem e fala são geradas juntas em um único passo, então a boca e a atuação são a mesma decisão. Não há uma faixa de áudio separada sendo combinada com uma renderização muda, e não há forma de controlar uma foto ou um vídeo enviado.

Posso usar minha própria voz?

Você pode enviar uma gravação como referência de voz de um personagem. Clonar a voz de outra pessoa não é oferecido.

Quem está ouvindo na tomada mexe a boca?

Não deveria — cada personagem que não está falando no quadro é explicitamente marcado com lábios fechados, que é a instrução que impede quem ouve de mexer a boca junto com a fala.

O que acontece com voz over e chamadas telefônicas?

O marcador de fora de quadro é escrito primeiro na nota de interpretação, e depois todos os visíveis na tomada são descritos com a boca fechada — então a fala é ouvida sem que ninguém pareça estar dizendo ela.

Por que minha tomada de diálogo ficou mais longa do que eu escrevi?

Porque a fala precisa daquele tempo. Tomadas com diálogo têm um piso de cerca de três palavras por segundo em inglês, cinco caracteres por segundo em chinês, com uma pausa adicionada para falas muito curtas. Uma tomada curta demais para a fala é corrigida antes da renderização, não depois.

Ouça um personagem antes de finalizar um episódio

A prévia gratuita é longa o suficiente para uma linha de diálogo.

Experimente o SceneMixer gratuitamente

Pacotes de créditos a partir de $1.49 · Pro $7.99/mês · Não precisa de cartão de crédito para começar

Preços·Guias·Amostras·Suporte·Privacidade·Termos·Aviso legal·Contato·© 2026 SceneMixer