Personagens que falam
Atualizado em 20 de setembro de 2026

Existem duas maneiras de fazer um personagem falar na tela. Uma é renderizar um vídeo mudo e depois mover a boca com uma faixa de áudio — o caminho da sincronia labial, que precisa de um recorte do rosto, um arquivo de áudio de referência, e produz um rosto que se move corretamente, mas um corpo que não atua. A outra é gerar imagem e som juntos, para que a atuação e a boca sejam uma única decisão.
Este fluxo usa a segunda opção. O nível padrão de vídeo é audiovisual: o modelo recebe a fala, quem a diz, como é dita e uma referência de voz, e retorna uma tomada com a fala já nela. Nada é costurado depois.
| A fala | Literal, uma vez. Dita exatamente como escrita — sem paráfrases, sem reajuste de tempo. |
|---|---|
| Quem fala | Nomeado, e vinculado à referência de voz daquele personagem para que a mesma pessoa soe igual entre os episódios. |
| Como é dita | Uma direção curta entre colchetes — baixinho, ainda sorrindo, forçando um tom neutro. É direção de atuação, não legenda. |
| Quem mais está no quadro | Marcado com lábios fechados, para que quem ouve não mexa a boca junto. |
| Fala fora de quadro | Marcada primeiro no colchete — voz over, ao telefone, pelo interfone — e depois todos os visíveis são descritos com a boca fechada. |
| Tempo | Uma tomada com diálogo nunca é mais curta do que a fala precisa: três palavras por segundo em inglês, cinco caracteres por segundo em chinês. |
Cada personagem recebe uma voz de uma biblioteca de vozes de sistema prontas — você ouve uma amostra de três a oito segundos antes de escolher, pode trocar a combinação, escolher outra no seletor ou enviar sua própria gravação. O motivo de combinar em vez de criar uma voz por personagem é custo e estabilidade: vozes criadas mudam entre gerações e têm custo por personagem, enquanto uma voz da biblioteca é a mesma voz no episódio um e no episódio doze.
Se um personagem não tiver voz atribuída, a tomada usa como apoio uma descrição escrita da voz — idade, textura, registro — que o modelo interpreta. Esse é o padrão para projetos novos; atribuir vozes é um passo deliberado, não algo que acontece silenciosamente com cada personagem.
Uma tomada de quatro segundos não consegue conter dezesseis palavras em inglês. Ou a fala fica acelerada até ficar ininteligível ou a linha é cortada. Por isso tomadas de diálogo têm um piso derivado da fala: contagem de palavras dividida por três para inglês, contagem de caracteres dividida por cinco para chinês, e falas curtas ganham uma pausa extra em vez de serem espremidas até o mínimo teórico. Tomadas que voltam curtas demais para a fala são sinalizadas e corrigidas antes de qualquer renderização — o que é mais barato do que descobrir o problema no resultado final.
O idioma do diálogo é uma configuração do projeto, escolhida uma vez, e aplicada onde as falas são escritas pela primeira vez, em vez de ser traduzido depois — assim a atuação é criada naquele idioma, em vez de ser uma dublagem. Quinze idiomas de interface estão disponíveis e o diálogo tem suporte em todos eles; alguns idiomas ocasionalmente pronunciam mal palavras individuais no nível padrão do modelo, e o seletor avisa quando isso acontece. A página de vozes de personagens cobre isso em detalhes.
A fala está incluída no preço do vídeo — não há cobrança separada de áudio. O vídeo começa em 10 credits por segundo de saída (≈ $0.06/s no menor preço por crédito) e chega a $0.47/s no nível mais nítido; a montagem custa 1 crédito por segundo. A combinação de voz da biblioteca não custa nada. Contas novas recebem 50 credits e uma prévia gratuita de até 5 segundos — o suficiente para ouvir um personagem falar antes de decidir. As tarifas estão na página de preços.
Idiomas
Cada série abaixo foi produzida pelo mesmo fluxo, com o elenco falando o idioma de forma nativa: a interface, os documentos de trabalho e as falas estão todos no mesmo idioma, e nada é dublado. Abra uma para ouvir.
A Carta de LisboaPortuguêsNo seu idioma
윈터 프라미스한국어Diálogo nativo
El Secreto de CostaEspañolDiálogo nativo
浪人の誓い日本語Diálogo nativo
Ikrar JakartaBahasa IndonesiaDiálogo nativo
Зимняя коронаРусскийDiálogo nativo
L’Héritier du DéfiléFrançaisDiálogo nativo
Il Tavolo dell'OlivaItalianoDiálogo nativo
De Vuurtoren van de FjordNederlandsDiálogo nativo
العهد الصحراويالعربيةDiálogo nativo
Çantasındaki SözleşmeTürkçeDiálogo nativo
Die Istanbul-TäuschungDeutschDiálogo nativo
Останній сигналУкраїнськаDiálogo nativo
問劍青雲繁體中文Diálogo nativo
The Last EnvelopeEnglishDiálogo nativoNão. Imagem e fala são geradas juntas em um único passo, então a boca e a atuação são a mesma decisão. Não há uma faixa de áudio separada sendo combinada com uma renderização muda, e não há forma de controlar uma foto ou um vídeo enviado.
Você pode enviar uma gravação como referência de voz de um personagem. Clonar a voz de outra pessoa não é oferecido.
Não deveria — cada personagem que não está falando no quadro é explicitamente marcado com lábios fechados, que é a instrução que impede quem ouve de mexer a boca junto com a fala.
O marcador de fora de quadro é escrito primeiro na nota de interpretação, e depois todos os visíveis na tomada são descritos com a boca fechada — então a fala é ouvida sem que ninguém pareça estar dizendo ela.
Porque a fala precisa daquele tempo. Tomadas com diálogo têm um piso de cerca de três palavras por segundo em inglês, cinco caracteres por segundo em chinês, com uma pausa adicionada para falas muito curtas. Uma tomada curta demais para a fala é corrigida antes da renderização, não depois.
A prévia gratuita é longa o suficiente para uma linha de diálogo.
Experimente o SceneMixer gratuitamentePacotes de créditos a partir de $1.49 · Pro $7.99/mês · Não precisa de cartão de crédito para começar
Preços·Guias·Amostras·Suporte·Privacidade·Termos·Aviso legal·Contato·© 2026 SceneMixer