Gerador de diálogos por IA
Atualizado em 20 de setembro de 2026

A maioria das ferramentas que falam em “diálogo por IA” se refere a legendas: texto que você cola sobre um clipe. Aqui, a fala é pronunciada. O modelo de vídeo gera imagem e áudio em uma única etapa, então a boca do personagem forma aquela frase, naquele idioma, com aquele ritmo — não há um arquivo de voz separado colado depois, nem uma etapa de sincronia labial que pode dar errado.
Isso tem uma consequência que vale a pena entender antes de você escrever qualquer coisa: o tamanho de uma fala define a duração de um plano. Diga a frase em voz alta e cronometre, porque é exatamente isso que o fluxo de produção faz.
| Escrito por | A análise do roteiro escreve as falas no esboço de cada episódio; depois, a lista de planos as atribui a planos específicos, com um personagem e uma nota de interpretação. |
|---|---|
| Idioma | Escolhido uma vez por projeto, antes da análise. São quinze opções. O elenco fala nesse idioma; a interface e os documentos de trabalho seguem o seu próprio idioma de forma independente. |
| Notas de interpretação | Uma observação curta entre parênteses por fala — como a frase é dita, não o que é dito. Ela chega ao modelo de vídeo como direção de atuação. |
| Falas fora de cena | Marcadas explicitamente: voz over, narração, voz interior, voz ao telefone. As falas marcadas não fazem a boca de ninguém se mover na tela. |
| Duração do plano | Derivada da fala. O inglês é cronometrado a três palavras por segundo; o chinês, a cinco caracteres por segundo. Uma fala curta ainda recebe uma duração mínima para que o plano não pareça cortado. |
| Vozes | Selecionadas em uma biblioteca de vozes predefinida, ou você envia uma amostra para um personagem. Não há clonagem de voz de pessoas para as quais você não tenha autorização. |
| Edição | Gratuita. Reescreva qualquer fala na lista de planos; apenas os segmentos que você alterou são renderizados novamente. |
Uma fala de dezoito palavras em inglês precisa de cerca de seis segundos de tela. Se você pedir a um modelo de vídeo um plano de quatro segundos com dezoito palavras, uma de duas coisas acontece: a fala fica acelerada até virar um amontoado sem sentido, ou o modelo simplesmente descarta a segunda metade da frase. Nenhuma dessas falas avisa que aconteceu — você só percebe quando assiste à edição.
Por isso, a lista de planos calcula a duração mínima a partir da própria fala e insere esse valor no plano. Se a soma dos planos de um segmento ultrapassar o que o segmento comporta, o segmento é dividido em um limite entre planos, em vez de ser comprimido. Você pode alterar qualquer duração manualmente; o cálculo existe para que o padrão nunca erre de um jeito que estrague uma tomada.
Cada fala traz uma nota curta entre colchetes — do tipo que um diretor fala em uma reunião, não um advérbio de romancista. “Seco, já decidido.” “Tentando não olhar para a porta.” Essas notas chegam ao modelo como instrução de atuação e mudam a leitura de forma perceptível. O fluxo aplica duas regras para que elas continuem úteis:
Quando o modelo retorna falas sem notas — o que acontece de forma imprevisível —, uma etapa pequena e separada preenche apenas as que faltam, sem mexer nas falas em si.
O idioma do diálogo é uma configuração do projeto, não de cada fala, e é escolhido antes da análise porque ele muda o que é escrito, não apenas como é renderizado. Um romance web chinês com diálogo em inglês gera falas em inglês com ritmo de inglês — não frases chinesas traduzidas. Nomes e cenários se adaptam se você também definir uma região alvo.
O que não muda é o preço: um segmento custa os mesmos credits em qualquer idioma, e os documentos de trabalho que você lê são traduzidos gratuitamente. Os detalhes estão em o guia de idioma de diálogo; diálogo nativo vs dublagem explica por que isso não é uma etapa de dublagem.
O diálogo não é um item separado na cobrança — ele é escrito pelas duas etapas pagas que você já executa. A análise de roteiro custa 4 credits por 3,333 caracteres de texto em inglês; a lista de planos de cada episódio custa 1 credit por 333 caracteres daquele episódio. Reescrever uma fala é gratuito; renderizar novamente o segmento que a contém custa o valor do vídeo do segmento, a partir de 10 credits por segundo (≈ $0.06/s no plano menor preço por crédito). A correspondência de voz não custa nada. Contas novas começam com 50 credits e uma prévia gratuita de até 5 segundos — o suficiente para ouvir uma fala interpretada antes de pagar por qualquer coisa. A tabela completa está na página de preços.
Idiomas
Cada série abaixo foi produzida pelo mesmo fluxo, com o elenco falando o idioma de forma nativa: a interface, os documentos de trabalho e as falas estão todos no mesmo idioma, e nada é dublado. Abra uma para ouvir.
A Carta de LisboaPortuguêsNo seu idioma
윈터 프라미스한국어Diálogo nativo
El Secreto de CostaEspañolDiálogo nativo
浪人の誓い日本語Diálogo nativo
Ikrar JakartaBahasa IndonesiaDiálogo nativo
Зимняя коронаРусскийDiálogo nativo
L’Héritier du DéfiléFrançaisDiálogo nativo
Il Tavolo dell'OlivaItalianoDiálogo nativo
De Vuurtoren van de FjordNederlandsDiálogo nativo
العهد الصحراويالعربيةDiálogo nativo
Çantasındaki SözleşmeTürkçeDiálogo nativo
Die Istanbul-TäuschungDeutschDiálogo nativo
Останній сигналУкраїнськаDiálogo nativo
問劍青雲繁體中文Diálogo nativo
The Last EnvelopeEnglishDiálogo nativoSim. A lista de planos é texto editável — substitua qualquer linha pela sua e apenas aquele segmento é rerenderizado. As pessoas também colam um roteiro pronto; nesse caso, a análise aproveita as linhas existentes em vez de inventar novas.
Com a nota de interpretação entre colchetes ao lado dela. Mantenha curta e focada no modo, não no sentido: “baixo, sem perguntar” muda a leitura; “ela diz que está indo embora” não muda, porque a fala já diz isso.
Sim — a voz é uma propriedade do personagem no projeto, combinada uma vez e reutilizada, da mesma forma que o rosto. Se você enviar sua própria amostra para um personagem, esse envio é uma escolha persistente e não é sobrescrito por combinações posteriores.
Ele vira uma fala marcada — voz interior ou narração —, de forma que é ouvida enquanto a imagem mostra algo que vale a pena assistir, em vez de virar um plano de alguém pensando.
Sim, e esse é o caso comum: a interface e os documentos de trabalho seguem o seu idioma; as falas seguem a configuração do projeto. Um produtor que fala inglês pode lançar uma série em coreano e ainda ler todos os documentos em inglês.
Uma prévia gratuita renderiza o plano de abertura do seu próprio episódio, já interpretado.
Experimente o SceneMixer grátisPacotes de créditos a partir de $1.49 · Pro $7.99/mês · Não precisa de cartão de crédito para começar
Preços·Guias·Amostras·Suporte·Privacidade·Termos·Aviso legal·Contato·© 2026 SceneMixer