Gerador de vídeos de anúncio com IA
Atualizado em 20 de setembro de 2026

| Você envia | Até quatro fotos do mesmo item — um produto, um prato, uma peça de roupa, um carro, uma fachada de loja ou um imóvel, ou uma captura de tela do seu app ou site. Ângulos e detalhes diferentes de uma mesma coisa, não quatro coisas diferentes. |
|---|---|
| Você escreve | Opcional. Uma frase sobre o que você está vendendo ajuda, e quando a foto e a frase discordam, a frase prevalece. |
| Duração | 15, 30 ou 60 segundos — um, dois ou quatro segmentos gerados. |
| Proporção e resolução | 16:9 ou 9:16; 480P, 720P ou 1080P. |
| Tom | Oito fórmulas: Épico, Engraçado, Acolhedor, Minimalista, Reviravolta, Close-ups de dar água na boca, Mostre como funciona, Um dia na vida. |
| Ele escreve | Um roteiro criativo com duas a quatro falas, elenco, cenários, storyboard, o vídeo gerado e um cartão final com sua marca, nome do produto, slogan e chamada para ação. |
| Som | Fala, ambiente e música são gerados junto com a imagem. Nenhuma faixa de biblioteca é adicionada depois. |
| Preço | Um valor orçado antes de você começar, e esse valor é o teto — você paga apenas pelas etapas que realmente rodaram, nunca mais do que o orçamento. |
Aperte o botão sem digitar nada e a primeira coisa que acontece é de graça: a foto é analisada, e você recebe o resultado — se o item é reconhecível, em qual categoria ele se encaixa, um nome de produto, uma descrição, os pontos de venda que valem a pena filmar, um tom sugerido e qualquer nome de marca legível na embalagem ou na sinalização, transcrito exatamente como está impresso, sem adivinhações. Se a leitura falhar, você descobre na hora, sem custo, com um botão para trocar a foto.
Duas coisas que essa leitura decide, e são os únicos motivos pelos quais a categoria importa:
Fotos de lojas e restaurantes quase sempre têm clientes e funcionários. Em vez de recusá-las, o processo remove as pessoas primeiro e mantém a sinalização, os móveis e a iluminação — porque um modelo de vídeo que recebe uma imagem de referência copia os rostos dela quase literalmente, e você não tem permissão para usar esses rostos em um anúncio. Capturas de tela são o único caso recusado: editar uma captura de tela deixa a interface borrada.
| Deixar com a IA | Um preço fechado cobre todo o processo — limpeza, roteiro, elenco, storyboard, vídeo e a versão final. Uma página de progresso mostra cada etapa, e você pode cancelar antes que a etapa de vídeo comece. Esse é o modo padrão. |
|---|---|
| Assumir o controle | Você paga pela limpeza e pelo roteiro escrito, depois cai no editor normal com o anúncio já montado: reescreva o roteiro, troque o elenco, edite qualquer plano, regenere um único segmento e faça a composição quando estiver satisfeito. Cada etapa posterior é cobrada como uma geração comum. |
Por baixo, um anúncio é um projeto comum do SceneMixer com o tipo de conteúdo definido como publicidade — a mesma análise de roteiro, a mesma arte de referência, a mesma lista de planos, a mesma renderização por segmento descrita na página de curtas dramáticos. O que é específico dos anúncios é o briefing criativo, a estrutura mais curta, o cartão final e o filtro de conformidade.
O modelo de vídeo usado para segmentos de anúncio produz som e imagem em uma única passada, então ele já entrega diálogo, som ambiente e, muitas vezes, uma trilha que combina com o que está na tela. Colocar uma faixa de biblioteca por cima disso faz com que as duas músicas briguem. Em vez disso, o briefing traz uma descrição escrita da música — instrumentação, andamento, ritmo, onde ela deve crescer — e a mesma descrição vai para todos os segmentos do mesmo anúncio, porque cada segmento é uma geração independente, sem memória dos outros. Descrições iguais são a única coisa que mantém a trilha coesa ao longo da edição.
O cartão final é silencioso por padrão, com o áudio do corpo do vídeo diminuindo até ele. Apenas três coisas são adicionadas depois da geração: o cartão final, um ajuste de volume e o selo AIGC.
Você vê um valor único antes de confirmar, e ele é calculado com as mesmas tarifas usadas no restante da plataforma: ler a foto é grátis, a limpeza ou o redesenho conta como uma imagem, o roteiro conta como uma chamada de modelo, as artes de referência são cobradas por imagem com 15 grátis por conta e 7 créditos cada uma depois disso, o vídeo custa 10 créditos por segundo de saída na faixa de 480P (≈ $0.06/s no menor preço por crédito) e mais nas faixas de maior resolução, e a montagem custa 1 crédito por segundo. O orçamento é um teto, não um depósito: as etapas são cobradas conforme são executadas, e um anúncio de 15 segundos que precisou de menos imagens de referência do que o estimado simplesmente custa menos. Se uma etapa falhar, a execução para ali em vez de gastar o restante do orçamento, e você pode repetir essa etapa sem precisar refazer as anteriores. Contas novas começam com 50 créditos; os pacotes começam em $1.49. A página de preços tem a tabela completa.
As falas, o cartão final e o elenco seguem o idioma da sua interface, e o mercado se adapta a ele — nomes, rostos e ruas se ajustam ao local onde o anúncio deve ser veiculado. É o mesmo motor de diálogo usado para produzir as séries abaixo, um por idioma.
Idiomas
Cada série abaixo foi produzida pelo mesmo fluxo, com o elenco falando o idioma de forma nativa: a interface, os documentos de trabalho e as falas estão todos no mesmo idioma, e nada é dublado. Abra uma para ouvir.
A Carta de LisboaPortuguêsNo seu idioma
윈터 프라미스한국어Diálogo nativo
El Secreto de CostaEspañolDiálogo nativo
浪人の誓い日本語Diálogo nativo
Ikrar JakartaBahasa IndonesiaDiálogo nativo
Зимняя коронаРусскийDiálogo nativo
L’Héritier du DéfiléFrançaisDiálogo nativo
Il Tavolo dell'OlivaItalianoDiálogo nativo
De Vuurtoren van de FjordNederlandsDiálogo nativo
العهد الصحراويالعربيةDiálogo nativo
Çantasındaki SözleşmeTürkçeDiálogo nativo
Die Istanbul-TäuschungDeutschDiálogo nativo
Останній сигналУкраїнськаDiálogo nativo
問劍青雲繁體中文Diálogo nativo
The Last EnvelopeEnglishDiálogo nativoNão. O mínimo é uma foto. Uma frase sobre o que você está vendendo melhora o resultado e resolve qualquer ambiguidade na foto — “nossa loja” ao lado de uma imagem de um balcão é a diferença entre um anúncio sobre um estabelecimento e um anúncio sobre uma máquina de café. Tudo o que vem depois, incluindo as falas, é escrito para você e pode ser reescrito no modo avançado.
Até quatro, e elas devem mostrar o mesmo assunto de ângulos diferentes ou com detalhes diferentes — a primeira é tratada como a principal e é a base para qualquer redesenho e para o cartão final. Fotos extras de um estabelecimento se tornam chapas de locação adicionais, então o anúncio se passa no seu espaço real, em vez de uma aproximação gerada dele.
Elas são removidas antes que a foto seja usada como referência, enquanto a sinalização, os equipamentos e a iluminação são mantidos. Isso não é por delicadeza: os modelos de vídeo copiam as imagens de referência quase literalmente, então um cliente na foto da sua loja acabaria aparecendo no seu anúncio.
No cartão final, sim, junto com o nome do produto, o slogan e a chamada para ação, no idioma do anúncio. Dentro das cenas geradas, não — os modelos de vídeo de IA não conseguem escrever com confiabilidade, então o anúncio é feito sem texto na tela em vez de arriscar errar.
As falas e o cartão final seguem o idioma da sua interface em quinze idiomas de diálogo, com elenco e cenário adaptados a esse mercado. O cartão final usa um idioma que consegue ser diagramado quando o roteiro precisa de ajustes ou de layout da direita para a esquerda.
Sim, até que a etapa de vídeo comece — esse é o ponto em que as chamadas caras começam, e é onde o botão de cancelar deixa de funcionar. Se uma etapa falhar, a execução para ali, os créditos dela são devolvidos e você pode repetir essa etapa sem refazer as anteriores.
Leia a foto de graça, veja o orçamento e depois decida.
Experimente o SceneMixer grátisPacotes de créditos a partir de $1.49 · Pro $7.99/mês · Não precisa de cartão de crédito para começar
Preços·Guias·Amostras·Suporte·Privacidade·Termos·Aviso legal·Contato·© 2026 SceneMixer