Voix de personnages IA
Mis à jour le 16 septembre 2026

La plupart des flux de production vidéo IA traitent l'audio comme une étape à part : générer des séquences muettes, synthétiser les répliques, puis lutter pour synchroniser les lèvres. Les modèles vidéo utilisés ici génèrent l'audio et l'image en une seule passe, ce qui élimine ce problème mais change la nature du « paramètre de voix ». Ce n'est pas un moteur de synthèse vocale dans lequel vous injectez un script — c'est une référence sur laquelle la passe de génération se base.
| Description écrite | Âge, timbre, ampleur, interprétation — générés à partir du script en même temps que tout le reste du personnage, et interprétés par le modèle vidéo. |
|---|---|
| Préréglage correspondant | Une voix choisie dans une bibliothèque de voix système, chacune accompagnée d'un court échantillon audio que vous pouvez écouter. Un appel au modèle propose une correspondance par personnage selon le genre, la langue et l'âge ; vous pouvez relancer la correspondance ou choisir une autre voix manuellement. |
| Votre propre échantillon | Importez un fichier audio pour un personnage et il devient la référence vocale de ce personnage pour tous les segments où il parle. |
Quelle que soit la méthode choisie, la voix est utilisée de manière cohérente : le même personnage parle avec la même voix dans tous les segments et tous les épisodes, pour la même raison que son visage reste identique — la référence l'accompagne partout.
Il n'existe aucun outil ici pour cloner une voix à partir d'un enregistrement de quelqu'un d'autre. C'est une absence délibérée, pas une fonctionnalité prévue sur la feuille de route : publier une interprétation synthétique de la voix d'une personne réelle pose un problème de droit à l'image dans la plupart des marchés que nous desservons, et un produit qui permet de le faire en un clic est un produit qui banalise cette pratique. Notre propre liste de contrôle de conformité considère l'image et la voix d'une personne comme des éléments que vous devez avoir le droit d'utiliser avant toute publication.
Deux conséquences qui méritent d'être dites clairement :
La langue des dialogues est choisie à l'étape 1 et s'applique à l'ensemble du projet : les répliques sont écrites dans cette langue lors de l'étape d'analyse, copiées à l'identique dans le storyboard, et interprétées dans cette langue. Il ne s'agit pas d'un doublage sur un original en anglais — il n'existe pas d'original en anglais. Les personnages, les noms et les décors peuvent être adaptés au marché cible en même temps via le paramètre de région cible. Quinze langues sont prises en charge, et l'argument contre le doublage explique pourquoi générer la réplique est préférable à en réajuster le timing.
La correspondance vocale est un appel au modèle gratuit — elle ne consomme pas de crédits et ne compte pas dans votre limite de tâches simultanées. L'import de votre propre échantillon est gratuit. L'audio lui-même fait partie de la génération vidéo, qui commence à 10 crédits par seconde de sortie (soit environ $0.06/s avec l'offre prix du crédit le plus bas) ; il n'y a pas de frais séparés par mot ou par personnage pour la parole. Consultez la page des tarifs, ou la présentation du générateur pour savoir où se situe la voix dans le processus de génération.
La langue des dialogues est définie une seule fois à l'étape 1 et l'ensemble de la production est interprété dans cette langue, le paramètre de région cible adaptant en même temps les noms, les visages et les décors à ce marché. Chaque échantillon ci-dessous a été produit de cette manière, un par langue.
Langues
Chaque série ci-dessous a été produite par le même pipeline, avec des personnages parlant la langue de manière native : l'interface, les documents de travail et les répliques sont tous dans la même langue, et rien n'est doublé. Ouvrez-en une pour écouter.
A Carta de LisboaPortuguêsDialogues natifs
윈터 프라미스한국어Dialogues natifs
El Secreto de CostaEspañolDialogues natifs
浪人の誓い日本語Dialogues natifs
Ikrar JakartaBahasa IndonesiaDialogues natifs
Зимняя коронаРусскийDialogues natifs
L’Héritier du DéfiléFrançaisDans votre langue
Il Tavolo dell'OlivaItalianoDialogues natifs
De Vuurtoren van de FjordNederlandsDialogues natifs
العهد الصحراويالعربيةDialogues natifs
Çantasındaki SözleşmeTürkçeDialogues natifs
Die Istanbul-TäuschungDeutschDialogues natifs
Останній сигналУкраїнськаDialogues natifs
問劍青雲繁體中文Dialogues natifs
The Last EnvelopeEnglishDialogues natifsNon. Les voix sont soit associées à partir d'une bibliothèque de voix prédéfinies échantillonnées, soit fournies par vous via l'import de votre propre audio. Il n'existe aucun moyen de reproduire une voix à partir d'un enregistrement de quelqu'un d'autre, et c'est un choix délibéré, pas une fonctionnalité manquante.
Non. Les modèles vidéo génèrent l'image et l'audio au cours de la même passe, de sorte que l'interprétation et le mouvement de la bouche proviennent d'une seule génération. C'est aussi pourquoi modifier une réplique implique de régénérer ce segment plutôt que de remonter une piste audio.
Oui. Importez un échantillon pour un personnage et il devient la référence vocale de ce personnage pour tous les segments où il parle.
La langue des dialogues est un paramètre au niveau du projet, donc oui au sein d'un même projet — mais la langue est choisie indépendamment de la langue dans laquelle vous avez écrit le script, et indépendamment de la langue de votre interface. Un même script peut être produit pour plusieurs marchés en l'exécutant avec des paramètres différents.
Oui, pour la même raison que le visage : quelle que soit la voix attribuée à un personnage, elle est définie au niveau du projet et est utilisée dans tous les segments où ce personnage parle.
Image et interprétation en une seule passe, dans la langue que parle votre public.
Essayer SceneMixer gratuitementForfaits de crédits à partir de $1.49 · Pro $7.99/mois · Aucune carte bancaire requise pour commencer
Tarifs·Guides·Exemples·Assistance·Confidentialité·Conditions·Mentions légales·Contact·© 2026 SceneMixer