Personnages qui parlent
Mis à jour le 20 septembre 2026

Il y a deux façons de faire parler un personnage à l’écran. La première consiste à rendre une vidéo muette puis à animer la bouche avec une piste audio : c’est la voie du lip-sync, qui nécessite un recadrage du visage et un fichier audio de pilotage, et qui produit un visage qui bouge correctement mais un corps qui ne joue pas. La seconde consiste à générer l’image et le son ensemble, pour que le jeu et la bouche relèvent d’une seule et même décision.
Ce pipeline utilise la seconde méthode. Le niveau vidéo par défaut est audiovisuel : le modèle reçoit la réplique, qui la dit, comment elle est dite, et une référence vocale, puis renvoie un plan où la réplique est prononcée. Rien n’est assemblé après coup.
| La réplique | Mot pour mot, une seule fois. Prononcée exactement comme écrite — ni paraphrasée, ni recalée temporellement. |
|---|---|
| Qui parle | Nommé, et lié à la référence vocale de ce personnage pour que la même personne ait la même voix d’un épisode à l’autre. |
| Comment c’est dit | Une courte indication entre crochets — à voix basse, toujours en souriant, d’un ton plat et forcé. Une indication de jeu, pas un sous-titre. |
| Qui d’autre est dans le champ | Marqué lèvres fermées, pour que les auditeurs ne remuent pas la bouche en même temps. |
| Paroles hors champ | Indiquées d’abord entre crochets — voix off, au téléphone, par l’interphone — puis toutes les personnes visibles sont décrites la bouche fermée. |
| Rythme | Un plan contenant un dialogue n’est jamais plus court que ce que la réplique nécessite : trois mots par seconde en anglais, cinq caractères par seconde en chinois. |
Chaque personnage se voit attribuer une voix issue d’une bibliothèque de voix système préconçues — vous écoutez un échantillon de trois à huit secondes avant de choisir, pouvez réassocier, choisir une autre voix dans le sélecteur, ou importer votre propre enregistrement. La raison pour laquelle il s’agit d’association plutôt que de création de voix par personnage, c’est le coût et la stabilité : les voix créées dérivent d’une génération à l’autre et coûtent par personnage, tandis qu’une voix de bibliothèque reste identique du premier au douzième épisode.
Si un personnage n’a pas de voix attribuée, le plan utilise par défaut une description écrite de la voix — âge, texture, registre — que le modèle interprète. C’est le comportement par défaut pour les nouveaux projets ; l’attribution des voix est une étape délibérée, pas quelque chose qui se fait silencieusement pour chaque personnage.
Un plan de quatre secondes ne peut pas contenir seize mots en anglais. Soit le débit est précipité au point d’être inintelligible, soit la réplique est coupée. Les plans de dialogue ont donc une durée minimale calculée à partir de la réplique : nombre de mots divisé par trois pour l’anglais, nombre de caractères divisé par cinq pour le chinois, et les répliques courtes reçoivent une pause en plus au lieu d’être compressées à leur minimum théorique. Les plans qui reviennent trop courts pour leur réplique sont signalés et corrigés avant tout rendu — ce qui coûte moins cher que de le découvrir à la sortie.
La langue des dialogues est un paramètre de projet, choisi une fois, et elle est appliquée là où les répliques sont écrites initialement plutôt que traduite après coup — le jeu est donc conçu dans cette langue au lieu d’être un doublage. Quinze langues d’interface sont disponibles et les dialogues sont pris en charge dans toutes ces langues ; quelques langues présentent occasionnellement des erreurs de prononciation sur certains mots avec le niveau de modèle par défaut, et le sélecteur l’indique quand c’est le cas. La page des voix de personnages couvre ce point en détail.
La parole est incluse dans le prix de la vidéo — il n’y a pas de frais audio séparés. La vidéo commence à 10 crédits par seconde de sortie (≈ $0.06/s avec le prix du crédit le plus bas) et va jusqu’à $0.47/s sur le niveau le plus net ; l’assemblage coûte 1 crédit par seconde. L’association vocale depuis la bibliothèque est gratuite. Les nouveaux comptes reçoivent 50 crédits et un aperçu gratuit d’au plus 5 secondes — de quoi entendre un personnage parler avant de se décider. Les tarifs sont sur la page des tarifs.
Langues
Chaque série ci-dessous a été produite par le même pipeline, avec des personnages parlant la langue de manière native : l'interface, les documents de travail et les répliques sont tous dans la même langue, et rien n'est doublé. Ouvrez-en une pour écouter.
A Carta de LisboaPortuguêsDialogues natifs
윈터 프라미스한국어Dialogues natifs
El Secreto de CostaEspañolDialogues natifs
浪人の誓い日本語Dialogues natifs
Ikrar JakartaBahasa IndonesiaDialogues natifs
Зимняя коронаРусскийDialogues natifs
L’Héritier du DéfiléFrançaisDans votre langue
Il Tavolo dell'OlivaItalianoDialogues natifs
De Vuurtoren van de FjordNederlandsDialogues natifs
العهد الصحراويالعربيةDialogues natifs
Çantasındaki SözleşmeTürkçeDialogues natifs
Die Istanbul-TäuschungDeutschDialogues natifs
Останній сигналУкраїнськаDialogues natifs
問劍青雲繁體中文Dialogues natifs
The Last EnvelopeEnglishDialogues natifsNon. L’image et la parole sont générées ensemble en une seule passe, donc la bouche et le jeu relèvent de la même décision. Il n’y a pas de piste audio séparée calée sur un rendu muet, et aucun moyen de piloter une photo ou une vidéo importée.
Vous pouvez importer un enregistrement comme référence vocale d’un personnage. Cloner la voix de quelqu’un d’autre n’est pas proposé.
Ils ne devraient pas — chaque personnage qui ne parle pas dans le champ est explicitement marqué lèvres fermées, ce qui est l’instruction qui empêche un auditeur de remuer la bouche en même temps que la réplique.
Le marqueur hors champ est écrit en premier dans la note de jeu, puis toutes les personnes visibles dans le plan sont décrites la bouche fermée — la réplique s’entend donc sans que personne ne paraisse la dire.
Parce que la réplique a besoin de ce temps. Les plans contenant un dialogue ont une durée minimale d’environ trois mots par seconde en anglais, cinq caractères par seconde en chinois, avec une pause ajoutée pour les répliques très courtes. Un plan trop court pour sa réplique est corrigé avant le rendu, pas après.
L’aperçu gratuit est assez long pour une réplique de dialogue.
Essayez SceneMixer gratuitementForfaits de crédits à partir de $1.49 · Pro $7.99/mois · Aucune carte bancaire requise pour commencer
Tarifs·Guides·Exemples·Assistance·Confidentialité·Conditions·Mentions légales·Contact·© 2026 SceneMixer