Pratende personages
Bijgewerkt 20 september 2026

Er zijn twee manieren om een personage op het scherm te laten praten. De ene is een stille video renderen en daarna de mond aansturen met een audiospoor — de lipsync-route, waarvoor je een gezichtsuitsnede en een sturend audiobestand nodig hebt, en die een correct bewegend gezicht oplevert maar een lichaam dat niet acteert. De andere is beeld en geluid samen genereren, zodat de voordracht en de mond één besluit zijn.
Deze pijplijn doet het tweede. De standaard videolaag is audiovisueel: het model krijgt de zin, wie hem zegt, hoe hij wordt gezegd en een stemreferentie, en levert een shot terug waarin de zin wordt uitgesproken. Er wordt niets achteraf aan elkaar geplakt.
| De zin | Letterlijk, één keer. Precies uitgesproken zoals geschreven — niet geparafraseerd, niet opnieuw getimed. |
|---|---|
| Wie het zegt | Bij naam genoemd, en gekoppeld aan de stemreferentie van dat personage zodat dezelfde persoon hetzelfde klinkt in alle afleveringen. |
| Hoe het wordt gezegd | Een korte aanwijzing tussen haken — binnensmonds, nog steeds glimlachend, het plat forceert. Een aanwijzing, geen ondertitel. |
| Wie er nog meer in beeld is | Gemarkeerd als lippen dicht, zodat luisteraars niet meepraten. |
| Spraak buiten beeld | Eerst gemarkeerd tussen de haken — voice-over, aan de telefoon, via de intercom — en daarna wordt iedereen die zichtbaar is beschreven met hun mond dicht. |
| Timing | Een shot met dialoog is nooit korter dan de zin nodig heeft: drie woorden per seconde in het Engels, vijf tekens per seconde in het Chinees. |
Elk personage krijgt een stem uit een bibliotheek met voorgemaakte systeemstemmen — je luistert naar een voorbeeld van drie tot acht seconden voordat je kiest, kunt opnieuw matchen, een andere stem kiezen in de selector of je eigen opname uploaden. De reden voor matchen in plaats van een stem per personage ontwerpen is kosten en stabiliteit: ontworpen stemmen veranderen tussen generaties en kosten per personage, terwijl een bibliotheekstem dezelfde stem is in aflevering één en aflevering twaalf.
Als een personage geen toegewezen stem heeft, valt de shot terug op een geschreven beschrijving van de stem — leeftijd, klank, register — die het model interpreteert. Dat is de standaard voor nieuwe projecten; stemmen toewijzen is een bewuste stap, niet iets dat stilzwijgend bij elk personage gebeurt.
Een shot van vier seconden kan geen zestien Engelse woorden bevatten. Of de voordracht wordt zo gehaast dat het onverstaanbaar wordt, of de zin wordt afgeknipt. Daarom hebben dialoogshots een ondergrens afgeleid van de zin: aantal woorden gedeeld door drie voor Engels, aantal tekens gedeeld door vijf voor Chinees, en bij korte zinnen wordt er extra pauze toegevoegd in plaats van ze tot hun theoretische minimum te persen. Shots die te kort terugkomen voor hun zin worden gemarkeerd en gecorrigeerd voordat er iets wordt gerenderd — dat is goedkoper dan het achteraf in de uitvoer ontdekken.
De dialoogtaal is een projectinstelling die je één keer kiest, en die wordt toegepast waar de zinnen eerst worden geschreven in plaats van achteraf vertaald — dus de voordracht wordt in die taal gemaakt in plaats van nagesynchroniseerd. Er zijn vijftien interfacetalen beschikbaar en dialoog wordt in al die talen ondersteund; een paar talen spreken af en toe een enkel woord verkeerd uit op de standaard modellaag, en de selector vermeldt dat waar dat zo is. De pagina met personagestemmen gaat hier dieper op in.
Spraak is bij de videoprijs inbegrepen — er zijn geen aparte audiokosten. Video begint bij 10 credits per seconde uitvoer (≈ $0.06/s op de laagste creditprijs) en loopt op tot $0.47/s op de scherpste laag; montage kost 1 credit per seconde. Stemmen matchen uit de bibliotheek is gratis. Nieuwe accounts krijgen 50 credits en één gratis voorbeeld van maximaal 5 seconden — genoeg om een personage te horen praten voordat je beslist. De tarieven staan op de prijzenpagina.
Talen
Elke onderstaande serie is geproduceerd via dezelfde pijplijn, waarbij de cast die taal als moedertaal spreekt: de interface, de werkdocumenten en de gesproken regels zijn allemaal in één taal, en er is niets nagesynchroniseerd. Open er een om het te horen.
A Carta de LisboaPortuguêsMoedertaaldialoog
윈터 프라미스한국어Moedertaaldialoog
El Secreto de CostaEspañolMoedertaaldialoog
浪人の誓い日本語Moedertaaldialoog
Ikrar JakartaBahasa IndonesiaMoedertaaldialoog
Зимняя коронаРусскийMoedertaaldialoog
L’Héritier du DéfiléFrançaisMoedertaaldialoog
Il Tavolo dell'OlivaItalianoMoedertaaldialoog
De Vuurtoren van de FjordNederlandsIn jouw taal
العهد الصحراويالعربيةMoedertaaldialoog
Çantasındaki SözleşmeTürkçeMoedertaaldialoog
Die Istanbul-TäuschungDeutschMoedertaaldialoog
Останній сигналУкраїнськаMoedertaaldialoog
問劍青雲繁體中文Moedertaaldialoog
The Last EnvelopeEnglishMoedertaaldialoogNee. Beeld en spraak worden in één keer samen gegenereerd, dus de mond en de voordracht zijn één besluit. Er is geen apart audiospoor dat wordt afgestemd op een stille render, en er is geen manier om een foto of geüploade video aan te sturen.
Je kunt een opname uploaden als stemreferentie voor een personage. Het klonen van andermans stem wordt niet aangeboden.
Dat horen ze niet te doen — elk niet-sprekend personage in beeld wordt expliciet gemarkeerd met lippen dicht, en die instructie voorkomt dat een luisteraar meepraat met de zin.
De markering voor buiten beeld staat eerst in de voordrachtaanwijzing, en daarna wordt iedereen die zichtbaar is in de shot beschreven met hun mond dicht — zodat de zin te horen is zonder dat iemand hem lijkt uit te spreken.
Omdat de zin de tijd nodig heeft. Shots met dialoog hebben een ondergrens van ongeveer drie woorden per seconde in het Engels, vijf tekens per seconde in het Chinees, met een extra pauze bij heel korte zinnen. Een shot die te kort is voor zijn zin wordt vóór het renderen gecorrigeerd, niet erna.
De gratis preview is lang genoeg voor één regel dialoog.
Probeer SceneMixer gratisCreditpakketten vanaf $1.49 · Pro $7.99/mnd · Geen creditcard nodig om te starten
Prijzen·Gidsen·Voorbeelden·Ondersteuning·Privacy·Voorwaarden·Juridisch·Contact·© 2026 SceneMixer