AI-personagestemmen
Bijgewerkt 16 september 2026

De meeste AI-videowerkstromen behandelen audio als een tweede stap: genereer stil beeldmateriaal, synthetiseer teksten en worstel daarna met lipsynchronisatie. De videomodellen hier genereren audio en beeld in één ronde, waardoor dat gevecht verdwijnt, maar verandert wat een "steminelling" is. Het is geen tekst-naar-spraakengine waar je een script in voert — het is een referentie waar de generatie op gebaseerd is.
| Schriftelijke beschrijving | Leeftijd, klankkleur, gewicht, voordracht — samen met al het andere over het personage uit het script gegenereerd en uitgevoerd door het videomodel. |
|---|---|
| Overeenkomende voorinstelling | Een stem gekozen uit een bibliotheek met systeemstemmen, elk met een kort audiovoorbeeld dat je kunt beluisteren. Eén modeloproep stelt per personage een match voor op basis van geslacht, taal en leeftijd; je kunt opnieuw matchen of handmatig een andere stem kiezen. |
| Je eigen voorbeeld | Upload audio voor een personage en dat wordt de referentie van dat personage voor elk segment waarin ze spreken. |
Wat er ook aan gekoppeld is, wordt consistent gebruikt: hetzelfde personage spreekt met dezelfde stem in elk segment en elke aflevering, om dezelfde reden dat hun gezicht hetzelfde blijft — de referentie reist met ze mee.
Er is hier geen hulpmiddel om een stem te klonen uit een opname van iemand anders. Dat is een bewuste leemte, geen item op de roadmap: het publiceren van een synthetische uitvoering van de stem van een echte persoon is een portretrechtelijk probleem in de meeste markten die we bedienen, en een product waarmee dat met één klik kan, maakt het tot iets gewoons. Onze eigen nalevingschecklist behandelt portretrecht — zowel gezicht als stem — als iets waar je het recht op moet hebben voordat je het publiceert.
Twee dingen die daaruit volgen, en die het waard zijn om duidelijk te zeggen:
De dialoogtaal wordt gekozen in Stap 1 en geldt voor het hele project: de teksten worden in die taal geschreven tijdens de analysefase, woord voor woord gekopieerd naar het storyboard en erin uitgevoerd. Dit is geen nasynchronisatie over een Engels origineel — er is geen Engels origineel. De cast, namen en omgevingen kunnen tegelijkertijd worden aangepast aan de bijbehorende markt via de doelregio-instelling. Er worden vijftien talen ondersteund, en het argument tegen nasynchronisatie gaat dieper in op waarom het genereren van de tekst beter is dan het opnieuw timen ervan.
Stemkoppeling is een gratis modeloproep — het verbruikt geen credits en telt niet mee voor je limiet voor gelijktijdige taken. Je eigen voorbeeld uploaden is gratis. De audio zelf maakt deel uit van videogeneratie, die begint bij 10 credits per seconde uitvoer (≈ $0.06/s bij het laagste creditprijs-abonnement); er zijn geen aparte kosten per woord of per personage voor spraak. Zie de prijzenpagina, of het overzicht van de generator voor waar de stem zich in het proces bevindt.
De dialoogtaal wordt eenmaal ingesteld in Stap 1 en de hele uitvoering wordt erin gedaan, waarbij de doelregio-instelling namen, gezichten en straten tegelijkertijd aanpast aan die markt. Elk voorbeeld hieronder is op die manier gemaakt, één per taal.
Talen
Elke onderstaande serie is geproduceerd via dezelfde pijplijn, waarbij de cast die taal als moedertaal spreekt: de interface, de werkdocumenten en de gesproken regels zijn allemaal in één taal, en er is niets nagesynchroniseerd. Open er een om het te horen.
A Carta de LisboaPortuguêsMoedertaaldialoog
윈터 프라미스한국어Moedertaaldialoog
El Secreto de CostaEspañolMoedertaaldialoog
浪人の誓い日本語Moedertaaldialoog
Ikrar JakartaBahasa IndonesiaMoedertaaldialoog
Зимняя коронаРусскийMoedertaaldialoog
L’Héritier du DéfiléFrançaisMoedertaaldialoog
Il Tavolo dell'OlivaItalianoMoedertaaldialoog
De Vuurtoren van de FjordNederlandsIn jouw taal
العهد الصحراويالعربيةMoedertaaldialoog
Çantasındaki SözleşmeTürkçeMoedertaaldialoog
Die Istanbul-TäuschungDeutschMoedertaaldialoog
Останній сигналУкраїнськаMoedertaaldialoog
問劍青雲繁體中文Moedertaaldialoog
The Last EnvelopeEnglishMoedertaaldialoogNee. Stemmen worden gekoppeld uit een bibliotheek met gesamplede vooraf ingestelde stemmen, of door jou aangeleverd als upload van je eigen audio. Er is geen manier om een stem te reproduceren uit een opname van iemand anders, en dat is bewust zo, niet omdat het nog niet af is.
Nee. De videomodellen genereren beeld en audio in dezelfde ronde, dus de uitvoering en de mondbeweging komen uit één generatie. Dat is ook de reden waarom het wijzigen van een tekst betekent dat je dat segment opnieuw genereert in plaats van een audiospoor te monteren.
Ja. Upload een voorbeeld voor een personage en dat wordt de stemreferentie van dat personage voor elk segment waarin ze spreken.
De dialoogtaal is een instelling op projectniveau, dus ja binnen één project — maar de taal wordt onafhankelijk gekozen van de taal waarin je het script schreef, en onafhankelijk van je interfacetaal. Eén script kan voor verschillende markten worden geproduceerd door het met verschillende instellingen te draaien.
Ja, om dezelfde reden als het gezicht: welke stem er ook aan een personage is gekoppeld, die is gekoppeld op projectniveau en gaat mee naar elk segment waarin dat personage spreekt.
Beeld en uitvoering uit één ronde, in de taal die je publiek spreekt.
Probeer SceneMixer gratisCreditpakketten vanaf $1.49 · Pro $7.99/maand · Geen creditcard nodig om te beginnen
Prijzen·Gidsen·Voorbeelden·Ondersteuning·Privacy·Voorwaarden·Juridisch·Contact·© 2026 SceneMixer