Говіркі персонажі
Оновлено 20 вересня 2026 р.

Є два способи змусити персонажа говорити на екрані. Один — відрендерити німе відео, а потім рухати рот за допомогою аудіодоріжки: це шлях ліп-синку, для якого потрібен виріз обличчя та керуючий аудіофайл; у результаті обличчя рухається правильно, а тіло не грає. Інший — згенерувати зображення і звук разом, щоб гра й рухи рота були одним цілим.
Цей пайплайн використовує другий спосіб. Типовий рівень відео — аудіовізуальний: моделі передають репліку, інформацію про те, хто її говорить, як її промовляють і референс голосу, а вона повертає кадр із вимовленою реплікою. Нічого не зшивається після генерації.
| Репліка | Дослівно, один раз. Промовляється точно так, як написано — без перефразування, без зміни таймінгу. |
|---|---|
| Хто говорить | Із зазначенням імені, прив’язане до референсу голосу цього персонажа, щоб одна й та сама особа звучала однаково в усіх серіях. |
| Як говориться | Коротка вказівка в дужках — під ніс, усе ще посміхаючись, змушуючи себе говорити рівно. Це режисерська вказівка, а не субтитр. |
| Хто ще в кадрі | Позначено як «губи закриті», щоб слухачі не ворушили губами слідом за мовцем. |
| Закадрове мовлення | Спочатку в дужках позначають тип — за кадром, по телефону, через гучномовець — а потім усіх видимих описують із закритим ротом. |
| Таймінг | Кадр із діалогом ніколи не коротший, ніж потрібно для репліки: три слова на секунду англійською, п’ять ієрогліфів на секунду китайською. |
Кожному персонажу призначають голос із бібліотеки готових системних голосів — перед вибором ви слухаєте зразок тривалістю три-вісім секунд, можете перепідібрати голос, вибрати інший у селекторі або завантажити власний запис. Причина підбору замість створення голосу для кожного персонажа — вартість і стабільність: створені голоси змінюються від генерації до генерації та коштують додатково на персонажа, а голос із бібліотеки звучить однаково і в першій, і в дванадцятій серії.
Якщо персонажу не призначено голос, кадр використовує письмовий опис голосу — вік, тембр, регістр, — який модель інтерпретує. Це типова поведінка для нових проєктів; призначення голосів — свідомий крок, а не щось, що відбувається непомітно для кожного персонажа.
Чотирисекундний кадр не може вмістити шістнадцять слів англійською. Або подача буде настільки швидкою, що слова стануть нерозбірливими, або репліку обріжуть. Тому діалогові кадри мають мінімальну тривалість, розраховану з репліки: кількість слів поділена на три для англійської, кількість ієрогліфів поділена на п’ять для китайської; до коротких реплік додають паузу замість того, щоб втискати їх у теоретичний мінімум. Кадри, що виходять занадто короткими для своєї репліки, позначають і виправляють до рендеру — це дешевше, ніж виявляти проблему вже в готовому результаті.
Мова діалогів — це налаштування проєкту, яке обирають один раз; її застосовують там, де репліки пишуть спочатку, а не перекладають потім, — тому гра звучить цією мовою, а не є дубляжем. Доступно п’ятнадцять мов інтерфейсу, і діалоги підтримуються всіма ними; у кількох мовах іноді трапляються неправильні вимови окремих слів на типовому рівні моделі, про що в селекторі є відповідне попередження. Докладніше про це розказано на сторінці голосів персонажів.
Мовлення вже включено у вартість відео — окремої плати за аудіо немає. Відео коштує від 10 кредитів за секунду готового матеріалу (приблизно $0.06/с на тарифі найнижча ціна кредиту) і до $0.47/с на найчіткішому рівні; монтаж — 1 кредит за секунду. Підбір голосу з бібліотеки нічого не коштує. Нові акаунти отримують 50 кредитів і одне безкоштовне попереднє відтворення тривалістю до 5 секунд — достатньо, щоб почути, як говорить персонаж, перш ніж приймати рішення. Тарифи — на сторінці цін.
Мови
Кожен серіал нижче створено за тим самим пайплайном: актори розмовляють відповідною мовою як носії — інтерфейс, робочі документи та репліки однією мовою, без дубляжу. Відкрийте, щоб послухати.
A Carta de LisboaPortuguêsРідномовні діалоги
윈터 프라미스한국어Рідномовні діалоги
El Secreto de CostaEspañolРідномовні діалоги
浪人の誓い日本語Рідномовні діалоги
Ikrar JakartaBahasa IndonesiaРідномовні діалоги
Зимняя коронаРусскийРідномовні діалоги
L’Héritier du DéfiléFrançaisРідномовні діалоги
Il Tavolo dell'OlivaItalianoРідномовні діалоги
De Vuurtoren van de FjordNederlandsРідномовні діалоги
العهد الصحراويالعربيةРідномовні діалоги
Çantasındaki SözleşmeTürkçeРідномовні діалоги
Die Istanbul-TäuschungDeutschРідномовні діалоги
Останній сигналУкраїнськаВашою мовою
問劍青雲繁體中文Рідномовні діалоги
The Last EnvelopeEnglishРідномовні діалогиНі. Зображення і мовлення генеруються разом за один прохід, тому рухи рота і гра є одним цілим. Немає окремої аудіодоріжки, яку підганяють під німий рендер, і немає можливості керувати фото чи завантаженим відео.
Ви можете завантажити запис як референс голосу для персонажа. Клонування чужого голосу не передбачено.
Не повинні — кожного персонажа, що не говорить, у кадрі явно позначено як «губи закриті», і саме ця вказівка заважає слухачеві воруши́ти губами слідом за реплікою.
Позначку про закадрове мовлення пишуть першою в примітці про подачу, а потім усіх видимих у кадрі описують із закритим ротом — тому репліку чути, але ніхто в кадрі не виглядає так, ніби її промовляє.
Бо репліці потрібен час. Кадри з діалогом мають мінімальну тривалість приблизно три слова на секунду англійською, п’ять ієрогліфів на секунду китайською, з додаванням паузи для дуже коротких реплік. Занадто короткий для репліки кадр виправляють до рендеру, а не після.
Безкоштовного попереднього перегляду вистачає на одну репліку діалогу.
Спробувати SceneMixer безкоштовноПакети кредитів від $1.49 · Pro $7.99/міс · Кредитна картка не потрібна для початку
Ціни·Посібники·Зразки·Підтримка·Конфіденційність·Умови·Правова інформація·Контакти·© 2026 SceneMixer