SceneMixer
Українська
Зареєструватися безкоштовно

Говіркі персонажі

AI-відео з говіркими персонажами

Оновлено 20 вересня 2026 р.

Коротка відповідь: мовлення генерується разом із зображенням за один прохід, а не накладається як ліп-синк на німий рендер. Кожен кадр містить репліку дослівно, названого мовця прив’язано до стабільного голосу з бібліотеки, додано коротку вказівку щодо подачі та явну примітку, що всі інші в кадрі тримають губи закритими. Діалогові кадри мають мінімальну тривалість — три слова на секунду англійською, — тому репліка ніколи не втискається в занадто короткий для неї кадр.
Кадр з «Команда «Зоряний спалах»», AI-короткометражної драми, згенерованої повністю в SceneMixer (7 персонажів, 1 епізод)
Зразок: «Команда «Зоряний спалах»» — Реалістична HD-якість, 1 епізод, створено повністю в SceneMixer зі сценарію · дивитися серії

Голос генерується разом із зображенням

Є два способи змусити персонажа говорити на екрані. Один — відрендерити німе відео, а потім рухати рот за допомогою аудіодоріжки: це шлях ліп-синку, для якого потрібен виріз обличчя та керуючий аудіофайл; у результаті обличчя рухається правильно, а тіло не грає. Інший — згенерувати зображення і звук разом, щоб гра й рухи рота були одним цілим.

Цей пайплайн використовує другий спосіб. Типовий рівень відео — аудіовізуальний: моделі передають репліку, інформацію про те, хто її говорить, як її промовляють і референс голосу, а вона повертає кадр із вимовленою реплікою. Нічого не зшивається після генерації.

Коротко

Що надсилається разом із кадром, де є мовлення
РеплікаДослівно, один раз. Промовляється точно так, як написано — без перефразування, без зміни таймінгу.
Хто говоритьІз зазначенням імені, прив’язане до референсу голосу цього персонажа, щоб одна й та сама особа звучала однаково в усіх серіях.
Як говоритьсяКоротка вказівка в дужках — під ніс, усе ще посміхаючись, змушуючи себе говорити рівно. Це режисерська вказівка, а не субтитр.
Хто ще в кадріПозначено як «губи закриті», щоб слухачі не ворушили губами слідом за мовцем.
Закадрове мовленняСпочатку в дужках позначають тип — за кадром, по телефону, через гучномовець — а потім усіх видимих описують із закритим ротом.
ТаймінгКадр із діалогом ніколи не коротший, ніж потрібно для репліки: три слова на секунду англійською, п’ять ієрогліфів на секунду китайською.

Голоси підбирають, а не синтезують окремо для кожного персонажа

Кожному персонажу призначають голос із бібліотеки готових системних голосів — перед вибором ви слухаєте зразок тривалістю три-вісім секунд, можете перепідібрати голос, вибрати інший у селекторі або завантажити власний запис. Причина підбору замість створення голосу для кожного персонажа — вартість і стабільність: створені голоси змінюються від генерації до генерації та коштують додатково на персонажа, а голос із бібліотеки звучить однаково і в першій, і в дванадцятій серії.

Якщо персонажу не призначено голос, кадр використовує письмовий опис голосу — вік, тембр, регістр, — який модель інтерпретує. Це типова поведінка для нових проєктів; призначення голосів — свідомий крок, а не щось, що відбувається непомітно для кожного персонажа.

Правило таймінгу і чому воно існує

Чотирисекундний кадр не може вмістити шістнадцять слів англійською. Або подача буде настільки швидкою, що слова стануть нерозбірливими, або репліку обріжуть. Тому діалогові кадри мають мінімальну тривалість, розраховану з репліки: кількість слів поділена на три для англійської, кількість ієрогліфів поділена на п’ять для китайської; до коротких реплік додають паузу замість того, щоб втискати їх у теоретичний мінімум. Кадри, що виходять занадто короткими для своєї репліки, позначають і виправляють до рендеру — це дешевше, ніж виявляти проблему вже в готовому результаті.

Мова

Мова діалогів — це налаштування проєкту, яке обирають один раз; її застосовують там, де репліки пишуть спочатку, а не перекладають потім, — тому гра звучить цією мовою, а не є дубляжем. Доступно п’ятнадцять мов інтерфейсу, і діалоги підтримуються всіма ними; у кількох мовах іноді трапляються неправильні вимови окремих слів на типовому рівні моделі, про що в селекторі є відповідне попередження. Докладніше про це розказано на сторінці голосів персонажів.

Що ця функція не робить

Скільки це коштує

Мовлення вже включено у вартість відео — окремої плати за аудіо немає. Відео коштує від 10 кредитів за секунду готового матеріалу (приблизно $0.06/с на тарифі найнижча ціна кредиту) і до $0.47/с на найчіткішому рівні; монтаж — 1 кредит за секунду. Підбір голосу з бібліотеки нічого не коштує. Нові акаунти отримують 50 кредитів і одне безкоштовне попереднє відтворення тривалістю до 5 секунд — достатньо, щоб почути, як говорить персонаж, перш ніж приймати рішення. Тарифи — на сторінці цін.

Мови

Рідна мова діалогів 15 мовами

Кожен серіал нижче створено за тим самим пайплайном: актори розмовляють відповідною мовою як носії — інтерфейс, робочі документи та репліки однією мовою, без дубляжу. Відкрийте, щоб послухати.

Переглянути всі 15 мов

Поширені запитання

Це ліп-синк?

Ні. Зображення і мовлення генеруються разом за один прохід, тому рухи рота і гра є одним цілим. Немає окремої аудіодоріжки, яку підганяють під німий рендер, і немає можливості керувати фото чи завантаженим відео.

Чи можна використати власний голос?

Ви можете завантажити запис як референс голосу для персонажа. Клонування чужого голосу не передбачено.

Чи рухають губами слухачі в кадрі?

Не повинні — кожного персонажа, що не говорить, у кадрі явно позначено як «губи закриті», і саме ця вказівка заважає слухачеві воруши́ти губами слідом за реплікою.

Що відбувається з закадровим голосом і телефонними розмовами?

Позначку про закадрове мовлення пишуть першою в примітці про подачу, а потім усіх видимих у кадрі описують із закритим ротом — тому репліку чути, але ніхто в кадрі не виглядає так, ніби її промовляє.

Чому мій діалоговий кадр довший, ніж я запланував?

Бо репліці потрібен час. Кадри з діалогом мають мінімальну тривалість приблизно три слова на секунду англійською, п’ять ієрогліфів на секунду китайською, з додаванням паузи для дуже коротких реплік. Занадто короткий для репліки кадр виправляють до рендеру, а не після.

Послухайте персонажа, перш ніж запускати серію

Безкоштовного попереднього перегляду вистачає на одну репліку діалогу.

Спробувати SceneMixer безкоштовно

Пакети кредитів від $1.49 · Pro $7.99/міс · Кредитна картка не потрібна для початку

Ціни·Посібники·Зразки·Підтримка·Конфіденційність·Умови·Правова інформація·Контакти·© 2026 SceneMixer