AI-голоса персонажей
Обновлено 16 сентября 2026 г.

В большинстве рабочих процессов с AI-видео аудио делают отдельно: сначала генерируют немой ролик, потом синтезируют реплики, а потом борются с рассинхроном губ. Здесь видеомодели создают аудио и картинку за один проход — это убирает проблему синхронизации, но меняет саму суть «настройки голоса». Это не движок text-to-speech, которому вы скармливаете скрипт, а референс, на который опирается генерация.
| Текстовое описание | Возраст, тембр, насыщенность, манера речи — всё это генерируется по скрипту вместе с остальными чертами персонажа и воспроизводится видеомоделью. |
|---|---|
| Подобранный пресет | Голос выбирается из библиотеки системных голосов, у каждого есть короткий аудиообразец для прослушивания. Один вызов модели предлагает подходящий вариант для каждого персонажа по полу, языку и возрасту; вы можете переподобрать голос или выбрать другой вручную. |
| Ваш собственный образец | Загрузите аудио для персонажа — и оно станет референсом его голоса для всех сегментов, где он говорит. |
Какой бы вариант вы ни прикрепили, он используется стабильно: один и тот же персонаж говорит одним и тем же голосом во всех сегментах и всех эпизодах по той же причине, по которой у него не меняется лицо — референс переносится вместе с ним.
Здесь нет инструмента для клонирования голоса по записи другого человека. Это осознанное ограничение, а не пункт в дорожной карте: публикация синтезированной записи голоса реального человека является проблемой использования образа на большинстве рынков, где мы работаем, а продукт, позволяющий сделать это в один клик, делает такую практику обыденной. Наш собственный чек-лист соответствия рассматривает образ — и лицо, и голос — как то, на что у вас должно быть право использования перед публикацией.
Из этого следуют два момента, которые стоит сказать прямо:
Язык диалогов выбирается на Шаге 1 и применяется ко всему проекту: реплики пишутся на этом языке на этапе анализа, дословно переносятся в сториборд и воспроизводятся на нём. Это не дубляж поверх английского оригинала — никакого английского оригинала нет. Состав актёров, имена и окружение могут одновременно адаптироваться под нужный рынок через настройку целевого региона. Поддерживается пятнадцать языков; в материале почему дубляж — плохая идея объясняется, почему генерация реплик лучше, чем перекладка их под тайминг.
Подбор голоса — это бесплатный вызов модели: он не тратит кредиты и не учитывается в лимите параллельных задач. Загрузка собственного образца тоже бесплатна. Само аудио является частью генерации видео, которая стоит от 10 кредитов за секунду готового ролика (≈ $0.06/с на тарифе самая низкая цена за кредит); отдельной платы за слово или символ за речь нет. Подробности — на странице с ценами или в обзоре генератора, где рассказано, на каком этапе обработки задаётся голос.
Язык диалогов задаётся один раз на Шаге 1, и вся генерация идёт на нём, а настройка целевого региона одновременно адаптирует имена, лица и улицы под соответствующий рынок. Каждый пример ниже сделан именно так — по одному на язык.
Языки
Каждый сериал ниже создан по одному и тому же пайплайну: актёры говорят на выбранном языке как на родном — интерфейс, рабочие документы и реплики на одном языке, без дубляжа. Откройте любой, чтобы послушать.
A Carta de LisboaPortuguêsРодная речь
윈터 프라미스한국어Родная речь
El Secreto de CostaEspañolРодная речь
浪人の誓い日本語Родная речь
Ikrar JakartaBahasa IndonesiaРодная речь
Зимняя коронаРусскийНа вашем языке
L’Héritier du DéfiléFrançaisРодная речь
Il Tavolo dell'OlivaItalianoРодная речь
De Vuurtoren van de FjordNederlandsРодная речь
العهد الصحراويالعربيةРодная речь
Çantasındaki SözleşmeTürkçeРодная речь
Die Istanbul-TäuschungDeutschРодная речь
Останній сигналУкраїнськаРодная речь
問劍青雲繁體中文Родная речь
The Last EnvelopeEnglishРодная речьНет. Голоса подбираются из библиотеки сэмплированных предустановленных голосов или загружаются вами в виде собственного аудио. Возможности воспроизвести голос по записи другого человека нет, и это сделано намеренно, а не потому что функция ещё не готова.
Нет. Видеомодели генерируют картинку и аудио за один проход, поэтому исполнение реплики и движения губ получаются в рамках одной генерации. Именно поэтому при изменении реплики нужно перегенерировать соответствующий сегмент, а не перемонтировать аудиодорожку.
Да. Загрузите образец для персонажа — и он станет референсом его голоса для всех сегментов, где он говорит.
Язык диалогов — это настройка уровня проекта, так что в рамках одного проекта да. Но язык выбирается независимо от того, на каком языке вы написали скрипт, и независимо от языка интерфейса. Один и тот же скрипт можно выпустить для нескольких рынков, запустив генерацию с разными настройками.
Да, по той же причине, по которой сохраняется лицо: какой бы голос ни был прикреплён к персонажу, он закрепляется на уровне проекта и переносится во все сегменты, где этот персонаж говорит.
Картинка и исполнение за один проход — на языке, на котором говорит ваша аудитория.
Попробуйте SceneMixer бесплатноПакеты кредитов от $1.49 · Pro $7.99/мес · Для начала не нужна банковская карта
Тарифы·Руководства·Примеры·Поддержка·Конфиденциальность·Условия·Правовая информация·Связаться с нами·© 2026 SceneMixer