Говорящие персонажи
Обновлено 20 сентября 2026 г.

Заставить персонажа говорить на экране можно двумя способами. Первый — отрендерить тихое видео, а потом привести рот в движение по аудиодорожке: это путь лип-синка, для которого нужен кроп лица и управляющий аудиофайл; в результате лицо двигается правильно, а тело не играет. Второй — сгенерировать картинку и звук вместе, так что игра и движения рта — это одно решение модели.
Этот пайплайн работает по второму варианту. Стандартный тариф видео — аудиовизуальный: модели передают реплику, имя говорящего, манеру произношения и референс голоса, а в ответ приходит кадр, в котором эта реплика уже произнесена. Ничего не сшивается постфактум.
| Реплика | Дословно, один раз. Произносится ровно как написано — без перефразирования и перераспределения по времени. |
|---|---|
| Кто говорит | Указывается по имени и привязывается к голосовому референсу персонажа, чтобы один и тот же герой звучал одинаково во всех сериях. |
| Как говорит | Короткая ремарка в скобках — себе под нос, всё ещё улыбаясь, натянуто ровным голосом. Это указание по подаче, а не субтитр. |
| Кто ещё в кадре | Помечается как «губы сомкнуты», чтобы слушатели не шевелили губами в такт речи. |
| Речь за кадром | Сначала в скобках ставится пометка — закадровый голос, по телефону, по громкой связи — а потом все видимые персонажи описываются с сомкнутым ртом. |
| Тайминг | Кадр с диалогом никогда не короче, чем нужно для реплики: в английском — три слова в секунду, в китайском — пять иероглифов в секунду. |
Каждому персонажу назначают голос из библиотеки готовых системных голосов — перед выбором можно прослушать семпл длиной три–восемь секунд, переподобрать вариант, выбрать другой из списка или загрузить собственную запись. Причина в том, что подбор стабильнее и дешевле, чем разработка голоса под каждого героя: кастомные голоса дрейфуют от генерации к генерации и оплачиваются отдельно для каждого персонажа, а библиотечный голос звучит одинаково и в первой, и в двенадцатой серии.
Если персонажу не назначен голос, в кадре используется текстовое описание голоса — возраст, тембр, регистр — которое модель интерпретирует сама. Это поведение по умолчанию для новых проектов; назначение голосов — это осознанный шаг, а не автоматическая процедура для всех персонажей.
Четырёхсекундный кадр не вмещает шестнадцать английских слов. Либо речь скомкают до неразборчивости, либо реплику обрежут. Поэтому у кадров с диалогом есть минимальная длительность, рассчитанная по реплике: количество слов делится на три для английского, количество иероглифов — на пять для китайского, а к коротким репликам добавляется пауза вместо того, чтобы втискивать их в теоретический минимум. Кадры, которые получились слишком короткими для своей реплики, помечаются и исправляются до рендера — это дешевле, чем обнаружить проблему уже в готовом видео.
Язык диалогов — это настройка проекта, которую выбирают один раз; он применяется там, где реплики пишутся изначально, а не переводится постфактум — поэтому игра получается сразу на нужном языке, а не в виде дубляжа. Доступно пятнадцать языков интерфейса, и диалоги поддерживаются на всех из них; на стандартном тарифе в паре языков иногда встречаются неправильные произношения отдельных слов, и в селекторе об этом сказано там, где это актуально. Подробности — на странице голосов персонажей.
Речь включена в стоимость видео — отдельной платы за аудио нет. Видео стоит от 10 кредитов за секунду готового ролика (≈ $0.06/с на тарифе самая низкая цена за кредит) и до $0.47/с на самом качественном тарифе; сборка стоит 1 кредит за секунду. Подбор голоса из библиотеки бесплатный. Новые аккаунты получают 50 кредитов и одно бесплатное превью длительностью до 5 секунд — этого достаточно, чтобы прослушать, как говорит персонаж, перед принятием решения. Актуальные тарифы — на странице цен.
Языки
Каждый сериал ниже создан по одному и тому же пайплайну: актёры говорят на выбранном языке как на родном — интерфейс, рабочие документы и реплики на одном языке, без дубляжа. Откройте любой, чтобы послушать.
A Carta de LisboaPortuguêsРодная речь
윈터 프라미스한국어Родная речь
El Secreto de CostaEspañolРодная речь
浪人の誓い日本語Родная речь
Ikrar JakartaBahasa IndonesiaРодная речь
Зимняя коронаРусскийНа вашем языке
L’Héritier du DéfiléFrançaisРодная речь
Il Tavolo dell'OlivaItalianoРодная речь
De Vuurtoren van de FjordNederlandsРодная речь
العهد الصحراويالعربيةРодная речь
Çantasındaki SözleşmeTürkçeРодная речь
Die Istanbul-TäuschungDeutschРодная речь
Останній сигналУкраїнськаРодная речь
問劍青雲繁體中文Родная речь
The Last EnvelopeEnglishРодная речьНет. Картинка и речь генерируются вместе за один проход, поэтому движения рта и игра — это одно решение модели. Отдельной аудиодорожки, которую подгоняют под тихий рендер, нет, и возможности управлять фото или загруженным видео тоже нет.
Вы можете загрузить запись как голосовой референс для персонажа. Клонирование чужого голоса не предлагается.
Не должны — каждому неговорящему персонажу в кадре явно ставится пометка «губы сомкнуты», и именно эта инструкция не даёт слушателю шевелить губами в такт реплике.
Пометка о речи за кадром ставится первой в заметке о подаче, а потом все видимые в кадре персонажи описываются с сомкнутым ртом — так реплика слышна, но никто на экране не выглядит так, будто её произносит.
Потому что реплике нужно время. У кадров с диалогом есть минимальная длительность — примерно три слова в секунду для английского, пять иероглифов в секунду для китайского, а к очень коротким репликам добавляется пауза. Слишком короткий для реплики кадр исправляется до рендера, а не после.
Бесплатного превью хватает на одну реплику диалога.
Попробуйте SceneMixer бесплатноПакеты кредитов от $1.49 · Pro $7.99/мес · Банковская карта не нужна для старта
Тарифы·Руководства·Примеры·Поддержка·Конфиденциальность·Условия·Правовая информация·Связаться с нами·© 2026 SceneMixer