SceneMixer
Русский
Зарегистрироваться бесплатно

Говорящие персонажи

AI-видео с говорящими персонажами

Обновлено 20 сентября 2026 г.

Короткий ответ: речь генерируется вместе с картинкой за один проход, а не накладывается в виде лип-синка на тихий рендер. Каждый кадр содержит реплику дословно, указанный говорящий привязан к стабильному библиотечному голосу, добавляется короткая указание по подаче и явная пометка, что у всех остальных в кадре губы сомкнуты. У кадров с диалогом есть минимальная длительность — в английском это три слова в секунду — поэтому реплику никогда не втискивают в слишком короткий для неё кадр.
Кадр из «Командование «Звездопад»», AI-короткометражной дорамы, полностью сгенерированной SceneMixer (7 персонажей, 1 эпизод)
Пример: «Командование «Звездопад»» — Реалистичное HD, 1 эпизод, полностью создано SceneMixer по сценарию · смотреть серии

Голос генерируется одновременно с картинкой

Заставить персонажа говорить на экране можно двумя способами. Первый — отрендерить тихое видео, а потом привести рот в движение по аудиодорожке: это путь лип-синка, для которого нужен кроп лица и управляющий аудиофайл; в результате лицо двигается правильно, а тело не играет. Второй — сгенерировать картинку и звук вместе, так что игра и движения рта — это одно решение модели.

Этот пайплайн работает по второму варианту. Стандартный тариф видео — аудиовизуальный: модели передают реплику, имя говорящего, манеру произношения и референс голоса, а в ответ приходит кадр, в котором эта реплика уже произнесена. Ничего не сшивается постфактум.

Коротко о главном

Что передаётся вместе с кадром, где персонаж говорит
РепликаДословно, один раз. Произносится ровно как написано — без перефразирования и перераспределения по времени.
Кто говоритУказывается по имени и привязывается к голосовому референсу персонажа, чтобы один и тот же герой звучал одинаково во всех сериях.
Как говоритКороткая ремарка в скобках — себе под нос, всё ещё улыбаясь, натянуто ровным голосом. Это указание по подаче, а не субтитр.
Кто ещё в кадреПомечается как «губы сомкнуты», чтобы слушатели не шевелили губами в такт речи.
Речь за кадромСначала в скобках ставится пометка — закадровый голос, по телефону, по громкой связи — а потом все видимые персонажи описываются с сомкнутым ртом.
ТаймингКадр с диалогом никогда не короче, чем нужно для реплики: в английском — три слова в секунду, в китайском — пять иероглифов в секунду.

Голоса подбираются, а не синтезируются отдельно для каждого персонажа

Каждому персонажу назначают голос из библиотеки готовых системных голосов — перед выбором можно прослушать семпл длиной три–восемь секунд, переподобрать вариант, выбрать другой из списка или загрузить собственную запись. Причина в том, что подбор стабильнее и дешевле, чем разработка голоса под каждого героя: кастомные голоса дрейфуют от генерации к генерации и оплачиваются отдельно для каждого персонажа, а библиотечный голос звучит одинаково и в первой, и в двенадцатой серии.

Если персонажу не назначен голос, в кадре используется текстовое описание голоса — возраст, тембр, регистр — которое модель интерпретирует сама. Это поведение по умолчанию для новых проектов; назначение голосов — это осознанный шаг, а не автоматическая процедура для всех персонажей.

Правило тайминга и зачем оно нужно

Четырёхсекундный кадр не вмещает шестнадцать английских слов. Либо речь скомкают до неразборчивости, либо реплику обрежут. Поэтому у кадров с диалогом есть минимальная длительность, рассчитанная по реплике: количество слов делится на три для английского, количество иероглифов — на пять для китайского, а к коротким репликам добавляется пауза вместо того, чтобы втискивать их в теоретический минимум. Кадры, которые получились слишком короткими для своей реплики, помечаются и исправляются до рендера — это дешевле, чем обнаружить проблему уже в готовом видео.

Язык

Язык диалогов — это настройка проекта, которую выбирают один раз; он применяется там, где реплики пишутся изначально, а не переводится постфактум — поэтому игра получается сразу на нужном языке, а не в виде дубляжа. Доступно пятнадцать языков интерфейса, и диалоги поддерживаются на всех из них; на стандартном тарифе в паре языков иногда встречаются неправильные произношения отдельных слов, и в селекторе об этом сказано там, где это актуально. Подробности — на странице голосов персонажей.

Что эта функция не делает

Сколько это стоит

Речь включена в стоимость видео — отдельной платы за аудио нет. Видео стоит от 10 кредитов за секунду готового ролика (≈ $0.06/с на тарифе самая низкая цена за кредит) и до $0.47/с на самом качественном тарифе; сборка стоит 1 кредит за секунду. Подбор голоса из библиотеки бесплатный. Новые аккаунты получают 50 кредитов и одно бесплатное превью длительностью до 5 секунд — этого достаточно, чтобы прослушать, как говорит персонаж, перед принятием решения. Актуальные тарифы — на странице цен.

Языки

Родная речь на 15 языках

Каждый сериал ниже создан по одному и тому же пайплайну: актёры говорят на выбранном языке как на родном — интерфейс, рабочие документы и реплики на одном языке, без дубляжа. Откройте любой, чтобы послушать.

Посмотреть все 15 языков

Частые вопросы

Это лип-синк?

Нет. Картинка и речь генерируются вместе за один проход, поэтому движения рта и игра — это одно решение модели. Отдельной аудиодорожки, которую подгоняют под тихий рендер, нет, и возможности управлять фото или загруженным видео тоже нет.

Можно ли использовать свой голос?

Вы можете загрузить запись как голосовой референс для персонажа. Клонирование чужого голоса не предлагается.

Шевелят ли губами слушатели в кадре?

Не должны — каждому неговорящему персонажу в кадре явно ставится пометка «губы сомкнуты», и именно эта инструкция не даёт слушателю шевелить губами в такт реплике.

Что происходит с закадровым голосом и телефонными разговорами?

Пометка о речи за кадром ставится первой в заметке о подаче, а потом все видимые в кадре персонажи описываются с сомкнутым ртом — так реплика слышна, но никто на экране не выглядит так, будто её произносит.

Почему кадр с диалогом длиннее, чем я написал?

Потому что реплике нужно время. У кадров с диалогом есть минимальная длительность — примерно три слова в секунду для английского, пять иероглифов в секунду для китайского, а к очень коротким репликам добавляется пауза. Слишком короткий для реплики кадр исправляется до рендера, а не после.

Прослушайте персонажа перед тем, как запускать серию

Бесплатного превью хватает на одну реплику диалога.

Попробуйте SceneMixer бесплатно

Пакеты кредитов от $1.49 · Pro $7.99/мес · Банковская карта не нужна для старта

Тарифы·Руководства·Примеры·Поддержка·Конфиденциальность·Условия·Правовая информация·Связаться с нами·© 2026 SceneMixer