SceneMixer
Русский
Зарегистрироваться бесплатно

Ремейк: как из клипа считываются реплики и музыка и что попадает в вашу серию

Короткий ответ: Каждый кадр клипа прослушивается дважды: сначала распознаватель речи отвечает на вопрос «кто-то говорит и что именно сказал», потом модель, описывающая кадр, работает с уже распознанными словами. Поэтому реплики цитируются, а не угадываются по движению губ, а кадр, где никто не говорит, помечается как тихий. Если в клипе есть музыка, при считывании отмечается её характер, и каждый сгенерированный вами клип получает такое же короткое задание на музыку — как в рекламе. Язык диалогов выбирается на экране загрузки и фиксируется с началом считывания: реплики записываются на нём, а если в исходном клипе говорят на другом языке — переводятся. Реплика, которую распознаватель не смог разобрать, просто пропускается; сравните результат с вашим клипом и добавьте её в кадр в редакторе после генерации раскадровки.
Кадр из «Неоновый долг», AI-короткометражной дорамы, полностью сгенерированной SceneMixer (7 персонажей, 1 эпизод)
Пример: «Неоновый долг» — Реализм игрового движка, 1 эпизод, полностью создано SceneMixer по сценарию · смотреть серии

После считывания откройте серию на шаге 3 и просмотрите её структуру: в каждом блоке сцены реплики перечислены в формате «говорящий: реплика».

Как считываются реплики

Распознавание речи запускается для аудио каждого отдельного кадра. То, что оно услышало, передаётся описателю кадра как пометка «здесь были сказаны эти слова»; после этого описатель определяет говорящего по лицам и вписывает реплику в кадр. Музыка под речью обрабатывается корректно; сбои возникают на криках поверх толпы, при сильном акценте и очень тихих репликах — в таких случаях они пропускаются, а не придумываются. Реплики появляются в структуре как в сценарии: Пишите диалоги так, чтобы они распознавались.

A storyboard segment: location, time and weather fields, then numbered shots with durations, asset chips and spoken lines
Каждый кадр прослушивается; услышанное цитируется при считывании и попадает в структуру как реплики.

Почему цитирование, а не угадывание

Если оставить всё на усмотрение зрительной модели, на вопрос «что здесь сказано» она на одном и том же кадре то услышит речь, то нет, а при неуверенности придумает правдоподобные реплики. Распознанные слова, закреплённые в описании, исключают обе проблемы: при каждом описании кадра используются одни и те же слова.

Музыка

При считывании один раз проверяется, есть ли в клипе музыка и какая. Если есть, каждый сгенерированный вами сегмент получает однострочное задание на музыку под неё, чтобы в готовых сегментах была музыка того же характера; сам исходный трек не используется. Фоновые шумы отмечаются, но не переносятся. Откуда берётся музыка.

Язык диалогов

Выбирается на экране загрузки, по умолчанию соответствует языку интерфейса (китайская версия сайта всегда работает на китайском), и фиксируется с началом считывания. Реплики, услышанные на другом языке, переводятся на него. Для ремейка его нельзя изменить после начала, поэтому на шаге 1 нет соответствующего выпадающего списка. После считывания.

Если реплика пропущена или распознана неверно

Саму структуру редактировать нельзя, а раскадровка копирует из неё реплики слово в слово. Сгенерируйте раскадровку, потом откройте сегмент, к которому относится реплика, и добавьте или исправьте её там вместе с указанием говорящего; реплику, приписанную не тому человеку, исправляют так же. Редактирование бесплатно. Сгенерировать раскадровку.

В клипеПри считыванииВ вашей серии
Чётко произнесённая репликаЦитируется, говорящий определяетсяРеплика в структуре серии
Никто не говоритКадр помечается как тихийРеплики нет
Неразборчивая речьПропускаетсяДобавьте в сегмент вручную
МузыкаХарактер отмечаетсяМузыка того же характера в каждом сегменте
Фоновые шумыОтмечаютсяНе переносятся; в раскадровке прописываются свои

Частые вопросы

Почему реплика пропала?

Распознаватель не смог её разобрать. Сравните с вашим клипом и добавьте в сегмент после создания раскадровки.

Используются ли исходные голоса?

Нет. Голоса берутся из настроек голосов персонажей, как в любом проекте.

Может ли ремейк быть на другом языке, чем исходный клип?

Да; выберите язык диалогов на экране загрузки, и реплики переведутся при считывании.

Исходная музыка переиспользуется?

Нет. Описывается её характер, и сегменты генерируют собственную музыку.

Почему крик толпы не попадает в реплики?

Шум группы считается фоновым звуком, а не диалогом.

Услышано, процитировано, записано

Что было сказано в клипе — то и говорится в вашей серии.

Запустить ремейк

Обновлено 27 сентября 2026 г.

Тарифы·Руководства·Примеры·Поддержка·Конфиденциальность·Условия·Правовая информация·Связаться с нами·© 2026 SceneMixer