SceneMixer
日本語
無料登録

リメイク:クリップからセリフと音楽がどう読み取られ、エピソードに反映されるか

簡単に言うと: クリップの各ショットは2回解析されます。1回目は音声認識で「誰か話しているか、何と言っているか」を判定し、2回目はショットを説明するモデルが、認識された言葉をもとに内容を記述します。そのためセリフは口の動きから推測されるのではなく実際の発話が引用され、誰も話していないショットは無音と記載されます。クリップに音楽がある場合、読み取りでその雰囲気が記録され、生成される各クリップにはCMのように同じ短い音楽指定が引き継がれます。対話言語はアップロード画面で選択し、読み取り開始後は固定されます。セリフはその言語で書き起こされ、元の言語が異なる場合は翻訳されます。認識できなかったセリフは単に欠落します。絵コンテが生成されたら、クリップと見比べてエディター内の該当ショットに追加してください。
SceneMixerがエンドツーエンドで生成したAIショートドラマ『ネオン・デット』の静止画(キャラクター7人、1話)
サンプル:『ネオン・デット』 — ゲームエンジン写実、1話、脚本からSceneMixerパイプラインでエンドツーエンド制作 · エピソードを見る

読み取り後、ステップ3でエピソードを開き、アウトラインを確認してください。各シーンブロックには「話者:セリフ」の形式でセリフが一覧表示されます。

セリフが聞き取られる仕組み

音声認識は各ショットの音声ごとに実行されます。聞き取られた内容は「ここでこの言葉が話された」としてショット記述に渡され、記述モデルは顔から話者を特定し、セリフをショットに書き込みます。セリフの下に流れる音楽は処理されますが、群衆の中の叫び声、強い訛り、非常に小さい声のセリフは認識に失敗しやすく、創作されるよりは欠落として扱われます。その後セリフは台本のようにアウトラインに表示されます:認識されやすいセリフの書き方。

A storyboard segment: location, time and weather fields, then numbered shots with durations, asset chips and spoken lines
各ショットが聞き取られ、聞こえた内容が読み取り結果に引用され、アウトラインのセリフとして反映されます。

なぜ推測せず引用するのか

ビジョンモデルに「ここで何と言っているか」を任せると、同じショットでも聞き取れたり聞き取れなかったりする上に、不確かな場合はもっともらしいセリフを創作してしまうことがあります。認識した言葉を記述に固定すると、この両方の問題が防げ、ショットを記述するたびに常に同じ言葉が使われるようになります。

音楽

読み取り時にクリップに音楽があるか、どのような種類かを1回だけ確認します。音楽がある場合、生成する各セグメントにそれに合った1行の音楽指定が付与され、同じ雰囲気の音楽が生成されます。元の音源自体は使用されません。環境音は記録されますが引き継がれません。音楽の生成元。

対話言語

アップロード画面で選択し、初期値はインターフェースの言語になります(中国語版サイトは常に中国語です)。読み取り開始後は固定され、他言語で聞き取られたセリフはその言語に翻訳されます。リメイクでは後から変更できないため、ステップ1には選択ドロップダウンがありません。読み取り後の作業。

セリフが抜けていたり間違っていたりする場合

アウトライン自体は編集できず、絵コンテはそのセリフを一字一句コピーします。まず絵コンテを生成し、該当するセグメントを開いて、話者とともにセリフを追加または修正してください。話者が間違っている場合も同じ方法で修正できます。編集は無料です。絵コンテを生成する。

クリップ内読み取り結果エピソード内
明瞭なセリフ引用され、話者が特定されるアウトラインのセリフになる
誰も話していないショットが無音としてマークされるセリフなし
不明瞭な発話除外されるセグメント内で手動で追加する
音楽雰囲気が記録されるすべてのセグメントに同じ雰囲気の音楽が付く
環境音記録される引き継がれない;絵コンテ側で独自に設定される

よくある質問

セリフが抜けているのはなぜですか?

認識装置が聞き取れなかったためです。クリップと見比べて、絵コンテ作成後にセグメント内に追加してください。

元の音声は使われますか?

いいえ。通常のプロジェクトと同様に、音声はキャストのボイス設定から生成されます。

リメイクの音声を元のクリップと別の言語にできますか?

はい。アップロード画面で対話言語を選ぶと、読み取り時にセリフが翻訳されます。

元の音楽は再利用されますか?

いいえ。音楽の雰囲気が記述され、各セグメントで独自に生成されます。

群衆の叫び声にセリフが付かないのはなぜですか?

集団の音は対話ではなく背景音として扱われるためです。

聞き取り、引用し、書き起こす

クリップで話された内容が、そのままあなたのエピソードのセリフになります。

リメイクを開始する

2026年9月27日更新

料金プラン·ガイド·サンプル·サポート·プライバシーポリシー·利用規約·法的情報·お問い合わせ·© 2026 SceneMixer