
読み取り後、ステップ3でエピソードを開き、アウトラインを確認してください。各シーンブロックには「話者:セリフ」の形式でセリフが一覧表示されます。
音声認識は各ショットの音声ごとに実行されます。聞き取られた内容は「ここでこの言葉が話された」としてショット記述に渡され、記述モデルは顔から話者を特定し、セリフをショットに書き込みます。セリフの下に流れる音楽は処理されますが、群衆の中の叫び声、強い訛り、非常に小さい声のセリフは認識に失敗しやすく、創作されるよりは欠落として扱われます。その後セリフは台本のようにアウトラインに表示されます:認識されやすいセリフの書き方。

ビジョンモデルに「ここで何と言っているか」を任せると、同じショットでも聞き取れたり聞き取れなかったりする上に、不確かな場合はもっともらしいセリフを創作してしまうことがあります。認識した言葉を記述に固定すると、この両方の問題が防げ、ショットを記述するたびに常に同じ言葉が使われるようになります。
読み取り時にクリップに音楽があるか、どのような種類かを1回だけ確認します。音楽がある場合、生成する各セグメントにそれに合った1行の音楽指定が付与され、同じ雰囲気の音楽が生成されます。元の音源自体は使用されません。環境音は記録されますが引き継がれません。音楽の生成元。
アップロード画面で選択し、初期値はインターフェースの言語になります(中国語版サイトは常に中国語です)。読み取り開始後は固定され、他言語で聞き取られたセリフはその言語に翻訳されます。リメイクでは後から変更できないため、ステップ1には選択ドロップダウンがありません。読み取り後の作業。
アウトライン自体は編集できず、絵コンテはそのセリフを一字一句コピーします。まず絵コンテを生成し、該当するセグメントを開いて、話者とともにセリフを追加または修正してください。話者が間違っている場合も同じ方法で修正できます。編集は無料です。絵コンテを生成する。
| クリップ内 | 読み取り結果 | エピソード内 |
|---|---|---|
| 明瞭なセリフ | 引用され、話者が特定される | アウトラインのセリフになる |
| 誰も話していない | ショットが無音としてマークされる | セリフなし |
| 不明瞭な発話 | 除外される | セグメント内で手動で追加する |
| 音楽 | 雰囲気が記録される | すべてのセグメントに同じ雰囲気の音楽が付く |
| 環境音 | 記録される | 引き継がれない;絵コンテ側で独自に設定される |
認識装置が聞き取れなかったためです。クリップと見比べて、絵コンテ作成後にセグメント内に追加してください。
いいえ。通常のプロジェクトと同様に、音声はキャストのボイス設定から生成されます。
はい。アップロード画面で対話言語を選ぶと、読み取り時にセリフが翻訳されます。
いいえ。音楽の雰囲気が記述され、各セグメントで独自に生成されます。
集団の音は対話ではなく背景音として扱われるためです。
2026年9月27日更新
料金プラン·ガイド·サンプル·サポート·プライバシーポリシー·利用規約·法的情報·お問い合わせ·© 2026 SceneMixer