SceneMixer
日本語
無料登録

話すキャラクター

話すキャラクターを含むAI動画

2026年9月20日更新

簡単に説明すると、音声は映像と1回の生成で同時に作られ、無音の動画に後からリップシンクで合わせるわけではありません。各ショットには台詞が一字一句そのまま入り、指定された話し手は固定のライブラリ音声に紐づけられ、短い話し方の指示と、画面内の他の人物は唇を閉じているという明示的な注記が付きます。台詞を含むショットには最低時間があり、英語では1秒あたり3単語を基準とするため、台詞が短すぎるショットに押し込まれることはありません。
SceneMixerがエンドツーエンドで生成したAIショートドラマ『Starfall Command』の静止画(キャラクター7人、1話)
サンプル:『Starfall Command』 — 写実HD、1話、脚本からSceneMixerパイプラインでエンドツーエンド制作 · エピソードを見る

音声は映像と同じ生成処理から出力される

画面上のキャラクターに話させる方法は2つあります。1つは無音の動画を生成してから音声トラックで口を動かすリップシンク方式で、顔の切り抜きと駆動用音声ファイルが必要です。この方法では口の動きは正確でも、体の演技は連動しません。もう1つは映像と音声を一緒に生成する方法で、演技と口の動きが一体で決まります。

このパイプラインは後者の方式です。標準の動画ティアは音声映像一体型で、台詞、話し手、話し方、音声リファレンスをモデルに渡すと、その台詞が話されているショットが返されます。後から何かを縫い合わせることはありません。

概要

話すショットと一緒に送られるもの
台詞一字一句そのまま、1回だけ。書かれた通りに話され、言い換えやタイミングの調整はされません。
話し手名前で指定し、そのキャラクターの音声リファレンスに紐づけることで、エピソードをまたいで同じ人物が同じ声で話すようにします。
話し方角括弧内の短い指示 — 小声で、笑みを浮かべたまま、無理に抑揚を殺して。字幕ではなく演技指示です。
画面内の他の人物唇を閉じていると明記し、聞いている人が一緒に口を動かさないようにします。
画面外の音声角括弧の最初に指定 — ナレーション、電話越し、インターホン越し — その上で、画面に見えている人は全員口を閉じていると記述します。
タイミング台詞を含むショットは、台詞に必要な長さを下回りません。英語は1秒あたり3単語、中国語は1秒あたり5文字を基準とします。

音声はキャラクターごとに合成するのではなく、既存の音声から割り当てる

各キャラクターには、あらかじめ用意されたシステム音声のライブラリから声を割り当てます。選ぶ前に3〜8秒のサンプルを試聴でき、再割り当てやセレクターから別の声を選ぶことも、自分の録音をアップロードすることもできます。キャラクターごとに音声を作成するのではなく既存の音声を割り当てる理由は、コストと安定性のためです。専用に作成した音声は生成ごとにブレが生じ、キャラクターごとに費用がかかりますが、ライブラリの音声は第1話でも第12話でも同じ声です。

キャラクターに音声が割り当てられていない場合、ショットは年齢、声質、トーンといった声の文章記述にフォールバックし、モデルがそれを解釈します。これは新規プロジェクトのデフォルトです。音声の割り当ては意図的に行う手順であり、すべてのキャラクターに自動で適用されるものではありません。

タイミングのルールとその理由

4秒のショットに英語で16単語の台詞は入りません。早口になりすぎて聞き取れなくなるか、台詞が途中で切れてしまいます。そのため台詞のあるショットには台詞から算出される最低時間があり、英語は単語数を3で割り、中国語は文字数を5で割って算出します。短い台詞には理論上の最小値に詰め込むのではなく、ポーズが追加されます。台詞に対して短すぎるショットは、レンダリング前にフラグが付いて修正されます。出力後に判明するよりもコストが抑えられるからです。

言語

台詞の言語はプロジェクト設定で1度だけ選択し、台詞を書く段階で適用されます。後から翻訳するわけではないため、その言語で演技が作り込まれ、吹き替えにはなりません。インターフェースは15言語に対応しており、台詞もそれらの言語に対応しています。デフォルトのモデルティアでは一部の言語で単語ごとに誤読が発生することがあり、該当する場合はセレクターにその旨が表示されます。詳細はキャラクターボイスのページをご覧ください。

対応していないこと

料金

音声は動画の料金に含まれており、音声だけの追加料金はかかりません。動画は出力1秒あたり10クレジット(最低クレジット単価では$0.06/秒相当)から、最高画質ティアでは$0.47/秒まで。アセンブリは1秒あたり1クレジットです。ライブラリからの音声割り当ては無料です。新規アカウントには50クレジットと、最長5秒の無料プレビューが1回付与されます。決定する前にキャラクターの声を確認するのに十分な量です。料金は価格ページをご覧ください。

言語

15言語のネイティブ台詞

以下の各シリーズはすべて同じパイプラインで制作されており、キャストはその言語をネイティブに話します。インターフェース、作業ドキュメント、話される台詞はすべて同じ言語で統一されており、吹き替えは一切使用していません。開いて実際に聞いてみてください。

全15言語を見る

よくある質問

これはリップシンクですか?

いいえ。映像と音声は1回のパスで一緒に生成されるため、口の動きと演技は一体で決まります。無音のレンダリングに別の音声トラックを合わせる処理はなく、写真やアップロードした動画を駆動することもできません。

自分の声を使えますか?

キャラクターの音声リファレンスとして録音をアップロードできます。他人の声をクローンする機能は提供していません。

ショット内で聞いている人も口を動かしますか?

動かしません。画面内の話していないキャラクターは全員、唇を閉じていると明示的に指定されており、この指示によって聞き手が台詞に合わせて口を動かすのを防ぎます。

ナレーションや電話の通話はどうなりますか?

画面外のマーカーを話し方の指示の最初に記載し、ショットに見えている人は全員口を閉じていると記述します。そのため、誰かが話しているように見えることなく台詞が聞こえます。

台詞のあるショットが自分が書いた長さより長いのはなぜですか?

台詞にその時間が必要だからです。台詞を含むショットには、英語では1秒あたり約3単語、中国語では1秒あたり約5文字の最低時間があり、非常に短い台詞にはポーズが追加されます。台詞に対して短すぎるショットは、レンダリング後ではなくレンダリング前に修正されます。

エピソードを確定する前にキャラクターの声を聴く

無料プレビューはセリフ1行分の長さで確認できます。

SceneMixerを無料で試す

クレジットパックは$1.49から・Proは$7.99/月・開始時にクレジットカードは不要

料金プラン·ガイド·サンプル·サポート·プライバシーポリシー·利用規約·法的情報·お問い合わせ·© 2026 SceneMixer