AIキャラクターボイス
2026年9月16日更新

ほとんどのAI動画ワークフローでは、音声は後工程として扱われます。まず無音の映像を生成し、セリフを合成してから、リップシンクを合わせる作業が発生します。ここで使われる動画モデルは音声と映像を1回の処理で生成するため、この手間はなくなりますが、「声の設定」の意味合いが変わります。これは台本を入力して使う音声合成エンジンではなく、生成処理の条件となる参照情報なのです。
| 文章による説明 | 年齢、声質、声の太さ、話し方などを指定します。キャラクターの他の要素と同じく台本から生成され、動画モデルによって演じられます。 |
|---|---|
| マッチングされたプリセット | システムボイスのライブラリから声を選びます。各ボイスには試聴可能な短い音声サンプルが付いています。モデル呼び出し1回で、性別、言語、年齢をもとにキャラクターごとにマッチする声が提案されます。再マッチングしたり、手動で別の声を選んだりすることも可能です。 |
| 自身のサンプル | キャラクター用の音声をアップロードすると、そのキャラクターが登場するすべてのセグメントで、その音声が声の参照として使われます。 |
設定した声は一貫して使用されます。同じキャラクターの顔が変わらないのと同じ理由で、すべてのセグメント、すべてのエピソードで同じ声で話します。参照情報がキャラクターに紐づいているからです。
他人の録音から声をクローンするツールは用意していません。これはロードマップに載っていない意図的な制限です。私たちがサービスを提供するほとんどの市場では、実在する人物の声を使った合成パフォーマンスを公開することは肖像権の問題になります。ワンクリックでそれができる製品は、その行為を常態化させてしまいます。私たちのコンプライアンスチェックリストでは、顔であれ声であれ、肖像は公開前に使用権限を得ている必要があるものとして扱っています。
この制限から明確にお伝えしておくべき2点があります:
セリフの言語はステップ1で選択し、プロジェクト全体に適用されます。分析段階でその言語でセリフが書かれ、絵コンテにそのまま記載され、その言語で演じられます。これは英語の原版に対する吹き替え処理ではありません。英語の原版自体が存在しないのです。対象地域の設定により、キャスト、名前、舞台設定を同時に該当する市場に合わせることができます。15言語に対応しており、なぜセリフを生成する方が後からタイミングを合わせる吹き替えより優れているかについては、吹き替えを推奨しない理由で詳しく説明しています。
ボイスマッチングは無料のモデル呼び出しです。クレジットを消費せず、同時実行タスクの制限にもカウントされません。自身のサンプルのアップロードも無料です。音声自体は動画生成の一部として生成され、料金は出力1秒あたり10クレジットから(最低クレジット単価では約$0.06/秒)。音声に対して1単語ごと、1文字ごとの個別料金は発生しません。詳細は料金ページ、または生成処理の中で声の設定がどの位置にあるかについてはジェネレーター概要をご覧ください。
セリフの言語はステップ1で一度設定すると、生成全体がその言語で実行されます。同時に対象地域の設定により、名前、顔、街並みがその市場に合わせて調整されます。以下の各サンプルはこの方法で、言語ごとに1つずつ制作されたものです。
言語
以下の各シリーズはすべて同じパイプラインで制作されており、キャストはその言語をネイティブに話します。インターフェース、作業ドキュメント、話される台詞はすべて同じ言語で統一されており、吹き替えは一切使用していません。開いて実際に聞いてみてください。
A Carta de LisboaPortuguêsネイティブ台詞
윈터 프라미스한국어ネイティブ台詞
El Secreto de CostaEspañolネイティブ台詞
浪人の誓い日本語あなたの言語で
Ikrar JakartaBahasa Indonesiaネイティブ台詞
Зимняя коронаРусскийネイティブ台詞
L’Héritier du DéfiléFrançaisネイティブ台詞
Il Tavolo dell'OlivaItalianoネイティブ台詞
De Vuurtoren van de FjordNederlandsネイティブ台詞
العهد الصحراويالعربيةネイティブ台詞
Çantasındaki SözleşmeTürkçeネイティブ台詞
Die Istanbul-TäuschungDeutschネイティブ台詞
Останній сигналУкраїнськаネイティブ台詞
問劍青雲繁體中文ネイティブ台詞
The Last EnvelopeEnglishネイティブ台詞いいえ。声はサンプリングされたプリセットボイスのライブラリからマッチングするか、自身の音声をアップロードして提供していただきます。他人の録音から声を複製する方法は意図的に用意していません。未実装なのではなく、意図した仕様です。
いいえ。動画モデルは映像と音声を同じ処理で生成するため、演技と口の動きは1回の生成で作られます。セリフを変更する場合に音声トラックを編集するのではなく、そのセグメントを再生成する必要があるのもこのためです。
はい。キャラクター用のサンプルをアップロードすると、そのキャラクターが話すすべてのセグメントで、その音声が声の参照として使われます。
セリフの言語はプロジェクトレベルの設定のため、1つのプロジェクト内ではそうなります。ただし言語は、台本を書いた言語や、インターフェースの言語とは独立して選択できます。設定を変えて実行することで、1つの台本を複数の市場向けに制作できます。
はい。顔が変わらないのと同じ理由です。キャラクターに設定された声はプロジェクトレベルで紐づけられ、そのキャラクターが話すすべてのセグメントに引き継がれます。
視聴者が話す言語で、映像と演技を1回の処理で生成します。
SceneMixerを無料で試すクレジットパッケージは$1.49から ・Pro $7.99/月 ・クレジットカード不要で始められます
料金プラン·ガイド·サンプル·サポート·プライバシーポリシー·利用規約·法的情報·お問い合わせ·© 2026 SceneMixer