SceneMixer
Bahasa Indonesia
Daftar gratis

Karakter yang berbicara

Video AI dengan Karakter yang Berbicara

Diperbarui 20 September 2026

Jawaban singkat: ucapan dihasilkan bersama gambar dalam satu proses, bukan disinkronkan bibir ke hasil video sunyi. Setiap cuplikan membawa dialog apa adanya, pembicara yang disebutkan terikat ke suara pustaka yang stabil, arahan penyampaian singkat, dan catatan eksplisit bahwa semua orang lain dalam bingkai menutup bibir. Cuplikan dialog memiliki batas waktu minimum — tiga kata per detik dalam bahasa Inggris — sehingga dialog tidak pernah dipaksakan masuk ke cuplikan yang terlalu pendek.
Cuplikan dari “Starfall Command”, drama pendek AI yang dihasilkan secara end-to-end oleh SceneMixer (7 karakter, 1 episode)
Contoh: “Starfall Command” — HD Realistis, 1 episode, diproduksi secara end-to-end oleh SceneMixer dari naskah · tonton episodenya

Suara dihasilkan dari proses yang sama dengan gambar

Ada dua cara membuat karakter berbicara di layar. Pertama, merender video sunyi lalu menggerakkan mulut dengan trek audio — jalur sinkronisasi bibir, yang membutuhkan potongan wajah, file audio penggerak, dan menghasilkan wajah yang bergerak benar tetapi tubuh yang tidak berakting. Kedua, menghasilkan gambar dan suara secara bersamaan, sehingga akting dan gerak mulut adalah satu keputusan yang sama.

Alur kerja ini menggunakan cara kedua. Tier video default bersifat audio-visual: model diberikan dialog, siapa yang mengucapkannya, cara mengucapkannya, dan referensi suara, lalu mengembalikan cuplikan dengan dialog yang terucap di dalamnya. Tidak ada yang disambungkan setelahnya.

Sekilas

Apa yang dikirim bersama cuplikan berbicara
DialogApa adanya, satu kali. Diucapkan persis seperti tertulis — tidak diparafrase, tidak diatur ulang waktunya.
Siapa yang mengucapkannyaDisebutkan namanya, dan terikat ke referensi suara karakter tersebut agar orang yang sama terdengar sama lintas episode.
Cara mengucapkannyaArahan singkat dalam kurung — berbisik pelan, tetap tersenyum, memaksakan nada datar. Ini arahan akting, bukan takarir.
Siapa lagi yang ada dalam bingkaiDitandai bibir tertutup, agar pendengar tidak ikut menggerakkan mulut.
Ucapan di luar layarDitandai pertama dalam kurung — sulih suara, menelepon, lewat interkom — lalu semua orang yang terlihat dideskripsikan dengan mulut tertutup.
Pengaturan waktuCuplikan yang berisi dialog tidak pernah lebih pendek dari kebutuhan dialog: tiga kata per detik untuk bahasa Inggris, lima karakter per detik untuk bahasa Mandarin.

Suara dicocokkan, bukan disintesis khusus per karakter

Setiap karakter diberikan suara dari pustaka suara sistem yang sudah jadi — Anda mendengar sampel tiga sampai delapan detik sebelum memilih, bisa mencocokkan ulang, memilih suara lain dari pemilih, atau mengunggah rekaman sendiri. Alasan ini adalah pencocokan, bukan desain suara per karakter, adalah biaya dan stabilitas: suara yang didesain bisa bergeser antar generasi dan berbiaya per karakter, sementara suara pustaka tetap sama di episode satu dan episode dua belas.

Jika karakter belum memiliki suara yang ditetapkan, cuplikan akan kembali ke deskripsi tertulis tentang suara tersebut — usia, tekstur, register — yang ditafsirkan oleh model. Itu adalah bawaan untuk proyek baru; menetapkan suara adalah langkah yang disengaja, bukan sesuatu yang terjadi diam-diam ke setiap karakter.

Aturan waktu, dan mengapa aturan itu ada

Cuplikan empat detik tidak bisa menampung enam belas kata bahasa Inggris. Entah penyampaiannya terburu-buru sampai tidak jelas atau dialognya terpotong. Jadi cuplikan dialog memiliki batas minimum yang dihitung dari dialog: jumlah kata dibagi tiga untuk bahasa Inggris, jumlah karakter dibagi lima untuk bahasa Mandarin, dan dialog pendek diberi jeda tambahan alih-alih dipadatkan ke batas minimum teoretis. Cuplikan yang kembali terlalu pendek untuk dialognya akan ditandai dan diperbaiki sebelum dirender — ini lebih murah daripada menemukannya di hasil akhir.

Bahasa

Bahasa dialog adalah pengaturan proyek, dipilih sekali, dan diterapkan saat dialog pertama kali ditulis, bukan diterjemahkan setelahnya — sehingga akting ditulis dalam bahasa itu alih-alih menjadi sulih suara. Lima belas bahasa antarmuka tersedia dan dialog didukung di semuanya; beberapa bahasa terkadang salah mengucapkan kata tertentu di tier model default, dan pemilih akan memberitahukan hal itu jika benar. Halaman suara karakter membahas ini secara mendetail.

Apa yang tidak akan dilakukan fitur ini

Biaya

Ucapan sudah termasuk dalam harga video — tidak ada biaya audio terpisah. Video mulai dari 10 kredit per detik hasil (≈ $0.06/s di harga kredit terendah) dan mencapai $0.47/s di tier paling tajam; perakitan adalah 1 kredit per detik. Pencocokan suara dari pustaka tidak dikenakan biaya. Akun baru mendapatkan 50 kredit dan satu pratinjau gratis hingga 5 detik — cukup untuk mendengar karakter berbicara sebelum memutuskan. Tarif tercantum di halaman harga.

Bahasa

Dialog asli dalam 15 bahasa

Setiap seri di bawah diproduksi dengan alur kerja yang sama, dengan pemeran berbicara bahasa tersebut secara asli: antarmuka, dokumen kerja, dan baris dialog semuanya dalam satu bahasa, tidak ada sulih suara. Buka salah satu untuk mendengarnya.

Lihat semua 15 bahasa

Pertanyaan yang sering diajukan

Apakah ini sinkronisasi bibir?

Bukan. Gambar dan ucapan dihasilkan bersama dalam satu proses, sehingga mulut dan akting adalah keputusan yang sama. Tidak ada trek audio terpisah yang dicocokkan ke hasil sunyi, dan tidak ada cara untuk menggerakkan foto atau video yang diunggah.

Bisakah saya menggunakan suara saya sendiri?

Anda bisa mengunggah rekaman sebagai referensi suara karakter. Mengkloning suara orang lain tidak disediakan.

Apakah pendengar dalam cuplikan menggerakkan mulut mereka?

Seharusnya tidak — setiap karakter yang tidak berbicara dalam bingkai secara eksplisit ditandai dengan bibir tertutup, yang merupakan instruksi untuk menghentikan pendengar ikut menggerakkan mulut mengikuti dialog.

Apa yang terjadi dengan sulih suara dan panggilan telepon?

Penanda di luar layar ditulis pertama di catatan penyampaian, lalu semua orang yang terlihat dalam cuplikan dideskripsikan dengan mulut tertutup — sehingga dialog terdengar tanpa ada yang terlihat mengucapkannya.

Mengapa cuplikan dialog saya lebih panjang dari yang saya tulis?

Karena dialog membutuhkan waktu tersebut. Cuplikan yang berisi dialog memiliki batas minimum sekitar tiga kata per detik dalam bahasa Inggris, lima karakter per detik dalam bahasa Mandarin, dengan jeda tambahan untuk dialog yang sangat pendek. Cuplikan yang terlalu pendek untuk dialognya diperbaiki sebelum dirender, bukan sesudahnya.

Dengarkan karakter sebelum Anda menyelesaikan episode

Pratinjau gratisnya cukup panjang untuk satu baris dialog.

Coba SceneMixer gratis

Paket kredit mulai dari $1.49 · Pro $7.99/bln · Tidak perlu kartu kredit untuk memulai

Harga·Panduan·Contoh·Dukungan·Privasi·Ketentuan·Informasi hukum·Hubungi kami·© 2026 SceneMixer