Konsistensi Karakter Drama Pendek AI (2026): Alasan Wajah Berubah Antar Bidikan, dan Tiga Lapisan yang Menguncinya
Diperbarui 12 September 2026
Jawaban singkat: Konsistensi karakter dalam drama pendek AI berarti satu karakter mempertahankan wajah yang sama, pakaian dan properti yang sama, serta arah seni yang sama di puluhan hingga ratusan bidikan dalam satu serial. Pada tahun 2026, hal ini menjadi alasan utama platform dan penonton menolak serial buatan AI. Masalah ini tidak dapat diselesaikan hanya dengan susunan kata dalam prompt. Hal ini dikunci pada tiga lapisan terpisah: lembar karakter (latar belakang putih, cahaya searah, fitur identitas diutamakan), pelat adegan (set kosong, tiga bidang kedalaman, sumber cahaya dideskripsikan daripada di mana cahaya jatuh), dan kesinambungan antar bidikan di dalam storyboard (tindakan dan posisi dibawa lanjut, tidak pernah menyebut nama orang yang tidak ada dalam bingkai). Penyimpangan wajah memiliki tiga akar penyebab dan masing-masing memetakan ke satu lapisan: deskripsi teks menjadi luntur, referensi membawa cahaya yang sudah tertanam, dan bidikan tidak memiliki jangkar di antaranya. Di bawah ini: apa yang harus dilakukan di setiap lapisan, tabel input referensi, dan daftar periksa penerimaan 5 bidikan.
Contoh: “The Eagle's Vow” — HD Realistis, 1 episode, diproduksi secara end-to-end oleh SceneMixer dari naskah · tonton episodenya
Apa arti "konsisten": tiga lapisan
Fitur identitas: bentuk wajah, alis dan mata, hidung dan bibir, warna kulit, rambut, postur, usia tampak, ditambah satu jangkar yang langsung dikenali (bekas luka, tahi lalat, perhiasan, potongan rambut). Dibawa oleh lembar karakter.
Pakaian, riasan, dan properti: apa yang dikenakan dan dipegang karakter ini dalam adegan ini, serta apa yang ada di dalam set. Dibawa oleh deskripsi kostum per karakter dari analisis naskah dan oleh pelat adegan. Kostum bersifat per karakter dan per kelas sosial, bukan satu tag gaya untuk seluruh serial.
Pencahayaan dan arah seni: disiplin warna, material, kepadatan tata set, di mana sumber cahaya berada. Dibawa oleh pelat adegan dan oleh baris pencahayaan di setiap bidikan. Gambar referensi itu sendiri harus tetap netral.
Mengapa wajah menyimpang: tiga akar penyebab
Gejala
Akar penyebab
Lapisan
Karakter yang sama mendapatkan wajah baru setiap beberapa segmen dan perlahan menjadi generik
Deskripsi luntur: deskripsi wajah berada di tengah instruksi aksi dan teknis yang panjang, sehingga model kembali ke prior "wajah menarik" miliknya
Lapisan 1: identitas tidak didahulukan dalam prompt lembar, atau lembar tidak dilampirkan sebagai referensi pada setiap pembuatan
Wajah sudah benar, tetapi cahaya dan suhu warna melompat antar bidikan dalam adegan yang sama
Cahaya tertanam: lembar atau pelat membawa pencahayaan dramatis yang diwarisi setiap bidikan dan kemudian bertentangan dengan pencahayaan storyboard itu sendiri
Lapisan 2: referensi tidak netral
Posisi, tindakan, dan properti tidak terhubung di dalam satu segmen; orang yang tidak ada dalam adegan masuk ke dalam bingkai
Tidak ada jangkar antar bidikan: kesinambungan tidak ditulis, atau storyboard menyebut orang yang tidak ada dengan frasa negatif ("X keluar bingkai")
Lapisan 3: kesinambungan
Lapisan 1: lembar karakter
Lembar dibuat untuk pengenalan, bukan untuk suasana. Empat aturan tegas:
Latar belakang putih murni, sebagai klausa tersendiri. Nyatakan sebagai batasan mandiri dan ulangi dalam daftar negatif. Jika terkubur di paragraf lain, aturan ini akan ditimpa.
Jangan cahaya datar. "Pencahayaan merata, tanpa bayangan" adalah resep untuk wajah plastik: cahaya datar menghapus tekstur kulit dan struktur tulang. Tulis satu cahaya kunci searah di sekitar 75 derajat dengan cahaya pengisi dan cahaya tepi, dan minta bayangan di bawah hidung dan tulang pipi, cahaya pantul di mata, dan penurunan cahaya yang bertahap.
Identitas diutamakan. Urutan prompt tetap: fitur identitas subjek → kunci identitas (tidak ada wajah influencer, tidak ada penghalusan fitur khas) → blok teknis → batasan pembingkaian. Analisis naskah menghasilkan teks penampilan yang sangat detail (struktur tulang, tahi lalat, bekas luka); teks ini harus memimpin, bukan diletakkan di tengah.
Wajah > postur > kostum, dan ekspresi harus berakting. Nyatakan bahwa ini adalah uji tampilan aktor, bukan bidikan pakaian e-commerce; larang menarik bingkai mundur untuk menunjukkan pakaian dengan mengorbankan bagian kepala. Jangan tulis "ekspresi netral": hal itu menghapus kualitas yang justru membuat karakter dikenali (misalnya tatapan tajam seperti bilah).
Kegagalan umum: karakter dengan mantel panjang atau jubah tertelan oleh pakaian dalam bingkai penuh tubuh 9:16, mantel memenuhi tujuh puluh persen gambar dan wajah mengecil. Itu adalah batas fisik pembingkaian. Solusinya adalah lembar setengah tubuh terpisah yang membawa wajah, dengan biaya satu gambar tambahan per karakter.
Di SceneMixer, kolom penampilan yang dihasilkan oleh analisis naskah langsung menjadi subjek prompt lembar. Setiap karakter mendapatkan satu lembar penuh tubuh 9:16 dengan latar putih, dengan potongan wajah dan setengah tubuh yang dipotong otomatis, dan setiap pembuatan video selanjutnya melampirkan referensi karakter tersebut. Sebelum menilai kualitas lembar, konfirmasikan model gambar mana yang menghasilkannya: ukuran output dan prior sangat berbeda antar model, dan buktinya adalah dimensi gambar serta catatan tugas, bukan tebakan.
Lapisan 2: pelat adegan
Gambar adegan adalah "pelat" kosong yang dirujuk oleh model video. Standarnya kembali ke netralitas:
Tidak ada orang. Nyatakan skala dengan bagian bangunan itu sendiri (pintu setinggi dua orang, meja selebar satu lengan).
Tiga bidang kedalaman. Latar depan, tengah, dan belakang masing-masing dengan material dan tata rias eksplisit, sehingga model memiliki ruang untuk menempatkan kamera.
Deskripsikan dari mana cahaya berasal, bukan di mana cahaya jatuh. Tulis "lampu gantung putih hangat memancarkan cahaya lembut ke bawah dari kanan atas", bukan "cahaya menerangi permukaan meja". Jangan tulis garis batas bayangan, dan hindari kata warna jenuh: 3200 K pada kulit adalah putih hangat, dan "kuning" akan menghasilkan cat kuning.
Tidak ada grading suasana. Tidak ada grading suasana hati, siluet, kabut, atau berkas cahaya, dan tidak ada kata pemicu lama (sinematik, dramatis, 8K). Kabut di pelat akan muncul di setiap bidikan adegan tersebut.
Arah seni adalah pengaturan tingkat proyek yang memberi makan gambar adegan, gambar properti, dan prompt video, dan tidak pernah masuk ke lembar karakter, jika tidak lembar latar putih akan disinari seperti set.
Lapisan 3: kesinambungan dalam storyboard
Segmen panjang, shot pendek. Satu segmen adalah satu kali panggilan generasi dan durasinya harus mendekati batas 15 detik; tingkatkan tempo dengan memperpendek tiap shot, bukan dengan memotong segmen. Setiap segmen tambahan akan memulai ulang posisi dari frame pertama baru dan merusak kesinambungan.
Bawa kesinambungan di dalam segmen. Posisi duduk karakter, benda yang dipegang, dan apa yang sedang dilakukan di akhir shot sebelumnya adalah titik awal shot berikutnya.
Tulis hanya karakter yang ada di frame. Jangan pernah menyebut orang yang tidak ada. Kalimat seperti "Mark keluar" atau "Anna tidak hadir" justru meningkatkan kemungkinan mereka muncul, karena kata benda di dalam kalimat negasi bertindak sebagai penarik perhatian model.
Pencahayaan berdasarkan penyebab. Aturannya sama dengan plate. Posisi cahaya, media, dan grade masing-masing ditulis satu kali, tanpa pengulangan dan tanpa konflik.
Input referensi berdasarkan model
Model
Input referensi
Durasi klip
Catatan
Diverifikasi
Seedance 2.0 (Volcano Engine Ark)
Teks ditambah referensi gambar, video, dan audio; gambar dapat berupa frame pertama, frame terakhir, atau referensi karakter
4–15 dtk
Audio asli; gambar hingga 30 MB dan 300–6000 px per sisi; salah satu jalur video di SceneMixer
2026-09-05, sesuai dokumentasi Ark API
Wan 3.0 (Alibaba Cloud Model Studio)
Hingga 10 gambar referensi, 5 video referensi, dan 5 audio referensi per permintaan; prompt hingga 20.000 karakter
2–30 dtk
480P / 720P / 1080P; generasi yang gagal tidak dikenakan biaya; jalur video lainnya di SceneMixer
2026-09-05, sesuai dokumentasi Model Studio API
Model video lainnya
Sebagian besar menerima referensi gambar atau frame pertama/terakhir
Bervariasi
Batasan sering berubah; apa pun modelnya, metode lembar putih ditambah plate netral tetap sama
2026-09-05
Hanya sel yang terverifikasi yang diisi; sel kosong adalah kosong, bukan tebakan. Yang menentukan konsistensi bukanlah apakah batasnya 9 referensi atau 50, melainkan apakah sedikit referensi yang Anda lampirkan bersifat netral.
Daftar periksa penerimaan: lima shot dari karakter yang sama berdampingan
☐ Bentuk wajah, alis, mata, hidung, dan bibir terbaca sebagai orang yang sama di kelima shot.
☐ Penanda visual (bekas luka, tahi lalat, perhiasan, potongan rambut) ada dan di posisi yang sama di setiap shot.
☐ Dalam satu adegan, arah cahaya dan suhu warna cocok; tidak ada shot hangat di samping shot dingin.
☐ Kostum dan properti tangan berkesinambungan di dalam segmen, tidak ada yang muncul atau menghilang.
☐ Tidak ada karakter yang seharusnya tidak hadir tiba-tiba masuk; tidak ada pemeran utama kedua yang muncul.
☐ Kulit memiliki tekstur dan bayangan bertahap, bukan permukaan plastik yang datar.
Saat sebuah shot gagal, kembali ke lapisan yang dipetakan dan perbaiki lapisan itu. "Perkuat prompt" bukanlah perbaikan.
Mengapa gambar referensi karakter perlu latar belakang putih?
Karena apa pun cahaya dan latar belakang yang tertanam di referensi akan diwarisi oleh setiap shot tempat karakter itu muncul. Lembar yang difoto di bawah cahaya malam dingin membuat adegan siang hari bergeser ke warna dingin; properti di latar belakang bisa tergambar ulang sebagai bagian dari karakter. Latar belakang putih dengan satu key light searah sekitar 75 derajat hanya merekam struktur wajah dan tidak membawa informasi adegan, sehingga pencahayaan shot apa pun dapat menimpanya.
Bagaimana cara memperbaiki karakter yang tidak konsisten di video AI?
Diagnosa berdasarkan lapisan sebelum menyentuh prompt. Wajah yang berbeda antar shot adalah masalah lembar karakter: periksa apakah pencahayaan datar atau wajah terlalu kecil di frame. Wajah sudah benar tapi cahaya kostum melompat-lompat berarti plate adegan atau pencahayaan shot saling bertabrakan. Posisi dan aksi yang tidak nyambung di dalam satu segmen disebabkan oleh kurangnya kesinambungan di storyboard. Setiap lapisan punya perbaikan sendiri; menulis ulang satu prompt besar justru memperburuk ketiganya.
Bisakah saya menjaga karakter tetap konsisten hanya dengan mendeskripsikan wajah di setiap prompt?
Tidak. Dalam puluhan generasi, deskripsi akan terencerkan oleh instruksi aksi, latar, dan pencahayaan tiap segmen, dan model akan kembali ke wajah menarik yang generik. Metode yang stabil adalah melampirkan lembar karakter yang sama sebagai gambar referensi ke setiap generasi dan membiarkan teks hanya memuat aksi dan emosi segmen tersebut.
Berapa banyak gambar referensi yang dibutuhkan setiap karakter?
Minimal satu lembar seluruh tubuh 9:16 di latar putih. Karakter utama akan lebih baik jika ditambah potongan wajah untuk close-up. Karakter dengan mantel panjang atau jubah cenderung tertutup kostum dalam frame seluruh tubuh, jadi lembar setengah badan yang menampilkan wajah layak ditambahkan.
Tiga lapisan sudah terpasang di dalam alur kerja
Teks tampilan dari hasil analisis menjadi subjek lembar; lembar putih dan plate netral ikut terbawa di setiap segmen yang Anda hasilkan.