首頁 › 使用指南 › AI 短劇角色一致性:3 層架構
指南 · 製作
AI 短劇角色一致性(2026):為什麼鏡頭之間臉會變,以及鎖定一致性的三層架構 更新於 September 12, 2026
快速回答: AI 短劇的角色一致性,指的是同一個角色在一部劇數十到數百個鏡頭中,維持相同的長相、相同的服裝與道具,以及一致的美術風格。到了 2026 年,這已經是平臺和觀眾拒看 AI 劇集的首要原因。這個問題光靠調整提示詞用字解決不了,必須在三個獨立層級分別鎖定:角色設定圖(白底、方向性打光、優先放身份特徵)、場景底圖(空場景、三層景深、描述光源位置而非光線落點),以及分鏡(分集分鏡腳本)內部的鏡頭連戲(動作與位置要承接,絕對不要提到畫面裡沒有的人)。臉部漂移有三個根本原因,各自對應一個層級:文字描述被稀釋、參考圖帶有內建光線、鏡頭之間沒有錨點。以下會說明每個層級該怎麼做、附上參考圖輸入對照表,以及 5 鏡頭驗收檢查清單。
範例:《老鷹之誓》— 真人寫實高清畫質,1 集,由 SceneMixer 從劇本端到端產出 · 觀看集數
「一致」是什麼意思:三個層級
身份特徵 :臉型、眉眼、鼻唇、膚色、髮型、體態、視覺年齡,再加上一個一眼就能認出的記號(疤痕、痣、一件首飾、特殊髮型)。由角色設定圖承載。
服裝、妝容與道具 :這個角色在這場戲穿什麼、拿什麼,以及場景裡有什麼東西。由劇本分析產出的各角色服裝描述,加上場景底圖共同承載。服裝是依角色、依社會階級設定的,不是整部劇套一個風格標籤就好。
光線與美術方向 :色彩紀律、材質、場景佈置密度、光源位置。由場景底圖和每個鏡頭的光線描述共同承載。參考圖本身必須維持中性。
為什麼臉會漂移:三個根本原因
症狀 根本原因 對應層級
同一個角色每隔幾段(一段視頻)就換一張臉,慢慢變得大眾臉 描述被稀釋:臉部描述被埋在長串動作與技術指令中間,模型就會退回它預設的「好看的臉」先驗 第一層:身份特徵沒有放在設定圖提示詞的最前面,或者不是每次生成都掛上設定圖當參考
臉是對的,但同一場戲不同鏡頭之間光線和色溫跳來跳去 內建光線:設定圖或底圖帶有強烈戲劇性光線,每個鏡頭都會繼承這道光,然後和分鏡(分集分鏡腳本)自己的光線設定打架 第二層:參考圖不中性
同一段(一段視頻)裡位置、動作、道具接不起來;不在這場戲的人走進畫面 鏡頭之間沒有錨點:沒寫連戲設定,或者分鏡(分集分鏡腳本)用否定語句提到不在場的人(例如「X 離開畫面」) 第三層:連戲
第一層:角色設定圖
設定圖的目的是讓人認得出角色,不是營造氣氛。四條鐵則:
純白背景,單獨寫成一條。 要當成獨立約束條件寫,還要在負面清單裡再寫一次。如果埋在別的段落裡,就會被覆蓋掉。
不要平光。 「光線均勻、沒有陰影」是做出塑膠臉的食譜:平光會消掉皮膚質感和骨骼結構。要寫一盞大約 75 度的方向性主光,加上補光和輪廓光,要求鼻子和顴骨下方有陰影、眼睛裡有眼神光、光線逐漸衰減。
身份優先。 固定提示詞順序:主體身份特徵 → 身份鎖定(不要網美臉、不要抹平辨識度高的特徵) → 技術區塊 → 構圖約束。劇本分析會產出非常細的外觀描述(骨骼結構、痣、疤痕);這些內容必須放在最前面,不能塞在中間。
臉 > 姿態 > 服裝,表情要有戲。 要寫明這是演員的定裝 look test,不是電商服裝拍攝;禁止為了帶到全身服裝就拉遠鏡頭、把頭拍小。不要寫「中性表情」:那會把角色最容易被認出的特質(比如刀一樣銳利的眼神)直接抹掉。
已知坑: 穿長大衣或長袍的角色,在 9:16 全身畫面裡會被衣服吞掉,大衣佔掉畫面七成,臉縮得很小。這是構圖的物理限制。解法是另外做一張半身設定圖專門帶臉,代價是每個角色多一張圖。
在 SceneMixer 裡,劇本分析產出的外觀欄位會直接成為設定圖提示詞的主體。每個角色會有一張 9:16 白底全身設定圖,系統自動裁切臉部和半身特寫,之後每次生成影片都會自動掛上該角色的參考圖。在判斷設定圖品質之前,先確認是哪個圖像模型生成的:不同模型的輸出尺寸和先驗差很多,判斷依據是圖片尺寸和任務紀錄,不要用猜的。
第二層:場景底圖
場景圖是影片模型參考的空「底圖」。標準同樣是中性:
不要有人。 用建築本身的構件表達比例(一扇兩人高的門、一張單臂寬的桌子)。
三層景深。 前景、中景、背景各自寫明材質和佈置,模型才有空間放攝影機。
描述光從哪裡來,不要描述光落在哪裡。 寫「一盞暖白吊燈從右上方向下投下柔光」,不要寫「光照亮桌面」。不要寫陰影分界線,避免用高飽和的顏色詞:皮膚上的 3200 K 是暖白,寫「黃色」就會給你黃油漆。
不要氛圍調色。 不要情緒調色、剪影、霧氣或光束,也不要用那些老套觸發詞(電影感、戲劇性、8K)。底圖裡的霧,會出現在那場戲的每一個鏡頭裡。
美術方向是專案層級的設定,會餵給場景圖、道具圖和影片提示詞,絕對不要餵給角色設定圖 ,否則白底設定圖會被打成像片場一樣的光。
第三層:分鏡(分集分鏡腳本)裡的連戲
片段要長,鏡頭要短。 一個片段就是一次生成呼叫,長度要盡量接近15秒上限;想加快節奏,就縮短每個鏡頭的長度,而不是把片段切得更碎。每多切一個片段,位置就會從新的第一幀重新開始,連貫性就會斷掉。
在片段內部接續狀態。 上一個鏡頭結尾時角色坐在哪、手上拿什麼、正在做什麼,下一個鏡頭就要從同一個狀態開始。
只寫畫面裡有的角色。 絕對不要提到不在場的人。寫「馬克離開」或「安娜不在場」反而會提高他們出現的機率,因為否定句裡的名詞一樣會吸引模型生成對應內容。
用光要講明來源。 規則和場景底板一樣:光源位置、光線介質、色調各寫一次就好,不要重複,也不要互相矛盾。
各模型支援的參考輸入
模型 參考輸入 片段長度 備註 確認時間
Seedance 2.0(火山引擎 Ark) 支援文字加上圖片、影片、音訊參考;圖片可做首幀、尾幀或角色參考 4–15 秒 原生支援音訊;圖片單檔上限30 MB,邊長300–6000 px;SceneMixer 內其中一條影片生成路徑 2026-09-05,依 Ark API 文件
Wan 3.0(阿里雲 Model Studio) 每次請求最多10張參考圖、5段參考影片、5段參考音訊;提示詞最長20,000字元 2–30 秒 480P / 720P / 1080P;生成失敗不計費;SceneMixer 內另一條影片生成路徑 2026-09-05,依 Model Studio API 文件
其他影片模型 多數支援圖片參考或首幀/尾幀 不一定 限制經常變動;不管用哪個模型,白背景設定圖加中性底板的方法都一樣適用 2026-09-05
只有經過驗證的欄位才填內容;空白就是空白,不是用猜的。決定一致性的關鍵不是你能附9張還是50張參考圖,而是你附上的那幾張是不是中性的。
驗收檢查清單:同一角色五個鏡頭並排比對
☐ 五個鏡頭裡的臉型、眉毛、眼睛、鼻子、嘴唇看起來都是同一個人。
☐ 視覺錨點(疤痕、痣、首飾、髮型)每個鏡頭都存在,而且位置一樣。
☐ 同一場景內,光線方向和色溫一致;不會出現暖調鏡頭旁邊接冷調鏡頭的狀況。
☐ 服裝和手持道具在片段內連續,不會無故出現或消失。
☐ 不在場的角色不會走進來;也不會冒出第二個「主角」。
☐ 皮膚有質感和漸層陰影,不是扁平的塑膠感。
鏡頭生成失敗時,要回到它對應的分層去修正那一層。「加強提示詞」不是解法。
延伸閱讀
劇本本身怎麼建立一致性(每個地點只用一個名稱、每集不超過三四個場景),請看直式短劇劇本格式與開場鉤子結構 。揭露與肖像權相關規則請看2026 AI 短劇合規檢查清單 。想看實際完成的劇集怎麼套用這套方法,請打開範例短劇 :每一部都公開了演員設定圖,以及每個片段的腳本和影片。
常見問題
為什麼角色參考圖需要白色背景?
因為參考圖裡既有的光線和背景,會被帶進那個角色出現的每一個鏡頭。在冷色夜間光下拍的設定圖,會讓日間場景整個偏冷;背景裡的道具也會被模型算成角色的一部分。白色背景、加上大約75度角的單一方向主光,只會記錄臉部結構,不帶任何場景資訊,任何鏡頭的光線設定都能覆蓋它。
AI 影片裡角色不一致要怎麼修?
動提示詞之前,先按分層診斷問題。不同鏡頭長不同臉,是角色設定圖的問題:檢查是不是光線太平,或是臉在畫面裡太小。臉是對的,但服裝和光線跳來跳去,是場景底板和鏡頭光線互相打架。同一個片段裡位置和動作接不起來,是分鏡(分集分鏡腳本)沒做好連貫。每一層都有對應的修法;把所有東西塞進一個大提示詞重寫,只會讓三個問題都變得更糟。
我每個提示詞都描寫臉部,就能讓角色維持一致嗎?
不行。幾十次生成下來,描述會被每個片段的動作、場景、光線指令稀釋,模型最後就會退回通用的好看臉孔。穩定的做法是每次生成都附上同一張角色設定圖當參考,文字部分只負責寫該片段的動作和情緒。
每個角色需要幾張參考圖?
最少要有一張9:16、白背景的全身設定圖。主角可以多準備一張臉部裁切,給特寫鏡頭用。穿長大衣或長袍的角色,在全身畫面裡臉容易被服裝吃掉,多準備一張能清楚看見臉的半身設定圖會很有用。
相關指南
三層架構已內建在工作流程裡
分析出來的外觀文字會變成設定圖的主體;白背景設定圖和中性底板,會自動跟著你生成的每一個片段一起帶入。
免費註冊
決定之前,你可以先到範例短劇 看看同一個角色在不同鏡頭裡的表現。