AI 숏드라마 캐릭터 일관성 (2026): 샷마다 얼굴이 바뀌는 이유와 이를 고정하는 세 가지 레이어
2026년 9월 12일 업데이트
간단히 답하자면: AI 숏드라마에서 캐릭터 일관성이란 한 캐릭터가 시리즈의 수십~수백 개 샷 전반에 걸쳐 동일한 얼굴, 동일한 의상과 소품, 동일한 아트 디렉션을 유지하는 것을 뜻합니다. 2026년 현재 이는 플랫폼과 시청자가 AI 제작 시리즈를 거절하는 첫 번째 이유입니다. 프롬프트 문구만으로는 해결되지 않습니다. 이는 세 개의 분리된 레이어에서 고정됩니다: 캐릭터 시트(흰 배경, 방향성 조명, 정체성 특징 우선), 씬 플레이트(빈 세트, 세 개의 심도 평면, 빛이 닿는 위치가 아니라 광원을 묘사), 그리고 스토리보드 내 샷 간 연속성(행동과 위치를 이어가고, 프레임 안에 없는 인물은 절대 언급하지 않음)입니다. 얼굴 드리프트에는 세 가지 근본 원인이 있으며 각각 하나의 레이어에 대응합니다: 텍스트 설명이 희석되거나, 레퍼런스에 내장된 조명이 따라오거나, 샷 사이에 앵커가 없는 경우입니다. 아래에 각 레이어에서 해야 할 일, 레퍼런스 입력 표, 5샷 수용 체크리스트를 정리했습니다.
샘플: “독수의 맹세” — 사실적인 HD, 에피소드 1개, 대본부터 SceneMixer 파이프라인으로 엔드투엔드 제작 · 에피소드 보기
"일관성"이 의미하는 것: 세 가지 레이어
정체성 특징: 얼굴형, 눈썹과 눈, 코와 입술, 피부톤, 머리카락, 체형, 보이는 나이, 그리고 즉시 알아볼 수 있는 앵커 하나(흉터, 점, 장신구, 헤어스타일). 캐릭터 시트가 이를 담당합니다.
의상, 분장, 소품: 해당 장면에서 캐릭터가 입고 들고 있는 것, 세트에 포함된 것. 대본 분석에서 나온 캐릭터별 의상 설명과 씬 플레이트가 이를 담당합니다. 의상은 시리즈 전체에 통일된 스타일 태그가 아니라 캐릭터별, 사회 계층별로 지정합니다.
조명과 아트 디렉션: 색상 규율, 재질, 세트 드레싱 밀도, 광원의 위치. 씬 플레이트와 각 샷의 조명 라인이 이를 담당합니다. 레퍼런스 이미지 자체는 중립을 유지해야 합니다.
얼굴이 드리프트하는 이유: 세 가지 근본 원인
증상
근본 원인
레이어
같은 캐릭터가 몇 개 segment마다 새 얼굴을 가지며 서서히 평범해짐
희석된 설명: 긴 행동 묘사와 기술 지시 중간에 얼굴 설명이 묻혀서 모델이 자체의 "매력적인 얼굴" 사전 분포로 돌아감
레이어 1: 시트 프롬프트에서 정체성이 맨 앞에 있지 않거나, 모든 생성 시 시트를 레퍼런스로 첨부하지 않음
얼굴은 맞는데 같은 장면 샷 사이에서 조명과 색온도가 튐
내장된 조명: 시트나 플레이트에 극적인 조명이 담겨 있어 모든 샷이 이를 물려받은 뒤 스토리보드 자체 조명과 충돌함
레이어 2: 레퍼런스가 중립적이지 않음
한 segment 내에서 위치, 행동, 소품이 연결되지 않고 장면에 없는 사람이 들어옴
샷 사이 앵커 없음: 연속성을 적지 않았거나, 스토리보드에서 부재 중인 인물을 부정적 표현("X가 프레임 밖으로 나감")으로 이름을 언급함
레이어 3: 연속성
레이어 1: 캐릭터 시트
시트는 분위기가 아니라 알아보기 위해 존재합니다. 네 가지 엄격한 규칙:
순수 흰 배경을 독립된 조항으로 명시하세요. 독립된 제약으로 적고 부정 리스트에도 반복하세요. 다른 문단에 묻어두면 무시됩니다.
플랫 라이트를 쓰지 마세요. "그림자 없이 고른 조명"은 플라스틱 얼굴 레시피입니다: 플랫 라이트는 피부 질감과 골격을 지웁니다. 대략 75도 방향의 키 라이트 하나에 필과 림을 넣고, 코와 광대뼈 아래 그림자, 캐치라이트, 점진적인 폴오프를 요청하세요.
정체성을 먼저 두세요. 프롬프트 순서를 고정하세요: 피사체 정체성 특징 → 정체성 고정(인플루언서 얼굴 금지, 특징적인 요소 스무딩 금지) → 기술 블록 → 프레이밍 제약. 대본 분석은 아주 상세한 외형 텍스트(골격, 점, 흉터)를 산출하는데, 이는 중간이 아니라 맨 앞에 와야 합니다.
얼굴 > 자세 > 의상 순서로 두고, 표정은 연기되어야 합니다. 이것이 배우 룩 테스트지 전자상거래 의상 샷이 아님을 선언하세요; 머리를 희생하고 의상을 보여주기 위해 뒤로 당기는 것을 금지하세요. "무표정"이라고 적지 마세요: 그건 캐릭터를 알아보게 만드는 바로 그 자질(예를 들어 칼날 같은 시선)을 지워버립니다.
알려진 실패 케이스: 긴 코트나 로브를 입은 캐릭터가 9:16 전신 프레임에서 옷에 삼켜져, 코트가 이미지의 70퍼센트를 채우고 얼굴이 작아집니다. 이는 프레이밍의 물리적 한계입니다. 해결책은 캐릭터당 이미지 하나를 더 쓰는 대가로 얼굴을 담은 별도의 반신 시트를 만드는 것입니다.
SceneMixer에서는 대본 분석으로 생성된 외형 필드가 시트 프롬프트의 피사체로 바로 들어갑니다. 각 캐릭터는 흰 배경의 9:16 전신 시트 하나를 받고, 얼굴과 반신 크롭이 자동으로 잘리며, 이후 모든 비디오 생성에 해당 캐릭터의 레퍼런스가 첨부됩니다. 시트 품질을 판단하기 전에 어떤 이미지 모델이 생성했는지 확인하세요: 모델마다 출력 크기와 사전 분포가 크게 다르며, 그 증거는 추측이 아니라 이미지 크기와 작업 기록입니다.
레이어 2: 씬 플레이트
씬 이미지는 비디오 모델이 참조하는 빈 "플레이트"입니다. 기준은 다시 중립성입니다:
사람 없음. 건물 자체 구성요소(두 사람 키 높이의 문, 팔 하나 너비의 탁자)로 규모를 표현하세요.
세 개의 심도 평면. 전경, 중경, 배경 각각에 명시적인 재질과 드레싱을 넣어 모델이 카메라를 배치할 공간을 주세요.
빛이 닿는 위치가 아니라 빛이 오는 곳을 묘사하세요. "따뜻한 흰색 펜던트가 오른쪽 위에서 부드러운 빛을 아래로 던진다"고 쓰고, "탁자 위를 밝게 비춘다"고 쓰지 마세요. 그림자 경계선을 적지 말고, 채도가 높은 색 단어를 피하세요: 피부 위 3200K는 따뜻한 흰색인데 "노란색"이라고 쓰면 노란 페인트가 나옵니다.
분위기 그레이딩 없음. 무드 그레이딩, 실루엣, 안개, 광선 효과를 넣지 말고, 오래된 트리거 단어(cinematic, dramatic, 8K)도 쓰지 마세요. 플레이트의 안개는 해당 장면의 모든 샷에 나타납니다.
아트 디렉션은 씬 이미지, 소품 이미지, 비디오 프롬프트에 들어가는 프로젝트 수준 설정이며, 절대 캐릭터 시트에는 들어가지 않습니다. 그렇지 않으면 흰 배경 시트가 세트처럼 조명됩니다.
레이어 3: 스토리보드 내 연속성
긴 세그먼트, 짧은 샷. 한 세그먼트는 한 번의 생성 호출이며 15초 상한에 가깝게 만들어야 합니다. 세그먼트를 잘게 나누지 말고 개별 샷을 짧게 해서 속도를 올리세요. 세그먼트가 하나 추가될 때마다 새 첫 프레임에서 위치가 다시 시작되고 연속성이 깨집니다.
세그먼트 내에서 이어가기. 이전 샷 마지막에 캐릭터가 앉아 있던 자세, 들고 있던 물건, 하던 행동이 그대로 다음 샷의 시작점이 됩니다.
프레임 안 인물만 적기. 없는 사람을 절대 언급하지 마세요. "마크가 퇴장"이나 "애나는 없음"이라고 적으면 오히려 그 인물이 등장할 확률이 올라갑니다. 부정문 안의 명사도 유인 요소로 작용하기 때문입니다.
원인 기준 조명. 플레이트와 같은 규칙입니다. 조명 위치, 매개체, 등급을 각각 한 번씩만 적고 반복하거나 충돌하지 않게 하세요.
모델별 레퍼런스 입력
모델
레퍼런스 입력
클립 길이
참고
확인일
Seedance 2.0 (Volcano Engine Ark)
텍스트 + 이미지, 영상, 오디오 레퍼런스; 이미지는 첫 프레임, 마지막 프레임 또는 캐릭터 레퍼런스로 사용 가능
4–15초
네이티브 오디오 지원; 이미지는 최대 30MB, 변 길이 300–6000px; SceneMixer의 영상 경로 중 하나
2026-09-05, Ark API 문서 기준
Wan 3.0 (Alibaba Cloud Model Studio)
요청당 레퍼런스 이미지 최대 10장, 레퍼런스 영상 최대 5개, 레퍼런스 오디오 최대 5개; 프롬프트 최대 20,000자
2–30초
480P / 720P / 1080P; 생성 실패 시 과금되지 않음; SceneMixer의 다른 영상 경로
2026-09-05, Model Studio API 문서 기준
기타 영상 모델
대부분 이미지 레퍼런스 또는 첫/마지막 프레임을 지원
다양함
제한 사항은 자주 바뀝니다; 어떤 모델이든 흰 배경 시트 + 중립 플레이트 방식은 동일합니다
2026-09-05
검증된 셀만 채웠습니다; 빈칸은 추측이 아니라 그대로 빈칸입니다. 일관성을 결정하는 건 레퍼런스가 9개인지 50개인지가 아니라, 첨부하는 소수의 레퍼런스가 중립적인가입니다.
합격 체크리스트: 같은 캐릭터 샷 다섯 개를 나란히 놓고
☐ 얼굴형, 눈썹, 눈, 코, 입이 다섯 샷 모두 동일 인물로 보인다.
☐ 시각적 앵커(흉터, 점, 장신구, 머리모양)가 모든 샷에 같은 위치에 있다.
☐ 한 장면 안에서 조명 방향과 색온도가 일치한다; 따뜻한 샷 바로 옆에 차가운 샷이 없다.
☐ 의상과 손 소품이 세그먼트 내에서 이어지며, 갑자기 나타나거나 사라지지 않는다.
☐ 없는 캐릭터가 걸어 들어오지 않는다; 두 번째 "주인공"이 등장하지 않는다.
☐ 피부에 질감과 점진적인 음영이 있고, 평평한 플라스틱 같지 않다.
샷이 실패하면 매핑된 레이어로 돌아가 그 레이어를 고치세요. "프롬프트를 강화하기"는 수정 방법이 아닙니다.
레퍼런스에 담긴 조명과 배경이 그 캐릭터가 등장하는 모든 샷에 상속되기 때문입니다. 차가운 야간 조명 아래에서 찍은 시트는 낮 장면을 차갑게 만들고, 배경의 소품이 캐릭터의 일부로 다시 칠해집니다. 약 75도 각도의 방향성 키 라이트 하나만 쓴 흰 배경은 얼굴 구조만 기록하고 장면 정보를 담지 않아, 어떤 샷의 조명도 이를 덮어쓸 수 있습니다.
AI 영상에서 캐릭터가 일관되지 않을 때 어떻게 고치나요?
프롬프트를 건드리기 전에 레이어별로 진단하세요. 샷마다 얼굴이 다르면 캐릭터 시트 문제입니다: 플랫한 조명이거나 프레임에서 얼굴이 너무 작은지 확인하세요. 얼굴은 맞는데 의상 조명이 튀면 장면 플레이트와 샷 조명이 서로 충돌하는 겁니다. 한 세그먼트 안에서 위치와 행동이 이어지지 않으면 스토리보드의 연속성이 빠진 겁니다. 각 레이어에는 저마다의 수정법이 있습니다; 큰 프롬프트 하나를 다시 쓰면 세 문제를 모두 악화시킵니다.
매 프롬프트마다 얼굴을 묘사하는 것만으로 캐릭터를 일관되게 유지할 수 있나요?
아니요. 수십 번 생성을 거치면 묘사가 각 세그먼트의 행동, 배경, 조명 지시에 희석되어 모델이 평범한 미형 얼굴로 되돌아갑니다. 안정적인 방법은 모든 생성에 동일한 캐릭터 시트를 레퍼런스 이미지로 첨부하고, 텍스트에는 해당 세그먼트의 행동과 감정만 담는 것입니다.
캐릭터마다 레퍼런스 이미지가 몇 장 필요한가요?
최소한 흰 배경의 9:16 전신 시트 한 장이 필요합니다. 주요 캐릭터는 클로즈업용 얼굴 크롭을 추가로 쓰면 좋습니다. 긴 코트나 로브를 입은 캐릭터는 전신 프레임에서 옷에 얼굴이 묻히기 쉬우므로, 얼굴이 잘 보이는 별도의 반신 시트를 추가 이미지로 준비할 가치가 있습니다.
세 레이어가 파이프라인에 내장되어 있습니다
분석된 외형 텍스트가 시트의 주제가 되며, 흰 배경 시트와 중립 플레이트가 생성하는 모든 세그먼트에 함께 적용됩니다.