SceneMixer
한국어
무료 가입

말하는 캐릭터

말하는 캐릭터가 등장하는 AI 영상

2026년 9월 20일 업데이트

간단한 답변: 음성은 립싱크로 무음 영상에 입혀지는 게 아니라 화면과 한 번에 생성됩니다. 각 컷에는 대사가 그대로 담기며, 지정된 화자는 안정적인 라이브러리 음성, 짧은 연출 지시, 프레임 속 다른 인물은 입을 다물고 있다는 명시적 노트와 함께 연결됩니다. 대사 컷에는 최소 타이밍 기준이 있어 영어 기준 초당 3단어보다 짧게 대사가 뭉개지지 않습니다.
SceneMixer가 엔드투엔드 생성한 AI 숏드라마 “스타폴 커맨드”의 스틸컷 (캐릭터 7명, 에피소드 1개)
샘플: “스타폴 커맨드” — 사실적인 HD, 에피소드 1개, 대본부터 SceneMixer 파이프라인으로 엔드투엔드 제작 · 에피소드 보기

음성은 화면과 같은 생성 과정에서 나옵니다

화면 속 캐릭터가 말하게 하는 방식은 두 가지입니다. 하나는 무음 영상을 렌더링한 뒤 오디오 트랙으로 입을 움직이는 립싱크 방식으로, 얼굴 크롭과 구동용 오디오 파일이 필요하고 입은 정확히 움직이지만 몸은 연기하지 않습니다. 다른 하나는 화면과 소리를 함께 생성해 연기와 입 움직임이 하나의 결정으로 이뤄지는 방식입니다.

이 파이프라인은 후자를 사용합니다. 기본 영상 티어는 시청각 통합 생성입니다: 모델에 대사, 화자, 말하는 방식, 음성 레퍼런스를 전달하면 대사가 담긴 컷이 반환됩니다. 이후 별도로 이어 붙이는 과정은 없습니다.

한눈에 보기

말하는 컷에 전달되는 정보
대사그대로, 한 번만. 작성한 대로 정확히 말하며 바꿔 말하거나 타이밍을 재조정하지 않습니다.
화자이름으로 지정하고 해당 캐릭터의 음성 레퍼런스와 연결해 에피소드가 바뀌어도 같은 인물이 같은 목소리를 냅니다.
말하는 방식괄호 안 짧은 지시 — 작은 목소리로, 여전히 웃으며, 억지로 담담하게. 자막이 아니라 연출 지시입니다.
프레임 속 다른 인물입을 다물고 있다고 표시해 듣는 사람이 따라 입을 움직이지 않게 합니다.
화면 밖 음성괄호 맨 앞에 표시 — 내레이션, 전화 통화, 인터콤 — 그리고 보이는 모든 인물은 입을 다문 상태로 묘사합니다.
타이밍대사가 담긴 컷은 대사 길이보다 짧을 수 없습니다: 영어는 초당 3단어, 중국어는 초당 5자 기준입니다.

음성은 매칭 방식으로, 캐릭터마다 새로 합성하지 않습니다

각 캐릭터에는 미리 구축된 시스템 음성 라이브러리에서 음성을 할당합니다. 선택 전 3~8초 샘플을 들을 수 있고, 다시 매칭하거나 선택기에서 다른 음성을 고르거나 직접 녹음 파일을 업로드할 수도 있습니다. 캐릭터별 음성 디자인 대신 매칭을 쓰는 이유는 비용과 안정성 때문입니다: 디자인된 음성은 생성마다 달라지고 캐릭터별 비용이 들지만, 라이브러리 음성은 1화에서 12화까지 같은 목소리로 유지됩니다.

캐릭터에 음성이 할당되지 않으면 나이, 음색, 음역 같은 목소리에 대한 글 설명으로 폴백해 모델이 이를 해석합니다. 이게 새 프로젝트의 기본값이며, 음성 할당은 모든 캐릭터에 자동으로 이뤄지는 게 아니라 직접 진행하는 단계입니다.

타이밍 규칙과 그 이유

4초 컷에 영어 16단어를 담을 수는 없습니다. 말이 뭉개져 알아듣지 못하게 되거나 대사가 잘리기 때문입니다. 그래서 대사 컷에는 대사 기반의 최소 길이가 있습니다: 영어는 단어 수를 3으로 나누고, 중국어는 글자 수를 5로 나눕니다. 짧은 대사는 이론적 최소 길이로 압축하지 않고 위에 쉼을 더합니다. 대사보다 짧게 나온 컷은 렌더링 전에 플래그를 달아 수정하는데, 결과물에서 문제를 발견하는 것보다 비용이 적게 들기 때문입니다.

언어

대사 언어는 프로젝트 설정에서 한 번 선택하며, 대사를 처음 쓸 때 적용돼 나중에 더빙처럼 번역되지 않습니다. 즉 해당 언어로 연기가 만들어집니다. 인터페이스 언어는 15개를 지원하며 대사도 이들 언어로 지원됩니다. 기본 모델 티어에서 일부 언어는 개별 단어 발음이 가끔 틀릴 수 있으며, 해당 경우 선택기에 그 사실이 표시됩니다. 자세한 내용은 캐릭터 음성 페이지를 참고하세요.

지원하지 않는 기능

비용

음성은 영상 가격에 포함돼 별도 오디오 비용이 없습니다. 영상은 출력 초당 10 크레딧(최저 크레딧 단가 기준 약 $0.06/s)부터 시작해 가장 고화질 티어에서는 $0.47/s까지이며, 조립 비용은 초당 1 크레딧입니다. 라이브러리 음성 매칭은 무료입니다. 신규 계정에는 50 크레딧과 최대 5초 무료 프리뷰 1회가 제공돼 결정 전 캐릭터 목소리를 들어볼 수 있습니다. 요금은 가격 페이지에서 확인하세요.

언어

15개 언어 원어민 대사

아래 모든 시리즈는 동일한 파이프라인으로 제작되었으며, 출연진이 해당 언어를 원어민 수준으로 구사합니다. 인터페이스, 작업 문서, 대사까지 모두 같은 언어로 제공되며 더빙은 전혀 사용되지 않습니다. 직접 열어서 들어보세요.

15개 언어 모두 보기

자주 묻는 질문

이게 립싱크인가요?

아닙니다. 화면과 음성이 한 번에 함께 생성되므로 입 움직임과 연기가 하나의 결정으로 이뤄집니다. 무음 렌더링에 별도 오디오 트랙을 맞추는 과정이 없으며, 사진이나 업로드한 영상을 구동할 수도 없습니다.

내 목소리를 쓸 수 있나요?

녹음 파일을 캐릭터 음성 레퍼런스로 업로드할 수 있습니다. 다른 사람의 목소리를 클로닝하는 기능은 제공하지 않습니다.

컷 속에서 듣고 있는 사람도 입을 움직이나요?

움직이지 않아야 합니다 — 프레임 속 말하지 않는 모든 캐릭터는 입을 다물고 있다고 명시적으로 표시되며, 이 지시가 듣는 사람이 대사에 맞춰 입을 움직이는 걸 막습니다.

내레이션과 전화 통화는 어떻게 처리되나요?

연출 노트 맨 앞에 화면 밖 표시를 적고, 컷에 보이는 모든 인물은 입을 다문 상태로 묘사합니다 — 그래서 아무도 말하는 모습 없이 대사만 들리게 됩니다.

대사 컷이 제가 적은 것보다 깁니다. 왜 그런가요?

대사에 시간이 필요하기 때문입니다. 대사가 담긴 컷에는 영어 기준 초당 약 3단어, 중국어 기준 초당 약 5자의 최소 길이가 있으며, 아주 짧은 대사에는 쉼이 더해집니다. 대사보다 짧은 컷은 렌더링 후가 아니라 전에 수정됩니다.

에피소드를 확정하기 전 캐릭터 목소리 들어보기

무료 미리보기는 대사 한 줄 분량으로 충분합니다.

SceneMixer 무료로 체험하기

크레딧 패키지 $1.49부터 · Pro $7.99/월 · 시작할 때 신용카드 필요 없음

요금·가이드·샘플·지원·개인정보 처리방침·이용약관·법적 고지·문의하기·© 2026 SceneMixer