SceneMixer
繁體中文
免費註冊

翻拍:系統如何從片段讀取台詞與音樂,以及最終會出現在你劇集裡的內容

簡單說:系統會把片段裡的每個鏡頭聽兩次:第一次由語音辨識判斷「有沒有人說話、說了什麼」,接著再交給描述鏡頭的模型,以辨識出的文字為基礎作業。因此台詞是直接引用,不是從嘴型猜的;沒有人說話的鏡頭會標記為靜音。如果片段有音樂,讀取時會記下它的風格,你之後生成的每個片段都會帶有同樣的簡短音樂提示,就像廣告一樣。對白語言會在上傳畫面選擇,讀取開始後就固定:台詞會以該語言寫入;如果原始片段說的是其他語言,就會翻譯成該語言。辨識器聽不清楚的台詞會直接留空;等分鏡生成後,你可以對照原始片段,在編輯器裡把它加回對應鏡頭。
AI 短劇《星隕指揮所》劇照,由 SceneMixer 端到端生成(7 位角色、1 集)
範例:《星隕指揮所》— 真人寫實高清畫質,1 集,由 SceneMixer 從劇本端到端產出 · 觀看集數

讀取完成後,請到步驟 3 打開該集,查看大綱:每個場景區塊都會以「說話者:台詞」的格式列出內容。

台詞是怎麼被聽到的

語音辨識會針對每個鏡頭各自的音訊執行。辨識到的內容會交給鏡頭描述模組,標示「這裡說了這些話」;描述器再依據畫面中的人臉判定說話者,並把台詞寫進該鏡頭。人聲底下的音樂會被妥善處理;但在人群中大喊、口音很重,或是台詞非常小聲的狀況下就容易失敗,這時系統會直接略過而不會編造內容。台詞接著會像劇本一樣出現在大綱裡:寫出容易被辨識的對白。

A storyboard segment: location, time and weather fields, then numbered shots with durations, asset chips and spoken lines
每個鏡頭都會被聽取;聽到的內容會被引用進讀取結果,最後成為大綱裡的台詞。

為什麼要用引用,而不是用猜的

如果完全交給視覺模型回答「這裡說了什麼」,同一個鏡頭有時聽得到、有時聽不到,而且不確定時還會編出看似合理的台詞。把辨識出的文字固定放進描述裡,就能避免這兩種問題;每次描述同一個鏡頭時,都會使用完全相同的文字。

音樂

讀取時會一次性判斷片段是否有音樂、是哪種類型。如果有,你生成的每個片段都會帶有一行符合該風格的音樂提示,讓生成出的片段具備同樣特質的音樂;原始音軌本身絕對不會被直接使用。環境音會被記錄,但不會沿用。音樂從哪裡來。

對白語言

對白語言在上傳畫面選擇,預設為你的介面語言(中文網站一律為中文),讀取開始後就固定不變。聽到的其他語言台詞會被翻譯成這個語言。翻拍一旦開始就無法事後更改,這也是為什麼步驟 1 沒有提供下拉選單。讀取完成之後。

當台詞漏掉或有錯時

大綱本身不能編輯,分鏡也會逐字照搬大綱裡的台詞。請先生成分鏡,再打開台詞所屬的片段,在那裡連同說話者一起新增或修正;說話者標錯的狀況也用同樣方式修正。編輯不收費。生成分鏡。

在片段中在讀取結果中在你的劇集裡
清楚的口說台詞引用內容,並標註說話者成為大綱裡的台詞
沒有人說話鏡頭標記為靜音沒有台詞
語音不清楚略過不寫手動在片段中補上
音樂記錄其風格每個片段都使用同風格的音樂
環境音會被記錄不沿用;分鏡會自行編寫

常見問題

為什麼會少一條台詞?

因為辨識器聽不出來。等分鏡建立後,請對照你的原始片段,在對應片段中手動補上。

會使用原始的人聲嗎?

不會。人聲來自演員的語音設定,和一般專案相同。

翻拍的對白可以和原始語言不同嗎?

可以。在上傳畫面選擇對白語言,讀取時就會把台詞翻譯成該語言。

原始音樂會被重複使用嗎?

不會。系統只會描述它的風格,再由各片段自行生成對應音樂。

為什麼人群喊叫沒有台詞?

群體雜訊會被視為背景音,而不是對白。

聽到、引用、寫入

片段裡說了什麼,你的劇集就會說什麼。

開始翻拍

更新於 2026 年 9 月 27 日

價格方案·使用指南·作品範例·支援服務·隱私權政策·服務條款·法律資訊·聯絡我們·© 2026 SceneMixer