
讀取完成後,請到步驟 3 打開該集,查看大綱:每個場景區塊都會以「說話者:台詞」的格式列出內容。
語音辨識會針對每個鏡頭各自的音訊執行。辨識到的內容會交給鏡頭描述模組,標示「這裡說了這些話」;描述器再依據畫面中的人臉判定說話者,並把台詞寫進該鏡頭。人聲底下的音樂會被妥善處理;但在人群中大喊、口音很重,或是台詞非常小聲的狀況下就容易失敗,這時系統會直接略過而不會編造內容。台詞接著會像劇本一樣出現在大綱裡:寫出容易被辨識的對白。

如果完全交給視覺模型回答「這裡說了什麼」,同一個鏡頭有時聽得到、有時聽不到,而且不確定時還會編出看似合理的台詞。把辨識出的文字固定放進描述裡,就能避免這兩種問題;每次描述同一個鏡頭時,都會使用完全相同的文字。
讀取時會一次性判斷片段是否有音樂、是哪種類型。如果有,你生成的每個片段都會帶有一行符合該風格的音樂提示,讓生成出的片段具備同樣特質的音樂;原始音軌本身絕對不會被直接使用。環境音會被記錄,但不會沿用。音樂從哪裡來。
對白語言在上傳畫面選擇,預設為你的介面語言(中文網站一律為中文),讀取開始後就固定不變。聽到的其他語言台詞會被翻譯成這個語言。翻拍一旦開始就無法事後更改,這也是為什麼步驟 1 沒有提供下拉選單。讀取完成之後。
大綱本身不能編輯,分鏡也會逐字照搬大綱裡的台詞。請先生成分鏡,再打開台詞所屬的片段,在那裡連同說話者一起新增或修正;說話者標錯的狀況也用同樣方式修正。編輯不收費。生成分鏡。
| 在片段中 | 在讀取結果中 | 在你的劇集裡 |
|---|---|---|
| 清楚的口說台詞 | 引用內容,並標註說話者 | 成為大綱裡的台詞 |
| 沒有人說話 | 鏡頭標記為靜音 | 沒有台詞 |
| 語音不清楚 | 略過不寫 | 手動在片段中補上 |
| 音樂 | 記錄其風格 | 每個片段都使用同風格的音樂 |
| 環境音 | 會被記錄 | 不沿用;分鏡會自行編寫 |
因為辨識器聽不出來。等分鏡建立後,請對照你的原始片段,在對應片段中手動補上。
不會。人聲來自演員的語音設定,和一般專案相同。
可以。在上傳畫面選擇對白語言,讀取時就會把台詞翻譯成該語言。
不會。系統只會描述它的風格,再由各片段自行生成對應音樂。
群體雜訊會被視為背景音,而不是對白。
更新於 2026 年 9 月 27 日