廣東話字幕時間軸怎麼調:對齊對白也要讀得完

立即體驗 AI 字幕生成

使用 CantoSub AI 為您的影片自動生成專業級字幕

字對了,觀眾仍跟不上——這通常不是辨識問題,而是時間軸問題。廣東話字幕時間軸管的是每一句何時出現、停留多久、與下一句隔多遠;它跟「每行幾個字」有關,卻不是同一件事。行長管畫面擠不擠;時間軸管觀眾有沒有時間把字讀完,同時仍覺得字跟嘴巴同步。

香港創作者常見兩種失手。一種是字幕比口播慢半拍,靜音滑看時以為講者還沒講完;另一種是一句口語轉成書面語後字數變多,同一段顯示時間卻沒加長,結果畫面一閃而過。兩者都不會在「錯字檢查」裡被抓到,卻直接影響完讀與信任感。

本文聚焦對白同步、閱讀節奏、鏡頭切換與口語/書面語換算後的再調時。短片一行讀得完的規則另見 Reels 字幕長度;口語轉書面語見 廣東話口語轉書面語

時間軸要解決的三件事

調字幕時間,其實是在平衡三個互相拉扯的目標:

  1. 對白同步: 字大致在說話開始時出現,不要提前劇透下一句,也不要拖到講完才跳出來。
  2. 可讀時間: 觀眾需要足夠秒數掃完該句;字多就應停留久一點,或拆成兩條。
  3. 畫面節奏: 字幕切換盡量貼近鏡頭切換與語意停頓,避免在臉部特寫正中央突然換字搶焦點。

只追其中一項,另外兩項容易崩。例如硬把出點鎖死在波形結束的那一格,短句會閃得太快;反過來為了「讀得完」把一句拖到六、七秒,觀眾又會懷疑字幕卡住。實務上先求同步與可讀,再微調與鏡頭的關係。

串流平台與影視交付常談的框架,對自媒體同樣有用:單條字幕通常不宜短於約一秒(或約二十格,視幀率而定),也不宜無故超過約六至七秒;相鄰兩條之間留極短間隙,避免上一句剛消失、下一句立刻蓋上造成閃爍。這些是閱讀舒適度的經驗範圍,不是香港短片的法律;最終仍要以你片種的語速與畫面密度為準。

中文閱讀速度常以「每秒字數」討論。影視交付有人沿用較慢習慣,也有串流規格容許更快;自媒體不必死記單一數字。更實用的驗收是:同一條字幕,關聲讀兩次仍吃力,就偏快;開聲時字還停很久、畫面已換話題,就偏慢。數字只是起點,片種與字級才決定觀感。

先對波形,再對「讀不讀得完」

較穩的校對順序是:

  1. 戴耳機只聽對白,對波形調入點。 字幕應貼近該句語音起點;明顯早於口播的「預告字幕」最容易抽離觀眾。
  2. 聽完句尾再決定出點。 語尾可略留半秒緩衝,讓眼睛收完最後一兩個字;不要在講者還在拖音時就把字撤走。
  3. 靜音重播一次,只看字。 跟得上、讀得完,才算時間軸及格。有聲時大腦會用聽覺補洞,最容易誤判「應該夠讀」。
  4. 再對鏡頭切換。 若出點落在鏡頭切換前極短距離,可考慮貼齊切點;若入點剛過切點半秒內,有時直接貼齊新鏡頭更乾淨。

在剪輯軟件裡,把字幕軌與音訊波形並排,比只在播放器裡「感覺一下」更準。Premiere、Final Cut、DaVinci、CapCut 都能拉塊邊界;匯入的是 .srt 還是 .fcpxml,會影響你之後改時碼的順手程度,見 SRT 與 FCPXML

有一個容易誤判的細節:序列起始時間碼不是 0:00。 專案若從一小時碼起算,而 SRT 從零起算,整軌會整體偏移。看起來「全部不同步」,先查起始碼與匯入對齊選項,再逐句微調,可少改幾百次。多段素材拼接後才生成字幕,也要確認時間原點是成片時間軸,而不是某一段原始檔的開頭。

創作者在雙螢幕前對照波形與字幕塊,微調廣東話字幕入點與出點

口語轉書面語之後,為什麼一定要重調時

廣東話口播短、書面語常較長,是時間軸最容易被忽略的環節。口語「佢哋而家搞掂咗」轉成書面「他們現在已經處理好了」,意思不變,字數與視覺寬度卻變了。若工具先按口語音段切時碼,再改文字卻不重算停留,書面稿就會偏急。

處理原則:

  • 先定語體,再鎖時間。 決定保留口語還是轉書面之後,才微調每條的出點與拆句。
  • 字變多就加時間或拆句。 同一時段塞不下,寧可拆成兩條完整意群,也不要加快閃現。
  • 刪填充詞也會改變節奏。 「呢、啦、啊」刪掉後,口播停頓處可能突然沒有對應字;有時要把相鄰短條合併,避免畫面空一拍又跳一下。填充詞取捨見 廣東話字幕填充詞

中英夾雜同樣影響「感覺上的閱讀速度」。deadlinemeeting、品牌英文名佔的寬度與漢字不同,靜音時眼睛掃過拉丁字母的節奏也不同。夾雜規則穩定後,再對那些含英文詞的句子單獨檢查停留是否足夠,見 中英夾雜字幕

語速快、搶話與短片:三種常見翻車

語速快的單人口播。 評測、開箱、街訪旁白常在兩秒內塞完一句主張。若自動分段仍維持「完整文法句」,單條字數會爆。解法是按意群拆:主張一句、理由一句、數字一句;每條對準該意群的語音,而不是整段獨白共用一個長塊。

雙人搶話。 訪談與 Podcast 常出現重疊。字幕一次只宜呈現一條主資訊;兩人同時講時,優先保留被鏡頭對準或推動話題的那一句,另一句可縮短、延後或省略。不要把兩人對白疊成同一條長句「誰說了什麼都擠在一起」。長音檔切句思路另見 Podcast 廣東話字幕

直式短片。 時間軸問題會被介面放大:底部按鈕已佔安全區,字又大,可讀窗口更短。長片那份 SRT 直接丟進 Reels/Shorts,常見結果是出點還停在上一鏡頭的後半。短片應重新切句、重對時間,而不是只縮字級。行長規則見 Reels 字幕長度;平台形態見 軟字幕與燒錄字幕

開場三秒尤其關鍵。hooks 那一句若入點晚、或出點被下一句提早蓋掉,靜音資訊流裡等於沒有字幕。寧可讓開場句略多留一點,再壓縮後面的過渡句。價錢、日期、折扣碼亦同:這些字讀錯代價高,停留應比寒暄句更寬裕。

直式短片時間軸檢查清單:入點對齊、停留夠讀、句間留隙、避開底部安全區

一份可重複的調時檢查清單

完成辨識與錯字校對後,用這張清單走一次時間軸:

  1. 抽十條難句。 含專有名詞、中英夾雜、笑點、價錢的句子優先。
  2. 入點是否貼口播? 明顯提早或遲到超過一小段,就拉齊波形。
  3. 停留是否夠讀? 靜音讀;讀不完就加出點或拆句。
  4. 有沒有閃爍? 兩條相隔極短、像在眨眼,就合併或拉開間隙。
  5. 有沒有「僵住」? 單條無故超過約六秒且畫面已換話題,就切開。
  6. 鏡頭切換附近乾不乾淨? 出點卡在切點前一點點時,貼齊往往更穩。
  7. 短片另做直式預覽。 電腦時間軸「看起來夠」不等于手機資訊流夠讀。

品牌名、人名反覆出錯時,應回到詞庫減少下一集的返工,而不是每集只在時間軸上救火,見 字幕自定義詞庫。噪音導致邊界飄移時,先改善對白軌再調時,見 廣東話語音轉文字遇噪音

何時值得用粵語友善的自動分段

人手聽打每句入出點最精確,但成本高。對多數 YouTube 長片與常規短片,較務實的流程是:先用懂廣東話的工具產出帶時間碼的草稿,再只精修同步差與讀不完的句子。

CantoSub AI 會把對白切成合適長度以維持節奏與可讀性;Model 2.0 亦可控制填充詞與俚語風格,並為段落提供置信度評分,方便你先改「不穩」的句段,而不是從頭滑到尾。匯出 .srt.fcpxml 後,再回剪輯軟件拉齊鏡頭與安全區。功能說明見 CantoSub 2.0;配額見 價格。新用戶可從 註冊 開始試做一條真實素材。

自動分段解決的是「先有一條跟得上口播的底稿」;它不能代替你對品牌語氣、笑點與直式安全區的最終判斷。時間軸合格的標準很具體:關聲也能讀完,開聲也不覺得字在搶戲。

若你每週固定出片,可把調時變成模板:同一帳號、同一片種,用同一套「最短停留/最長停留/開場 hooks 加寬」規則,比每集重新感覺更省事。教學向可略寛;娛樂口播可略緊,但不要緊到閃爍。工具負責草稿,規則負責風格一致。

常見問題

問:字都對了,為什麼觀眾仍說字幕太快? 答:多半是停留不夠或單條字數過多。先靜音重播;讀不完就拆句或延長出點。口語轉書面後字數增加卻未重調時,也是常見原因。

問:字幕要不要完美貼齊每一個音素? 答:不必。貼近該句起點、出點略留閱讀緩衝即可。過度逐音素對齊,反而容易令短句閃爍、長句被切碎。

問:長片與短片可以共用同一條時間軸嗎? 答:文字母帶可以共用,時間軸通常要重做。短片語速、安全區與鏡頭密度不同,直接沿用長片 SRT 的入出點,很容易出現讀不完或擋 UI。

問:雙語字幕會不會令時間軸更難調? 答:會。中英兩行同時出現時,閱讀負擔上升,往往需要更長停留或改為先中後英、分軌上載。流程見 廣東話中英雙語字幕

問:置信度高的句子還要檢查時間嗎? 答:要抽查。置信度主要反映辨識把握,不保證閱讀時間足夠,也不保證與鏡頭切換舒服。難句與轉換書面語後的長句,仍應走靜音檢查。

本文由 CantoSub 團隊編寫/審閱;撰稿過程使用 AI 輔助,事實與產品說明以官網為準。

準備開始製作 AI 字幕了嗎?

立即體驗 CantoSub AI,輕鬆為您的影片添加專業級廣東話字幕,讓內容創作更簡單、更有效率。

✨ 無需信用卡 • 30 分鐘免費試用

廣東話字幕時間軸怎麼調:對齊對白也要讀得完 | CantoSub AI Blog