廣東話語音轉文字遇噪音怎麼辦:配樂與街拍怎麼校對

立即體驗 AI 字幕生成

使用 CantoSub AI 為您的影片自動生成專業級字幕

Cafe 冷氣、街市人聲、 tram 鈴、後製才加的 BGM——香港創作者最常見的廣東話語音轉文字失手,往往不是「模型不懂粵語」,而是人聲被噪音蓋住。同一句口語,在安靜收音間可以一次對準;換成邊走邊講、或成片已混好配樂,近音錯字、漏句、時間軸漂移就會成批出現。

問題不在「要不要做字幕」,而在順序:先降噪還是先轉寫?先拆對白軌還是整條混音丟進工具?嘈雜段要不要整段重錄?若每條片都從第一句慢慢聽打,街拍與短片節奏會被拖垮。

本文以實務場景拆開:什麼噪音最傷辨識、何時值得先處理音訊、如何用置信度與詞庫加速校對,以及何時該換收音而不是死撐後製。口語與書面語取捨見 廣東話口語轉書面語;通用轉寫流程另見 廣東話語音轉文字

為什麼噪音特別傷廣東話辨識

語音轉文字靠的是「聽得清的音素 + 語境猜測」。廣東話本身聲調多、懶音與語氣詞多,模型已要同時處理口語變體與中英夾雜。背景再疊一層穩定噪音(冷氣、風扇、低頻交通)或節奏性噪音(BGM 鼓點、街市叫賣),人聲邊界會糊掉:短字被吞、語氣詞被聽成實詞、英文專有名詞被拆成漢字諧音。

三類場景最常見。一是已混音成片:旁白底下有配樂,轉寫工具聽到的是「音樂 + 人聲」的混合物,低音鼓與人聲同頻時錯字會集中。二是街拍/邊走邊講:風噪、交通、路人對白搶話,麥克風距離一遠,音量忽大忽小。三是Cafe 或開放辦公室:持續冷氣聲不刺耳,但會拉低信噪比,長句後半段最易糊。

通用「中文」自動字幕對這些情況往往更脆,因為它未必按香港廣東話與中英夾雜優化。粵語專用工具仍受音訊品質限制——垃圾進、垃圾出——但至少在口語、潮語與港式用詞上,校對起點通常較乾淨。準確率數字會隨素材波動:安靜對白與嘈雜街拍不應拿同一個期望值比較。

先判斷:這段噪音值不值得救

不是每段嘈雜音都要先開降噪軟件。先問三個問題,再決定工時落在收音、音訊預處理,還是字幕校對。

人聲還聽不聽得清? 戴耳機靜音畫面只聽對白:若你自己都要重播兩次才聽懂,模型大概也聽不懂。這類片段優先重錄旁白或補一句清楚 take,比花一小時在錯字堆裡猜更划算。

噪音是穩定底噪,還是節奏性干擾? 穩定冷氣、輕微人聲牆,有時直接轉寫再靠置信度掃低分句即可。鼓點強、人聲與人聲重疊、突然經過的車聲,則較值得先壓低非人聲頻段,或乾脆用未混 BGM 的對白軌重跑。

成片還能不能拆軌? 若工程檔仍在,最省事的做法是:用乾淨人聲軌(或暫時 mute 配樂)做廣東話語音轉文字與校對,字幕定稿後再把 BGM 加回畫面。許多創作者的返工,其實來自「先混好再轉寫」這一步順序反了。

街訪與客服錄音若無法重錄,就要接受「可用底稿」而非「影院級字幕」:先求關鍵句、人名、數字正確,再決定要不要為社群片燒錄美觀樣式。

創作者在咖啡店窗邊戴耳機校對影片字幕,筆記寫著口語轉書面語

建議工作流:分離人聲 → 轉寫 → 先改低信心句

嘈雜素材較穩的順序是「對白優先,樣式最後」,而不是「整條成片一次過自動字幕」。

  1. 盡量用對白軌,或暫時壓低配樂。 剪輯軟件裡把 BGM 軌 mute、輸出一條僅人聲的音訊/影片再上載轉寫。若只有混音檔,可用簡單均衡略減低頻轟鳴,或用系統/剪輯軟件的人聲增強;不要過度削切,否則齒音失真會換另一種錯字。
  2. 鎖定風格再跑轉寫。 街拍 Vlog 可留部分俚語;教學、品牌、招聘偏書面語。風格不定,嘈雜段的「猜字」會更亂。細節見 廣東話口語轉書面語
  3. 專有名詞進詞庫。 品牌名、地名、產品型號在噪音裡最易變近音字。先鎖詞庫,比事後逐集改同一錯字快。做法見 字幕自定義詞庫
  4. 跑廣東話語音轉文字,並開啟可用的噪音/置信度提示。 先不要從第一句美化文筆:按低信心或被標為不清的句段跳讀,對照波形聽一次。否定詞、價錢、時間若錯,語意會翻案。
  5. 處理中英夾雜與填充詞。 meeting、deadline、brand 名要全片同一寫法;呢、啦、啊可按片種批量收斂,再人工只盯例外。中英夾雜規則見 中英夾雜字幕
  6. 匯出 .srt(或 .fcpxml/文字),接回剪輯軟件調樣式。 樣式、動畫、直式安全區在文字準了之後再做。Premiere、Final Cut、CapCut、DaVinci 的匯入路徑見站內各篇軟件指南。
  7. 發佈前靜音播一次。 嘈雜素材常有「字對了但時間飄」:對白被音樂蓋住時,模型切句會偏早或偏晚。靜音預覽比盯時間碼更能發現讀不完的行。

CantoSub AI 專為廣東話場景優化,可處理口語、潮語與中英夾雜,並把口語轉成書面語;支援 MP4、MOV 等影片與 MP3、WAV、M4A 等音訊,匯出 .srt.fcpxml.txt。平台標示廣東話辨識準確率可達九成以上(視音訊品質而變)。Model 2.0 提供噪音相關提示、段落置信度評分,以及俚語/填充詞等風格控制,方便先改低信心句而不是整篇平均用力。功能見 CantoSub 2.0;配額見 價格。新用戶有 30 分鐘免費試用、無需信用卡,從 註冊 開始。

資訊圖:嘈雜錄音字幕三步——分離人聲、轉寫校對、匯出 SRT

配樂、街拍、Cafe:三種邊角怎麼拆

配樂已燒進成片: 若仍有專案檔,拆對白重跑幾乎總是正解。若只有匯出檔,可試:略降整段音量中的低頻、或用「人聲分離/人聲增強」類功能抽出近似對白再轉寫;抽出軌失真太重就退回混音檔,把校對時間集中在歌詞式錯字與專有名詞。歌詞被聽成對白時,直接刪掉該段字幕,不要硬留。

街拍與戶外訪問: 風噪優先用防風罩與領夾咪靠近嘴邊;後製只能小幅補救。兩人搶話時,字幕不必追求影院級講者標籤——先保證每句話屬誰大致正確、關鍵引語無誤。重疊太嚴重的段落,寧可縮短字幕、保留一句清楚的結論。

Cafe/開放空間長講: 冷氣底噪適合「直接轉寫 + 置信度掃讀」。長句容易在句末糊掉,校對時特別聽句尾否定與數字。若你固定在同一間 Cafe 拍,可把常出現的店名、地區名寫進詞庫,減少每集重複改字。

短片 vs 長片: Reels/TikTok/Shorts 觀眾靜音滑過,錯字更顯眼,但片短,值得為對白軌多花五分鐘。YouTube 長片可另上軟字幕方便搜尋與開關;嘈雜段的軟字幕一樣要校對,否則搜尋索引會吃進錯字。平台取捨見 軟字幕與燒錄字幕YouTube 廣東話字幕

校對清單:嘈雜片先掃什麼

打開草稿後,不要從頭精修文筆。嘈雜素材的高優先錯誤通常集中在同一幾類:

  • 專有名詞與品牌寫法(噪音裡最易近音)
  • 數字、價錢、日期、折扣
  • 否定與條件(「唔好/不要」類一旦反轉,意思全錯)
  • 中英夾雜拼寫是否全片一致
  • 被音樂或路人聲「假生成」的多餘句
  • 時間軸是否與口型/停頓大致對齊
  • 最後才處理填充詞、標點與分行美感

若工具有置信度或「音訊不清」標記,先按標記跳讀,再全文靜音播一次。兩輪比「平均每句改一樣久」更省時間。步驟總覽亦可對照 廣東話字幕生成器使用步驟

什麼時候該重錄,而不是繼續降噪

後製有上限。出現下列情況,重錄旁白或補一句清楚 take 通常更快:人聲長期低於環境聲;風噪把齒音削平;多人同時大笑、叫喊蓋過對白;你已降噪兩次,錯字位置卻幾乎沒變。重錄時可保留畫面,只換音軌——觀眾較難察覺,字幕品質卻會跳一級。

也要分清用途。內部會議底稿、採訪筆記,接受較高錯字率、只改關鍵資訊即可;對外品牌片、課程、付費內容,則應把「聽不清的對白」當成拍攝問題,而不是單靠字幕工具硬補。工具指標與選型另見 廣東話字幕工具怎麼選

常見問題

問:一定要先降噪才做廣東話語音轉文字嗎? 答:不必。穩定輕微底噪可直接轉寫,再按低信心句校對。配樂蓋人聲、風噪明顯、或你仍保有未混 BGM 的對白軌時,先分離人聲再轉寫通常更划算。

問:混好 BGM 的 MP4 還能救嗎? 答:能做,但預期要多校對。優先試 mute 配樂重導一條對白版;若只有成片,可輕度人聲增強後重跑,並刪掉被歌詞誤聽成的句子。

問:置信度評分要怎樣用? 答:把它當校對地圖,不是分數競賽。先改被標低分或音訊不清的段落,再全文靜音檢查專有名詞與數字。可把時間花在真正聽不清的幾句上。

問:街拍是否應該一律燒錄字幕? 答:短影片平台觀眾常靜音,燒錄較穩;若同時上 YouTube 長片,可另備校對過的軟字幕方便搜尋與開關。無論哪種,嘈雜段的文字仍應先準再談樣式。

問:CantoSub 適合這類嘈雜素材嗎? 答:適合作為粵語向的轉寫與書面語母帶工具,尤其需要中英夾雜、詞庫與置信度掃讀時。音訊過差仍需重錄或接受較高人工量;新用戶可用免費試用先以自己的街拍或配樂片實測。

準備開始製作 AI 字幕了嗎?

立即體驗 CantoSub AI,輕鬆為您的影片添加專業級廣東話字幕,讓內容創作更簡單、更有效率。

✨ 無需信用卡 • 30 分鐘免費試用

廣東話語音轉文字遇噪音怎麼辦:配樂與街拍怎麼校對 | CantoSub AI Blog