台灣職場的「中文會議」往往並不是真的全中文。產品團隊會說「這個 feature 下個 sprint 上」,行銷會討論 campaign、CPA 和 conversion,工程團隊則可能在同一句話裡放進 API、SDK、deployment 和英文產品名。對人耳來說很自然,對 AI 逐字稿卻是另一種難題。
這種在同一段對話、甚至同一句話中切換語言的現象叫做 code-switching。研究界長期把中英混語語音辨識當成獨立問題,而不是把「中文 ASR + 英文 ASR」簡單相加。2025 年公開的 CS-Dialogue 就收集了 104 小時、200 位說話者的自然中英混語對話;更早的 TALCS 則有約 587 小時的中英混語教學語音。資料集做到這個規模,正說明真實混語不是少數例外。
中英夾雜會議為什麼比純中文逐字稿更難?
核心問題不是 AI 「知不知道英文」,而是它必須判斷語言在什麼位置切換。像「我們先把 onboarding flow 改掉」這句話,中文語法裡嵌入兩個英文詞;模型不只要聽出聲音,還要在正確邊界切換文字系統與詞彙機率。
研究也指出,混語辨識常受到資料稀疏、語言邊界和發音變異影響。Interspeech 2020 的中英 code-switching 研究以雙編碼器分開建模兩種語言,再用 gating network 處理語言識別;2023 年的研究則直接針對 language-specific boundary learning。換句話說,「何時從中文切到英文」本身就是模型需要學的訊號。
台灣會議還有另一層:嵌入的英文未必按美式或英式標準發音。團隊成員會把英文詞自然塞進中文語流,重音、音節和連音都可能改變。這不是誰英文講得標不標準的問題,而是混語 ASR 必須處理的真實輸入。
哪些英文最容易在台灣會議逐字稿裡出錯?
短縮寫是第一類高風險詞。 KPI、OKR、CRM、API、PR、QA 只有幾個音節或字母,上下文又很短。一旦模型把字母當成相近的中文聲音,整句仍可能「看起來通順」,因此肉眼快速掃過反而容易漏掉。
產品名、公司名和人名是第二類。 Notion、Slack、Figma、GitHub 這類名稱有固定拼法,但語音模型可能輸出一般英文單字、音譯或相近詞。內部專案代號更難,因為公開語料裡根本沒有足夠上下文。
數字與單位是第三類。 「Q3 target 2.5 million」「CPA 降 15%」這種句子一旦把數字、百分比或季度寫錯,影響比標點錯誤大得多。若逐字稿後面還要生成會議摘要,錯誤數字可能直接進入決策紀錄。
混語辨識應該看什麼指標?
只看「整篇準確率」不夠。中文通常用字元錯誤率 CER,英文常用詞錯誤率 WER;混語研究因此常使用 Mixed Error Rate(MER)之類的評估方式,讓不同文字單位可以放在同一個測試框架中。ASRU 2019 的 Mandarin-English Code-Switching Speech Recognition Challenge 就以專門的混語資料與評估來比較系統。
對一般使用者,不必自己重現學術 benchmark。更實用的是建立一份「關鍵詞命中率」:先列出 20 至 50 個這場會議不能錯的詞,再檢查每個工具正確保留多少。這些詞應包括產品名、人名、公司名、縮寫、數字、網址、專案名稱和行動項目中的動詞。
還要把錯誤分層。第一層是語音內容錯誤,第二層是語言切換錯誤,第三層是說話人標記錯誤,第四層才是標點與格式。這樣比較兩款工具時,才知道哪一款真的適合工作流程。
怎麼用真實會議測試中英夾雜逐字稿?
不要用「今天天氣很好,today is a nice day」這種刻意準備的測試句。真正的台灣會議會有口頭禪、插話、英文縮寫、專案名、語速變化和不完整句子,這才是應該測的資料。
- 選 10–20 分鐘代表性錄音最好直接取自你平常的產品會議、訪談、課堂或跨國會議,保留原本的收音環境。
- 先做高風險詞清單列出人名、產品名、公司名、縮寫、數字和英文術語,避免看完逐字稿才憑印象判斷。
- 固定同一個音檔所有候選工具都使用完全相同的錄音,否則無法分辨差異來自模型還是麥克風。
- 先看內容再看排版先核對詞是否正確,再檢查說話人、段落、標點和時間戳,不要被漂亮格式掩蓋內容錯誤。
- 最後才測摘要確認關鍵逐字稿正確後,再比較摘要是否保留決策、數字、負責人與下一步。
同一段錄音最好至少包含三種切換:中文句子嵌英文名詞、完整英文短句,以及英文縮寫。只測其中一種,很容易高估工具在真實會議裡的表現。
要選中文模式、英文模式,還是自動偵測?
如果工具提供明確的多語或混語模式,應優先測那個模式。單純的「自動偵測語言」有時指的是先判斷整個檔案主要是哪一種語言,並不一定代表模型能在每一句內自由切換。產品頁寫 multilingual,也不必然等於 intra-sentence code-switching 做得好。
如果只能選單一語言,通常以會議主要語言為起點。例如 80% 是中文、20% 是英文術語,可以先選中文,再特別檢查英文部分。但這只是測試策略,不是品質保證。
Atter AI 支援 90+ 語言,可作為多語錄音的候選工具之一。不過任何品牌的語言數量都只能回答「覆蓋哪些語言」,不能取代中英夾雜實測。
收音品質會不會比中英切換更重要?
會,而且兩種問題常一起出現。會議室遠端麥克風、筆電風扇、回音、Teams 或 Meet 壓縮、兩人同時說話,都會讓聲學訊號變差;當模型已經難以確定聲音內容時,再判斷語言邊界就更困難。
因此比較工具時要固定錄音條件。不要拿 A 工具測手機近講,B 工具測會議室遠講,再說 A 的混語能力更好。真正公平的比較只有一種:同一個原始檔、同一段時間、同一份人工核對表。
多人會議還要把 diarization 分開看。某句英文辨識完全正確,但被標到錯的人名下,對會議紀錄仍然是錯誤。尤其決策、承諾和 action item,說話人歸屬本身就是資訊。
為什麼逐字稿錯一個英文詞,摘要可能錯更多?
摘要模型通常以逐字稿作為輸入。上游如果把「not approved」漏掉 not、把 15% 寫成 50%、把產品 A 聽成產品 B,下游摘要再流暢也只是把錯誤整理得更漂亮。
所以重要會議不應把「錄音 → AI 逐字稿 → AI 摘要」視為完全無人檢查的一條線。比較安全的流程是先校對高風險資訊,再生成或確認摘要。不是每一句都要人工逐字修,但決策、數字、日期、人名、專案名和否定詞值得優先確認。
這也是為什麼混語逐字稿的評估不能只問「看起來順不順」。語言模型很擅長產生通順文字;真正重要的是文字是否忠於原音。
98.7% 準確率可以直接套在中英夾雜會議嗎?
不可以。Atter AI 的 98.7% 是乾淨音訊條件下的已驗證準確率,不能外推成所有中英夾雜、多人、遠距收音或高噪音會議都有相同結果。任何單一準確率數字都需要看測試條件。
混語研究本身也使用專門資料集,就是因為單語 benchmark 不能完整代表 code-switching。2025 年 CS-Dialogue 的作者特別強調 spontaneous conversations 與 full-length dialogue,目的就是讓資料更接近真實連續對話,而不是只有孤立句子。
對採購或日常使用而言,最有價值的「準確率」是你自己的錯誤成本。如果客服錄音最怕客戶姓名錯,就把姓名權重拉高;如果財務會議最怕數字錯,就優先算數字與單位;如果跨國專案最在意英文術語,就建立術語清單。
哪些做法能提高中英夾雜逐字稿的可用性?
第一,錄音前把麥克風放近說話者。改善訊噪比通常比事後猜錯字有效。第二,會議若有固定產品名與縮寫,建立一份團隊術語表;即使工具沒有自訂詞彙功能,這份表也能讓人工校對快很多。
第三,不要要求每個人「為了 AI」刻意講標準英文。那會讓測試失去意義。工具應該適應你的工作場景,而不是整個團隊為工具改變自然說話方式。
第四,把逐字稿和摘要的驗收分開。逐字稿要看忠實度,摘要要看是否保留決策與上下文。兩個任務混在一起,很容易因為摘要寫得漂亮而忽略底層辨識錯誤。
什麼情況下應該換另一款逐字稿工具?
如果工具偶爾漏一個標點,不必因此更換。但若它反覆在你的核心英文術語、產品名或說話人上出錯,而且這些錯誤會進入 CRM、會議紀錄、研究資料或客戶文件,就值得換工具測試。
目前工具可以繼續用
- 核心術語大多能穩定保留
- 同一錄音重跑結果一致
- 說話人錯誤不影響關鍵決策
- 少量錯字可在短時間內校正
應該比較其他工具
- 英文產品名與縮寫持續被改寫
- 數字、否定詞或人名頻繁出錯
- 多人會議說話人標記混亂
- 校對時間已接近人工整理會議紀錄
真正的選擇標準不是「哪個 AI 名氣最大」,而是哪個工具在你的音訊、你的詞彙和你的工作流程裡,錯得最少而且最好修。
中英夾雜會議逐字稿檢查清單
完成逐字稿後,先搜尋所有英文大寫縮寫,再搜尋產品名與人名。接著逐一核對數字、百分比、日期、金額和版本號。這幾類錯誤最容易影響後續工作。
然後抽查每一次語言切換前後的 5 至 10 秒。若模型常在切換點吞字、重複或把英文音譯成中文,代表混語邊界是主要問題。最後才檢查標點、分段和格式。
若你還在挑工具,可以搭配中文逐字稿工具比較;如果主要問題其實是台灣口音,而不是中英切換,先看台灣國語口音與 AI 辨識。兩種問題可能同時存在,但測試時最好分開記錄。
常見問題
AI 能辨識中英夾雜的會議嗎?
可以,但「同時支援中文和英文」不等於「一句話內切換也準」。用真實會議測試語言切換點、英文術語、縮寫和專有名詞,才知道工具是否適合。
為什麼英文縮寫特別容易辨識錯?
縮寫短、上下文少,而且常被放進中文語流中念。CRM、API、KPI 這類詞應列入高風險清單,逐一人工核對。
中英夾雜逐字稿應該怎麼測?
選 10 至 20 分鐘真實錄音,用完全相同的檔案測所有工具。先列出關鍵詞,再比較內容錯誤、語言切換、說話人和格式,不要只憑「看起來很順」判斷。
要把會議設定成中文還是英文?
若有混語模式就先測混語模式。若只能選單一語言,通常選會議主要語言,再特別檢查嵌入的另一種語言是否被錯寫。
中英夾雜會影響 AI 摘要嗎?
會。摘要建立在逐字稿上,因此產品名、數字、否定詞或決策若先被辨識錯,摘要可能放大錯誤。重要內容應先校對再採用摘要。
多人會議和中英夾雜哪個更難?
兩種難度會疊加。多人搶話增加聲學與說話人切分問題,中英切換增加語言邊界與詞彙選擇問題,評估時應分開記錄。
98.7% 準確率代表混語會議也有 98.7% 嗎?
不代表。98.7% 僅適用於 Atter AI 已驗證的乾淨音訊條件;真實混語會議仍要以自己的代表性錄音測試。