過去幾年,我們習慣的語音轉文字(STT)服務,像是把錄音檔丟進去,然後吐出一堆文字。但企業應用的痛點從來不是「把話變成字」,而是「這句承諾是誰說的」。隨著會議記錄、客服分析、即時 AI 助理的普及,單純的逐字稿已經無法滿足需求,「說話人分離」(Diarization) 成了決定這套系統可不可信的關鍵。
Meta 選在這個時間點切入,其實頗有意思。一方面,市場已經有 AWS、Speechmatics、Deepgram 這些老牌玩家卡位;另一方面,即時語音 AI 的應用場景正在爆炸性成長。Meta 這次拋出的定價——每小時 $0.18 美金,而且內建 20 人以上的即時說話人分離——顯然是衝著「用價格打破現有市場秩序」而來。這不是單純的技術競賽,而是一場總體擁有成本的戰爭。
核心段落:20 人以上分離很強,但真正的殺手鐧是「整合」
說話人分離:為什麼它比你想的更重要?
傳統 STT 回答的是「說了什麼」,但企業 AI 系統真正需要的是「誰說的」。想像一下,一個會議助理如果能把「我同意這個預算」這句話,正確地歸因給財務副總而不是實習生,這份會議記錄才有法律與商業價值。反之,歸因錯誤的逐字稿,甚至比沒有逐字稿更危險,因為它會誤導下游的 AI 分析。
Meta 的 Muse 架構把這件事變成一個單一的串流決策過程。音訊每 80 毫秒 切成一個 chunk,模型在每個步驟決定要「繼續聽」還是「輸出文字」。這種稱為 adaptive delay 的機制,讓模型在語音模糊時多等一點,在上下文足夠時提早輸出。更關鍵的是,它把「誰在說話」直接標記在 token 序列裡(例如 <|speaker_A|>),而不是像傳統系統那樣,先跑完轉錄再事後做聲紋聚類。
這是一個重要的思維轉變:Meta 不是把「分離」當作附加功能,而是把它當作語音理解的基礎建設。
20 人不是世界紀錄,但 $0.18 的價格是
先講結論:Muse 的 20+ 人分離能力,不是市場上最高的。依據目前各家公開文件,Speechmatics 宣稱即時模式預設支援 50 人,最高可調到 100 人;AWS 的 Amazon Transcribe 則支援最多 30 人。Meta 的數字落在市場前段班,但沒有打破紀錄。
然而,價格讓這個比較變得很有趣。以下是我們根據各家公開定價,統一換算成「每小時串流音訊」的粗略比較:
| 服務 | 約略每小時成本 | 即時說話人分離 |
|---|---|---|
| Soniox stt-rt-v5 | $0.12 |
內建,最高 15 人 |
| Meta Muse Voice Transcribe | $0.18 |
內建,20+ 人 |
| xAI Speech to Text | $0.20 |
支援,未公佈上限 |
| Speechmatics Real-time Standard | $0.24 |
內建,預設 50 人 |
| Deepgram Nova-3 Multilingual | $0.35 + $0.12 分離附加費 |
需額外加購 |
| AssemblyAI Universal-3.5 Pro | $0.45 + $0.12 分離附加費 |
需額外加購,最高 10 人 |
| Amazon Transcribe Streaming | $0.60(N. Virginia 區域範例) |
內建,最高 30 人 |
這張表透露了兩個訊息。第一,Meta 不是最便宜的(Soniox 更便宜),但考慮到它同時具備低延遲、多語碼轉換、關鍵字偏置與 20+ 人分離,$0.18 的性價比確實很有威脅性。第二,Deepgram 和 AssemblyAI 都把說話人分離當作「加價購」,Meta 直接內建的做法,等於變相幫企業省下 20% 到 30% 的帳單。
準確率才是真正的護城河
價格再漂亮,如果辨識錯誤率慘不忍睹,企業也不會買單。根據 Meta 提供的基準測試數據,Muse 在 Artificial Analysis AA-WER Streaming Index 上拿下 3.1% 的最終轉錄詞錯率(WER),領先 Cartesia(3.4%)、ElevenLabs(3.6%)與 GPT Live Transcribe(3.9%)。
更值得注意的是它的分離錯誤率(DER)。Meta 宣稱在 AMI-IHM、AMI-SDM 與 VoxConverse 等公開資料集上,平均 17.5% 的錯誤率低於圖表中的競爭對手。這代表的不只是「認得出來有幾個人」,而是即使在吵雜的遠場麥克風環境下,也能正確地把話歸給對的人。
未來一兩年:價格戰開打,分離功能將成標配
Muse 的出現,我認為會加速幾個產業趨勢。首先,「內建說話人分離」將從選配變為標配。當 Meta 用 $0.18 的價格把門檻打下來,其他廠商很難再對這項功能收取額外費用,否則在企業採購的 CP 值比較上會立刻落居下風。
其次,競爭焦點將從「每小時多少錢」轉向「每小時多少正確的說話人歸屬」。單純的 WER 已經不夠看了,企業會開始要求供應商提供 DER(Diarization Error Rate) 的第三方驗證數據。這對擅長做整合式模型的 Meta 相對有利,因為它的架構天生就是為了同時最佳化這兩個指標。
最後,中小型開發者將是最大贏家。過去要做出具備說話人分離的會議助理,往往得串接兩到三個不同服務(一個做 STT,一個做聲紋辨識),現在一個 API 就能搞定,而且成本還更低。這會大幅降低語音 Agent 的開發門檻,讓更多新創團隊有機會在垂直領域做出創新應用。
延伸思考與常見問題
Q1:什麼是「說話人分離」(Diarization),它跟一般的語音轉文字有什麼不同?
語音轉文字(STT)只負責把音訊變成文字,而說話人分離更進一步,會在文字上標註「這段話是誰說的」。它通常透過聲紋特徵來區分不同的說話者,輸出的結果會像是「Speaker A:我同意這筆預算」而不是單純的「我同意這筆預算」。
Q2:為什麼即時(串流)的說話人分離比離線處理更困難?
因為即時系統必須在音訊「還在發生當下」就做出判斷,無法偷看後面的內容來確認前面的歸屬是否正確。離線系統則可以分析完整段音訊後,再回頭修正分離結果。這就是為什麼有些廠商在文件裡會提醒,即時模式的準確率通常會比非同步模式稍微低一些。
Q3:Meta 的
$0.18定價真的算便宜嗎?為什麼其他廠商要另外收費?以「內建 20+ 人分離」的條件來看,
$0.18確實落在市場低價區間。其他廠商如 Deepgram 或 AssemblyAI 之所以將分離列為加價購,是因為這項功能需要額外的模型推理成本。Meta 選擇把它包進主方案,一方面是為了搶市佔,另一方面也反映出其整合式架構在推論效率上的優勢。