返回趨勢情報
趨勢情報

Meta 放出 Muse Voice Transcribe:轉寫、分誰在講、判斷何時該停,合成一個模型

2026年9月3日
易賺Ai團隊
19 分鐘閱讀
#開發者#產業動態#產品動態
Meta 放出 Muse Voice Transcribe:轉寫、分誰在講、判斷何時該停,合成一個模型

Mark Zuckerberg 在 X 轉發的示範不是單人聽寫,而是八個人同處一室、中英夾雜、還有人在句子中間切語言。字幕一邊落字,一邊把說話者標成 A 到 H。Meta Superintelligence Labs 把這套能力叫做 Muse Voice Transcribe,並寫成該實驗室第一款「即時音訊感知模型」:串流語音轉文字、二十人以上的說話者分離,以及判斷「這個人講完了沒」的結束點偵測,三件事走同一條解碼迴圈,官方強調不必再接後處理管線。

模型識別名稱是 muse-voice-transcribe-1.0,走 Meta Model API。標價寫得很直白:每 1,000 分鐘音訊 3 美元,換算大約每小時 0.18 美元。它已經接到 Meta AI for Mac 的系統級聽寫,以及 Muse Code;Mac 上按住 Fn,就能把聲音送進當前任何應用程式。訓練語料涵蓋 70 多種語言,上市初期建議先用 25 種「充分驗證」的語言。開發者文件把這 25 種列出來了:阿拉伯文、孟加拉文、荷蘭文、英文、法文、德文、希伯來文、印地文、印尼文、義大利文、日文、卡納達文、韓文、馬來文、普通話中文、馬拉地文、波蘭文、葡萄牙文、西班牙文、他加祿文、泰米爾文、泰盧固文、泰文、土耳其文、越南文。粵語不在這張表上。語碼轉換被寫成原生能力,同一句裡換語言也算在規格內。語言偏置、關鍵字偏置與上下文偏置可以再把專有名詞往上推。

這些是官方與開發者文件已經講清楚的部分。還沒講清楚的,是你拿自己的會議錄音去跑之後,還能不能相信排行榜上的 3.1%。

音訊每 80 毫秒進來一次,模型自己決定要不要吐字

技術核心不是又一個比較大的 Whisper 變體,而是把「聽」和「寫」放進同一條自回歸迴圈。Muse Voice Transcribe 屬於 Muse Spark 家族的多模態模型。音訊以 80 毫秒為一塊進來,相當於每秒 12.5 次;每一塊被壓成單一 soft token。模型接著做一個二元選擇:要嘛發出文字 token,要嘛發出特殊的 <|next_audio|>,系統再把這個佔位符換成下一塊真實音訊。串流結束時插入 <|empty_audio|>,模型把還握在手上的文字一次沖出來,不再要新音訊。即時端點原生吃 PCM_24KHZ(每秒 48,000 bytes、signed 16-bit little-endian 單聲道);PCM_16KHZ 也能送,但會在伺服器端重採樣。

聽與寫共用同一個解碼器,所以沒有另一段對齊模組可以慢慢漂掉。說話者分離與結束點偵測也不是外掛:可能換人時出現 <|start_of_turn|>,真正的 <|speaker_{A-Z}|> 標籤會拖到該塊結尾才定案;同一個人的聲音可以切成好幾段,最後仍收成同一個標籤。<|speech_onset|><|speech_endpoint|> 則標出開口與講完。Meta 的說法是這兩項任務與串流語音辨識聯合訓練,獎勵函式疊在 ASR 獎勵上面。

比較少見的是「自適應延遲」。因為模型自己控制要聽多久才吐下一個字,它也就控制了每個字背後有多少音訊上下文。難的詞多等一會兒,簡單的詞幾乎立刻落字。這套取捨不是工程師手調閾值,而是在強化學習階段把「字錯誤率獎勵」和「延遲獎勵」相乘,而不是相加。兩邊相乘的效果是:任何一邊差,整體分數就差,模型不能靠犧牲其中一項去刷另一項。Meta 稱這樣讓模型落在速度與準確度的 Pareto 前沿,並把先前由 Soniox、Cartesia、ElevenLabs 撐住的那條線往外推。

這也解釋了為什麼產品敘事一直強調「單一模型、不必後處理」。傳統管線裡,ASR 模型以為句子還沒完、說話者分離模型已經切了人、結束點偵測器又提早切斷——三個時鐘對不齊,字幕就會跳、標籤就會錯。現在三件事是同一串 token 決策,失敗模式會變,但交接點少了兩個。

數字對得上的部分,以及對不上的部分

第三方基準目前最常出現在報導裡的是 Artificial Analysis 的 AA-WER Streaming。英文最終稿字錯誤率,Muse Voice Transcribe 報 3.1%,說話結束後再等 0.16 秒出最終稿。同一張表上,Cartesia Ink-2 搭配語意結束點是 3.4%、0.43 秒;ElevenLabs Scribe v2 Realtime 是 3.6%、0.14 秒;Cartesia Ink-2 若改用外部結束點可以快到 0.07 秒,但錯誤率升到 4.0%。第一份部分稿(partial)方面,Meta 報 3.6%、0.13 秒。The New Stack 另外列了 GPT Live Transcribe 3.9%、Gemini 3.5 Transcribe Live 4.0%,並提醒這份排行只評英文語音。Artificial Analysis 這份串流集大約八小時,素材來自 AA-AgentTalk、VoxPopuli 與 Earnings22。0.3 個百分點的領先幅度,換一套口音或領域詞彙,順位就可能翻掉。

說話者分離是另一條軸。Meta 自己報 AMI-IHM、AMI-SDM、VoxConverse 三個公開集平均 diarization error rate 17.5%,圖上另外五套系統落在 21.1% 到 28.6%。語音錯誤率來自 Artificial Analysis,說話者數字來自 Meta 自己的圖,兩邊不是同一套獨立裁判。17.5% 仍高,代表二十人會議裡標錯人並不是罕見事件;它只是比同場對手少錯一些。

價格把戰場從「再壓 0.3 個百分點」拉到帳單。每千分鐘 3 美元,低於 Cartesia Ink-2 的 4 美元,也低於 ElevenLabs Scribe v2 Realtime 與 Deepgram Flux 的 6.50 美元。一場一小時的會議大約 0.18 美元;一個月轉寫 10 萬分鐘音訊,帳單大約 300 美元。Implicator 拿 Google Cloud Speech-to-Text 標準層約每小時 0.96 美元來對,算出大約便宜八成——那是舊的雲端轉寫價目,不是六天前才上線的 Gemini 3.5 Transcribe。後者按 token 計費,官方換算檔案版約每分鐘 0.005 美元、即時版約每分鐘 0.009 美元,也就是每小時大約 0.30 與 0.54 美元。Muse 仍比較便宜,但差距沒有「打到 Google 兩成價」那麼戲劇性。

項目Muse Voice TranscribeCartesia Ink-2ElevenLabs Scribe v2 RealtimeGemini 3.5 Transcribe Live
最終稿 WER(英文串流)3.1%3.4%(語意結束點)3.6%4.0%
講完到最終稿0.16 秒0.43 秒0.14 秒(未列於同一欄)
每小時音訊約當價0.18 美元0.24 美元0.39 美元約 0.54 美元
說話者分離是否同模型是,20 人以上否(需外掛)視產品組合檔案版有說話者歸因
詞級時間戳否,只有 turn 級視產品視產品檔案版有
可下載權重自架

表裡沒有寫進「快 0.02 秒所以贏了」。ElevenLabs 在講完後出最終稿其實略快;Meta 贏在錯誤率、價錢,以及說話者標籤不用另接一條管線。另一份常被拿來打臉「第一名」的表是 AssemblyAI 自己的預錄基準(7 月 17 日更新),那張表裡 Universal-3.5 Pro 平均正規化 WER 4.35%,ElevenLabs Scribe V2 5.87%,Deepgram Nova-3 6.66%。Muse 沒出現在那張 7 月的表上,AssemblyAI 也有商業利益,但它至少說明一件事:換資料集、換預錄還是串流,「第一名」會換人。

開發者實際接到的,比研究部落格少幾樣東西

Meta Model API 給兩條端點,跑的是同一個模型。即時走 wss://api.meta.ai/v1/asr/realtime,握手必須在 WebSocket 開好後十秒內用 JSON 送出,憑證放在握手框的 authorization.accessToken,HTTP Authorization 標頭這條線會被忽略。已有錄音則走 POST https://api.meta.ai/v1/asr/transcribe,用 multipart 上傳,這次才讀標頭。sessionId 可選;不給的話伺服器會自己生一個,方便你對日誌。

模式一旦在握手裡定下來,整場即時連線就不能改。預設 PUSH_TO_TALK:你自己按麥、自己切段,適合語音指令與聽寫。ENDPOINTING 讓模型找每一句的邊界,事件順序是 speechStart → 多次 transcript(部分稿)→ speechEndspeechComplete。文件特別寫了一句:speechEnd 不是稿,它只標邊界;真正可讀、可能已補上標點與大小寫的文字,在 speechComplete。回合可以重疊,後一句的 speechStart 可能比前一句的 speechComplete 先到,狀態機必須用 turnId 當鍵,不能假設事件會依序走完。部分稿事件沒有 turnId,它屬於最近一次 speechStart 開出來的那一輪。

DIARIZATION 會多吐 speaker 事件,標籤像 AB。文件寫明:這不是為低延遲語音指令調的,語音代理若要搶話,應改走 ENDPOINTING。標籤是「這一場連線裡的識別碼」,不是經過核對的人名,跨場連線也不保證同一個人還叫 A。同一場裡同一個標籤可以出現多次;單一 turn 恰好一個 speaker 事件。languageBiaskeywords 只能在開場時設,跑起來就不能改。關鍵字能把產品名、人名、縮寫往正確拼法推,但不保證拼出來的字完全等於你寫進清單的那一串。

文件也把「這次沒做什麼」寫死了。Muse Voice Transcribe 只回 turn 級時間戳,沒有詞級時間戳、沒有信心分數、沒有聲音事件偵測、沒有情緒偵測、也沒有把口語改寫成書面稿的 reformatting。字幕產品若需要逐詞對齊卡拉 OK 效果,這條 API 現在做不到。Google 在大約一週前上線的 Gemini 3.5 Transcribe,檔案版正好主打詞級時間戳與說話者歸因;即時版則走 Live API,並把口吃、自我更正收成比較乾淨的句子。Engadget 寫到,Google 把轉寫烤進 Android 與(規劃中的)Chrome,Meta 這次則還沒說要不要進 WhatsApp、Instagram 或 Quest。兩家都在搶麥克風入口,但一個往作業系統與瀏覽器裡嵌,一個先放在 Mac 聽寫與託管 API。

Alexandr Wang 同步轉發:模型已在 Meta 桌面應用與 Muse Code 上線,API 即日可打。研究部落格附了現場示範,麥克風音訊用來產生稿,官方寫明音訊不儲存。企業若把「示範頁不存」讀成「API 也不留」,還得去對 Meta Model API 的零資料保留條款,兩者不是同一份文件。

權重鎖在雲端,和 Muse Glimmer 不是同一條產品哲學

Meta 發言人向 The New Stack 確認:這次不會像 Muse Glimmer 開源 Apache 2.0 權重 那樣釋出可下載檔。Glimmer 走的是本地代理、權重公開;Voice Transcribe 只活在託管 API。如果你把「單一模型」當成資料不出機房的理由,這次發布幫不上忙。受監管產業、政府標案、醫院與金融內部部署,仍得繼續看開源 ASR,或看 Cohere 把轉寫戰拉回基礎設施層 那一類可自架路線。

Meta Model API 有零資料保留層(zero data retention),這對企業採購至少補了一格合規選項,但那仍是「資料進 Meta 的機器、承諾不留」,不是「模型在你機架上跑」。和 Muse Spark 1.1 把美系 API 地板壓到對手四分之一 相比,這次計價單位從「每百萬 token」換成「每千分鐘音訊」,比較像語音專用基礎設施,而不是通用大型語言模型聊天。開發者若把轉寫結果再丟進 Muse Spark 或外部AI代理做摘要、工單、知識庫,帳單會變成「音訊分鐘 + 文本 token」兩段,不能只用某一張價目表去估。

長音訊是第三個缺口。官方說原生支援超過一小時、不必切段,示範裡甚至放了一段超過一小時、十一位說話者的對話;沒說上下文窗口上限、超過後是滑動、重啟還是靜默丟段,也沒說說話者標籤在兩小時會議裡會不會重新編號。要上線客服質檢或董事會錄音,這些都得在自己的音檔上測,不能只抄排行榜。

眼鏡要聽得懂,語音代理要知道何時該停

The New Stack 的判斷很具體:Meta 有內建理由一直推這條線,因為眼鏡與 Mac 應用都需要麥克風通路夠穩。即時字幕只是表層;對語音助手和語音代理來說,結束點偵測錯一次,就等於搶話或死等。官方示範裡有一段中英夾雜:「明天九點有個 doctor appointment,你記得叫我一下」——這正是雙語家庭對話的日常形態,也是多數英文排行榜測不到的東西。OpenAI 先前用 GPT-Live 全雙工拆掉語音三件套,走的是「邊聽邊說、難題再丟給更強模型」;Meta 這次專攻「邊聽邊寫、順便標人、順便判斷講完沒」。兩者都在拆三件套,但拆的層不一樣:一個在對話,一個在感知。

對開發者工作流,差別會出現在串接成本。過去要接三個端點、對齊三套時間戳、還得自己寫「這句是誰講的、要不要打斷模型」的規則。現在理論上一個流就能拿到文字、說話者與 endpoint。提示詞層可以少做一件事:不必再把「請標示 Speaker A/B」寫進後處理指令,因為標籤已經是模型 token。風險則是把三個失敗模式綁死:模型一旦在延遲策略上學歪,轉寫、分人和切斷會一起歪,除錯時不能再只重啟其中一個微服務。DIARIZATION 模式文件自己說了不適合低延遲指令;若你的產品是「Hey Meta,現在幾點」,卻開成多人標籤模式,延遲會先把體驗吃掉。

Google 也不是沒碰麥克風入口。離線優先的語音轉寫 App 走的是裝置端、輕量、不一定要連雲。Muse Voice Transcribe 完全相反:雲端、閉源、按分鐘計費、強調長音訊與多人。Gemini 3.5 Transcribe 又是第三條路:會清口吃、會改寫自我更正,適合寫進信件的乾淨稿,不適合必須保留原話的會議紀錄或法律取證。三者短期不會互相取代。真正會被擠壓的,是那些只做英文串流、又沒有說話者分離、價錢還停在每千分鐘 6 美元以上的專用 API。

生成式AI 熱潮把語音重新變成入口,不是因為轉寫是新問題,而是因為代理要在人還在講話時做決定。結束點偵測從「語音活動偵測器的工程細節」,變成代理能不能自然插話的產品功能。Meta 用強化學習把這件事學進同一個解碼器,等於承認:麥克風通路的競爭,已經從「認得夠準」擴成「等得夠聰明」。

採購端現在能做的驗證其實很窄,但夠用。拿自己的會議錄音、客服通話、中英夾雜片段,對同一段音訊各跑 Muse、現有供應商與一套開源基線,比較最終稿 WER、講完到可讀字幕的秒數、說話者標籤穩不穩、以及零資料保留條款能不能過法務。英文排行榜上的 3.1% 只能當起點。25 種驗證語言雖然已見於文件,分語言 WER 仍沒公布;普通話在名單裡,不代表你的口音、領域詞彙與語碼轉換密度已經過關。權重一日不放,機房內部署就一日還是別人的題目。詞級時間戳一日沒有,對字幕、音檔剪輯與取證流程,就一日還得另接工具。

這次發布沒有改寫通用AI模型的能力階梯,它改的是語音管線還要不要維持三套時鐘。帳能算清楚、自己的音檔能跑過,這條 API 才值得換;數字只存在簡報上,就還只是實驗室第一款即時音訊感知模型的發布聲明。