Google 把兩款新的 文字轉語音 模型放進 Gemini 家族:gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts。開發者定價頁把標準檔寫成同一套文字輸入價——每百萬 token 0.50 美元,有效到 2026 年 12 月 31 日——音訊輸出則拆成兩檔:Flash 9.00 美元,Flash-Lite 6.00 美元。2027 年 1 月 1 日起,兩檔的文字輸入都變成 1.00,音訊輸出分別變成 18.00 與 12.00。Batch 與 Flex 是半價;Priority 是 1.8 倍。免費層對標準檔標 Free of charge,Batch 與 Flex 標 Not available。
上一版 gemini-3.1-flash-tts-preview 標準檔是文字 1.00、音訊 20.00,沒有快取欄、也沒有 Flex 與 Priority。3.8 這一欄多了 context caching:快取讀取 0.125 美元/百萬 token,儲存 0.50 美元/百萬 token/小時。模型卡把 Flash-Lite 寫成 3.1 Preview 的建議替代;Flash 則標成新的旗艦創作層。輸入上限 8,192、輸出上限 16,384,兩款相同,和 3.1 Preview 同一組數字。
官方部落格把這次更新說成「把語音生成從靜態預設,改成動態創作工作室」。產品經理 Leland Rechis 與 Gemini Audio 團隊的 Alan Cowen 聯名發文。能立刻核對的不是這句口號,而是價目表、模型 ID、語言數、上線範圍,以及獨立機構用另一套單位算出來的成本。
價目表先對齊,再談「變便宜」
| 模型 | 模型 ID | 文字輸入/百萬 token | 音訊輸出/百萬 token | 2027 年起 | Batch/Flex 音訊 | Priority 音訊 |
|---|---|---|---|---|---|---|
| Gemini 3.8 Flash TTS | gemini-3.8-flash-tts | 0.50 美元 | 9.00 美元 | 1.00/18.00 | 4.50 | 16.20 |
| Gemini 3.8 Flash-Lite TTS | gemini-3.8-flash-lite-tts | 0.50 美元 | 6.00 美元 | 1.00/12.00 | 3.00 | 10.80 |
| Gemini 3.1 Flash TTS Preview | gemini-3.1-flash-tts-preview | 1.00 美元 | 20.00 美元 | 未另標促銷截止 | 10.00 | 未列 |
同一張開發者定價頁,對較舊的 Gemini 音訊產品加了註腳:音訊 token 以每秒 25 個計算。3.8 TTS 這一欄沒有把這句註腳再寫一次。若沿用同一換算,一小時音訊約 9 萬 token,Flash 標準檔大約 0.81 美元,Lite 大約 0.54 美元;3.1 Preview 用同一公式則大約 1.80 美元。這是沿用假設,不是 3.8 自己新公布的「每小時價」。
獨立評測站 Artificial Analysis 不走 token,走「每百萬字元」。它把 3.8 Flash TTS 列成 32.98 美元/百萬字,Flash-Lite 22.07 美元;同一表上 3.1 Flash TTS 是 18.31 美元,SpaceXAI TTS 15 美元,Eleven v3 100 美元。token 單價往下走、字元單價相對 3.1 往上走,兩組數字可以同時成立:表現力較高的語音,每個字可能佔更長的音訊、吃掉更多音訊 token。Google 沒有公布「每個字平均產出多少秒」,所以 AA 的字元價不能直接拿來否定官方 token 價,官方 token 價也不能單獨當成創作者帳單。
官方把音訊輸出從 20 砍到 9;獨立機構把同一代產品換成每百萬字,算出來比上一版貴。兩組帳都要留著,不要只抄比較好看的那一欄。
兩款模型被怎麼分工
官方模型卡把工作負載寫進同一張對照表。Flash 主打聲學保真、演技細節、方言覆蓋,適用有聲書、工作室旁白、複雜多人對話、大量語氣爆發、難發音、地方口音。Lite 主打高吞吐量、低延遲、成本,適用大量產製、即時語音代理串接、朗讀功能、聲音複刻、日常單人生成。語言數不一樣:Flash 130 種,Lite 101 種。官方部落格對外只寫「100 種以上」;要以模型卡這兩欄為準。
兩款共用同一套 API schema 與提示結構。官方點名 Flash 是新旗艦創作層,Lite 是 gemini-3.1-flash-tts-preview 的建議替代。3.1 那 30 個預設聲沒有被宣布停用,但遷移指南要求呼叫端改 schema,不能把舊請求原樣丟進 3.8。
聲音庫從「30 個原聲」擴到「2,000 個以上可直接上線的聲音」,涵蓋墨西哥西班牙語、魁北克法語、蘇格蘭英語這類區域變體。Flash 另開 生成式 AI 聲音設計:用自然語言 提示詞 從零指定角色、口音、聲線特徵。官方示範包括墨爾本高能量 DJ、極細單調機器聲、日本語境的龍。自訂聲音可以存檔,官方說法是後續專案要維持一致、減少漂移。聲音混音(改音色、音高、速度、口音)標成即將推出,還沒進這次上線清單。
聲音複刻只寫在 Flash 的能力敘述裡:30 秒參考音訊,加上聲音擁有者的口頭同意錄音,系統比對兩段說話人一致後才建立聲音。Lite 的「何時用」欄把聲音複刻列進去,但官方沒有另給 Lite 專屬的複刻配額或價目。複刻聲音另帶 C2PA 內容憑證;所有 Gemini Audio 產出都帶 SynthID 浮水印,官方說人耳聽不出,但能被偵測為 AI 生成語音。
上線範圍與明確不開放的地方
開發者端:兩款都進 Gemini API 與 Google AI Studio,即日起可試。AI Studio 被寫成聲音設計工作區,可從提示詞生新聲、或複刻自己的聲音,再丟進雙說話人劇本編輯器逐行導戲。企業端:Gemini Enterprise 的 API「即將推出」,沒給日期。一般使用者端:Flash 進 Gemini Notebook,Lite 進 Google Vids。
腳註寫得很硬:透過 AI Studio 做聲音複刻,在伊利諾、德州、歐洲經濟區、英國、瑞士、印度不可用。這不是「稍後開放」的行銷句,是這次公告直接劃掉的司法轄區。原因官方沒有逐區解釋。伊利諾與德州在美國州層對生物辨識與聲音權有較完整的成文法討論;歐盟與英國對生成式身分與浮水印另有監管軌道。Google 沒有說這些法域「不能用 TTS」,只說 AI Studio 這條複刻路徑不開。
整合夥伴寫了兩串。開發平台:Agora、LiveKit、Pipecat、Vercel。內容與在地化:Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang。官方把用途概括成全球配音、帶區域口音的媒體在地化、會話式語音代理。沒有公布任何一家的流量、單價或上線日。
這次是 TTS,不是 Speech-to-Speech。同一個 Gemini 3.8 家族稍早已經有 Gemini 3.8 Live 語音代理:那個產品賣的是即時雙向語音,標價走每分鐘,Speech-to-Speech 分數被拿去對 GPT-Live-1。這次公告把 3.8 TTS 放在 3.5 Live Translate、3.5 Transcribe、3.8 Live、3.8 Live Extended Thinking 後面,當音訊家族的新成員,而不是把 Live 換皮。做客服電話的人買的是代理延遲;做有聲書、短影音旁白、遊戲對白的人買的是這兩款 TTS。
開發者要改的不是模型名,是請求形狀
遷移指南把舊寫法列成會被念出來的風險。3.8 把輸入文字當逐字稿。以前可以在稿子裡寫「開心地說:你好」或「Speaker 1: Hello!」,3.8 可能把這些指示當台詞讀出。持續性的語氣(style)與說話人標籤(speaker)要搬進結構化欄位:Interactions API 用 speech_metadata 註解;GenerateContent API 在每個 part 上掛 speech_metadata。多人對話每一輪都必須帶 speaker,而且要對得上設定好的說話人名單。
行內標籤只留給當下的發聲事件,而且改成角括號,例如笑聲、嘆息、停頓。耳語這種持續風格要放進 style,不要再塞進稿子。舊的長篇 Audio Profile/導演註解,官方建議改成先在 Voice design 做好角色,之後請求只帶 voice_... ID,style 字串盡量留空或留短。
預設輸出也改了。3.1 Preview 與更早的 TTS,unary 請求預設回沒有檔頭的 raw PCM(audio/l16)。3.8 預設回帶 RIFF 檔頭的 WAV(audio/wav)。先前用 Python wave 或 ffmpeg 自己包檔頭的程式,要拿掉這層包裝,否則會得到雙檔頭。若管線仍要 headerless PCM、mu-law 或 A-law,必須顯式設 response_format。快取從 3.1 的 Not supported 變成 Supported;Batch、Flex、Priority 三條消費軌道也一起開。這些不是「比較強」的形容詞,是會讓現有管線直接報錯或帳單跳檔的變更。
輸入 8,192、輸出 16,384 沒有變。長篇有聲書仍要在客戶端切段、自己管角色一致性。官方說 Flash 能在數小時連續音訊裡維持音質、節奏與角色音色、減少說話人漂移,並原生支援單一劇本的雙說話人場面與輪替。這是產品承諾,不是把輸出上限從 16,384 取消。輸出 token 上限仍在,長篇要靠分段與已存聲音 ID 接龍。
Hume 第一名寫進稿,獨立榜用另一把尺
Google 把 Hume AI 的 Voice Design Benchmark 寫進發布稿:Flash 總分 71.4 第一,口音建模 60.8 也第一。Overall Quality Index 上 Flash 第一、Lite 第二。相對 3.1 Flash TTS,官方說長篇與雙說話人劇本控制有重大改進。Voice Arena 盲測人類偏好,官方列出日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語、印地語拿下前列。這份名單沒有把英語放進去,也沒有公布樣本數、對手名單、或與 ElevenLabs、Murf、Adobe Firefly Speech 的同場分數。
Hume 與 Voice Arena 的數字,來源是 Google 自己的發布稿。The Next Web 轉述時維持「據 Google」這層。獨立、把帳單單位換成字元的,是 Artificial Analysis:Flash 每百萬字 32.98 美元,Lite 22.07,3.1 反而是 18.31,Eleven v3 100。若創作者的成本模型是「這一集有聲書有多少字」,AA 這張表比較接近發票;若成本模型是「生成了多少秒音訊」,官方 token 價比較接近。兩邊都沒有公布同一段稿在 3.1 與 3.8 上各生成幾秒。
競品位置官方自己點了名。TNW 把 ElevenLabs、印度的 Murf AI,以及 Adobe 八月加進 Firefly 的語音生成,寫成市場上已有的專業者。ElevenLabs 走訂閱與點數,公開報價帶從每月 5 美元檔到專業複刻;舊的 Gemini 3.1 對照文把 ElevenLabs 的英語自然度仍寫成強項,並點出 3.1 當時沒有複刻。3.8 把「30 秒複刻」補上,等於直接走進 ElevenLabs 的核心功能。Adobe Firefly Speech 走創作套件內的配音,不是純 API 價目表。Google 的優勢寫在語言覆蓋、雙說話人劇本、以及進 Notebook/Vids 的產品入口;還沒被獨立側寫證明的,是英語長篇自然度有沒有真的超車 ElevenLabs 的專業複刻檔。
同意錄音、浮水印、以及複刻仍然過不了的門
官方安全敘述有三層。第一層,複刻必須另傳一段口頭同意,且要和參考說話人對得上。第二層,所有 Gemini Audio 片段帶 SynthID。第三層,複刻聲音加 C2PA。模型卡被指向「安全與責任」的細節頁。發布稿沒有說同意錄音的通過率、假同意攻擊測過沒有、SynthID 在轉碼、加速、混響之後還能不能被偵到。
深度偽造 風險沒有因為這三層而消失。30 秒樣本加上一段對得上的同意聲,門檻比「幾分鐘高品質錄音才能做專業複刻」低。州法把聲音當成生物辨識或公開權標的時,產品選擇是在部分法域關掉 AI Studio 複刻,而不是把複刻做成全球一致。企業若走 API 而不是 AI Studio,這次腳註沒有逐條寫 API 複刻是否適用同一張地圖。沒寫的部分,不能讀成「API 在歐盟可以複刻」。
生成式聲音設計走另一條路:不複刻真人,用提示詞造新角色。這條路比較不像「偷誰的聲」,比較像「用文字描述一個不存在的配音員」。商標、角色權、以及「聽起來太像某位在世演員」的糾紛,官方沒有給檢測器。2,000 個預設聲的授權範圍(商用、轉售、再授權)也沒有在這篇產品稿裡展開。要上有聲書平台或廣告聯播網的人,仍得自己對平台條款,不能假設 Google 預設聲等於已清完音樂與人聲權。
對製作流程會改到哪一段
短影音旁白、課程口播、遊戲對白、客服預錄,過去常見做法是:在 ElevenLabs 或 Murf 選聲、或請配音員,再把檔案丟進剪輯時間軸。3.8 把「用中文提示詞造一個角色聲」和「同一劇本裡兩個說話人」寫進同一套 API。Flash 適合要演、要方言、要長時間不漂的段落;Lite 適合大量、要快、可接受少一點演技的段落。Notebook 讓一般 Gemini 使用者不用自己接 API 就能用 Flash;Vids 把 Lite 塞進 Google 自己的影片工具。這代表帳單可能出現在 Gemini 訂閱、Vids 用量、或開發者 API 三個入口,官方沒有把三個入口的額度畫在同一張表上。
對已經接 3.1 Preview 的團隊,遷移成本不在換 ID,在改 metadata、改檔頭、改快取與 Priority 開關。漏改 metadata 的代價是指示詞被念出來,聽起來像事故。漏改檔頭的代價是播不了或雙檔頭。打開 Priority 的代價是音訊輸出從 9 跳到 16.20,Lite 從 6 跳到 10.80。Batch/Flex 半價,但官方沒給這兩檔的延遲保證,不適合即時代理。
和 OpenAI 的 GPT-Live 也不在同一條產品線。GPT-Live 解決的是「邊聽邊說、中途打斷」;3.8 TTS 解決的是「稿子進、音檔出」。語音代理若要先聽再答,Live 或 Speech-to-Speech 仍是另一張價目表。TTS 這次把「代理 cascade」寫進 Lite 的適用場景,意思是:上游 大型語言模型 產生逐字稿,下游 TTS 念出來。那是級聯,不是全雙工。
這次公告沒有寫出來的數字
沒有公布:每個字或每秒實際消耗的音訊 token 實測分布、英語 Voice Arena 名次、與 ElevenLabs/Murf/Firefly 的同場 MOS、複刻通過率、SynthID 在常見轉碼後的偵測率、Enterprise 上線日、聲音混音上線日、2,000 預設聲的商用授權條文、API 複刻的法域地圖是否與 AI Studio 相同。Hume 71.4 與 AA 32.98 美元/百萬字同時存在,因為一個量品質、一個量字元成本,中間缺「秒數」。
要驗證這次發布,不必等下一場發表會。開發者可以對同一段雙人劇本,分別打 gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts,看 metadata 漏寫時會不會把「開心地」念出來、unary 回應是不是 WAV、帳單是 9 還是 6。創作者可以看自己所在法域能不能在 AI Studio 開複刻。採購可以把 AA 的每百萬字和官方每百萬 token 並排進試算表,用自己稿件的字數與實際秒數各算一次。哪一欄對得上發票,以實際秒數為準。
