一小時雙向語音對話,官方標價大約 1.38 美元。這是 Google 這次把 Gemini 3.8 Live 和 3.8 Live Extended Thinking 推進 Live API 時,開發者部落格直接寫下來的數字:音訊輸入每分鐘 0.005 美元、輸出每分鐘 0.018 美元。同一份註腳把它換算成大約每百萬 Token 輸入 3 美元、輸出 12 美元。對照 OpenAI 公開的 GPT-Live-1 語音層——每分鐘 0.05 美元、按秒計費、後端模型與工具另算——同樣一小時只算語音層就要 3 美元,還沒把委派出去的推理帳單加進來。
兩套模型不是文字旗艦的語音外掛。官方產品文由 Gemini Audio 團隊署名,定位是「目前最先進的即時對話模型」:原生語音對語音、近即時視覺、對話中切換 97 種語言,並在背景執行工具與 API 呼叫、嘴巴繼續講。3.8 Live 走規模與成本;Extended Thinking 走高複雜度任務,官方稱它能邊想邊說,用「讓我查一下……」這類口頭填料先接住使用者,再把多步背景進度講出來。開發者文件把模型代碼寫死成 gemini-3.8-live 與 gemini-3.8-live-extended-thinking,輸入上限 131,072 Token、輸出 65,536,對應 模型卡 上的約 128K 上下文、64K 輸出。
這條產品線跟本月稍早的 Gemini 3.8 Flash 不是同一場發布。Flash 是文字與編程工作馬;Live 是把對話層從「語音辨識 → 大型語言模型 → 文字轉語音」三件套,收成一條原生音訊管線。The Decoder 把對手套成 GPT-Live-1:基準分數 Google 領先,自然度與全雙工仍被寫成 OpenAI 較強。SiliconANGLE、9to5Google 則把 Workspace 的 Docs Live、Gmail Live、Keep Live 和 Search Live 一併算進這次上線範圍。
官方一次放出兩個模型,鋪的面比 API 更寬
Google 產品文把能力拆成兩層。3.8 Live 強調流暢對話與視覺錨定,Speech Agent Arena 官方稱拿第二;Extended Thinking 強調企業級任務完成度,Artificial Analysis 的 Speech to Speech Quality Index 寫 82.6、總榜第一,並稱超過 GPT-Live-1-Astra 與 Grok Voice Think Fast 2.0。同一段還列出代理任務完成率:τ-Voice 68.6%、Sierra 的 τ-Voice-banking 35.1%、Big Bench Audio 97.7%。ServiceNow 的 EVA-Bench 被拿來證明「準確率與對話品質可以同時壓在 Pareto 前沿」——測試註記寫明跑在 Gemini Enterprise Agent Platform 的 Live API 上,不是任意公開端點。
上線通道不是單一開發者預覽。模型卡把 3.8 Live 的發行面寫成 Gemini API、Gemini App、Google AI Studio、Google Cloud/Vertex AI、Google Search Live;Extended Thinking 另外進 Gemini App 的 Gemini Live,以及 Google Workspace 的 Gmail、Docs、Keep。產品文更細:3.8 Live 對所有人先走 Search Live,企業走 Gemini Enterprise 私人預覽,稍後才進 Customer Experience 產品;Extended Thinking 對開發者同樣走 API 與 AI Studio,企業同樣私人預覽,一般使用者則進 Gemini Live,Google AI Pro 與 Ultra 訂戶在 Docs 可用,Gmail 與 Keep 則開放給所有 Google AI 訂戶。
開發者部落格把整合夥伴列成 Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel、Vision Agents,負責即時媒體串流,讓應用不用自己撐 WebSocket 與編解碼。產品文另點名 Salesforce、Genspark、Lumeris 對延遲、流暢度與工具呼叫有興趣。所有由 Google AI 產品生成的音訊都帶 SynthID 隱形浮水印,官方說法是可被偵測、用來壓假訊息。
架構上,模型卡寫這兩顆音訊模型「基於 Gemini 3 Pro」。輸入接受音訊、影像、影片與文字;輸出音訊與文字。訓練資料、硬體與軟體敘述幾乎整段指向 Gemini 3 Pro 的卡片,等於公開承認:Live 不是另起爐灶的新基座,是把 3 Pro 的原生多模態能力,裁成高流量、低延遲對話軌道。
每分鐘怎麼算,比「比較便宜」三個字重要
開發者部落格把 Live API 標價寫成音訊輸入 0.005 美元/分鐘、音訊輸出 0.018 美元/分鐘。The Decoder 用「一小時兩邊都在說話」把帳單加總成約 1.38 美元,對上 GPT-Live-1 語音層至少 3 美元。這組對照成立的前提要講清楚:Google 是輸入、輸出兩條計時器;OpenAI 是整段語音工作階段按秒計費,後端模型與工具再另開一張單。
OpenAI 開發者文件把 GPT-Live-1 寫成全雙工語音模型,能邊聽邊說,並把推理與工具使用委派給你指定的後端模型。語音層官方價 0.05 美元/分鐘,不進位到整分鐘;建立 WebRTC 工作階段時會先記 15 秒再抵扣。免費層不能用。並行工作階段依帳號層級從 Tier 1 的 25 條,拉到 Tier 5 的 500 條。影像與影片輸入標不支援。知識截止日期寫 2025 年 7 月 31 日。換句話說,Google 這次用「音訊分鐘」打仗,OpenAI 用「工作階段分鐘 + 後端推理」打仗,兩張發票不能直接對折。
SiliconANGLE 補了一句 Google 產品文沒放進主標價的話:Extended Thinking 還會對推理 Token 計費,影片與文件這類額外輸入也另算。開發者文件又寫,3.8 Live 的回合預設覆蓋「音訊活動加上全部影片幀」,影片幀預設會送進模型,所以「相機一直開著」會直接吃上下文窗口與帳單。遷移說明要開發者「只在需要時送幀」。這不是行銷附註,是把 Live 從「每分鐘固定價」拉回「分鐘 + Token + 視覺幀」的混合帳。
原生語音對語音要解決的,是舊式三件套的接縫。傳統棧把聲音先丟進語音辨識,轉成字再進大型語言模型,最後用文字轉語音念出來。每一跳都加延遲,打斷與語調也很難保住。Google 開發者文把 3.8 Live 寫成「級聯架構的更精簡替代」。這和站內先前寫過的 GPT-Live 全雙工是同一條產業主線:語音層自己管對話節奏,難題丟給後面的腦。差別是 OpenAI 把「嘴」和「腦」拆成兩個帳單;Google 試圖讓同一條 Live 連線在講話時就把工具跑完,Extended Thinking 再把腦力開大。
The Decoder 聽完官方示範後的判斷比較刺:Google 又在用價格換質感,OpenAI 聽起來仍更自然,全雙工讓它能同時聽與說。Hacker News 上已有開發者用 Gemini Live 做 React 全雙工串流,能中途打斷、螢幕分享、內建語音活動偵測,抱怨集中在瀏覽器 48 kHz 與模型 16 kHz 輸入、24 kHz 輸出之間的 PCM 轉換,以及 API 金鑰不能進前端。兩邊的「全雙工」不是同一句話:OpenAI 文件強調同時聽與說;Google 文件強調背景工具與邊想邊說。採購時要分清楚你要的是「對方講話時模型仍在聽」,還是「模型邊查資料邊用口頭填料撐場」。
基準分數寫了領先,銀行任務卻只過三成五
把官方點名的數字攤開,比只唸「第一名」有用。
| 項目 | 3.8 Live | 3.8 Live Extended Thinking | 對照 |
|---|---|---|---|
| 模型代碼 | gemini-3.8-live | gemini-3.8-live-extended-thinking | 舊版 gemini-3.1-flash-live-preview |
| 音訊輸入/輸出價 | 0.005/0.018 美元/分鐘 | 同左,另計推理 Token 與額外輸入 | GPT-Live-1 語音層 0.05 美元/分鐘,後端另計 |
| Speech to Speech Quality Index | 未單列第一 | 82.6,官方稱總榜第一 | 官方點名超過 GPT-Live-1-Astra、Grok Voice Think Fast 2.0 |
| Speech Agent Arena | 官方稱第二 | 未作為主打 | 偏好票,不是任務成功率 |
| τ-Voice | 未作為主打 | 68.6% | 代理任務完成 |
| τ-Voice-banking | 未作為主打 | 35.1% | 銀行場景,過半失敗 |
| Big Bench Audio | 未作為主打 | 97.7% | 聽覺推理 |
| 上下文窗口 | 輸入 131,072/輸出 65,536 | 同左 | 模型卡寫約 128K/64K |
| 語言 | 97 種,可中途切換 | 同左 | GPT-Live-1 文件未用同一套語言數宣傳 |
| 視覺 | 近即時影像/影片 | 同左 | GPT-Live-1 文件標影像、影片不支援 |
| 知識截止日期 | 2025 年 1 月 | 同左 | GPT-Live-1 為 2025 年 7 月 31 日 |
SiliconANGLE 在轉述這些分數時加了條件句:如果 Google 自己說的算數。這句該留著。Artificial Analysis 的 Speech-to-Speech 榜是第三方指數,但 τ-Voice、τ-Voice-banking、Big Bench Audio 與 EVA-Bench 都是官方選擇公開的切片,獨立、同題、跨 GPT-Live-1 與 Amazon Nova Sonic 的並排實測,這次發布材料裡沒有。銀行任務 35.1% 尤其不能當成「語音代理已經能進櫃檯」:那表示十件受監管對話,大約六件過不了 Sierra 那套測試。企業若要把 Live 接進理賠、開戶、餘額查詢,這格數字比 82.6 的品質指數更靠近真實失敗成本。
開發者文件把能力邊界寫得很乾:音訊生成支援、函式呼叫支援、Live API 支援、搜尋錨定支援、思考支援;快取不支援、程式碼執行不支援、檔案搜尋不支援、Google 地圖錨定不支援、圖像生成不支援、結構化輸出不支援、URL 上下文不支援、Batch API 不支援。Extended Thinking 的函式呼叫還更窄,只接受非阻塞非同步,同步阻塞模式會直接硬錯誤,函式排程設定也不支援。換句話說,這不是「把 Flash 的工具箱掛上麥克風」,而是一條為低延遲對話裁過的軌道。你若指望它在通話裡寫程式、讀雲端硬碟、或回穩定 JSON,文件已經先說不行。
模型卡 的限制清單同樣不修飾:一般基礎模型的幻覺仍在,越獄防護仍在加強,偶發緩慢與逾時,知識截止日期停在 2025 年 1 月。對 2026 年秋天的即時語音代理來說,知識停在一年半前,代表「今天幾點的航班、這週的保單條款、剛剛改過的內部流程」都不能靠模型記憶,只能靠工具與錨定。搜尋錨定有開,地圖錨定沒開,企業知識庫也沒有檔案搜尋。能用的路徑是你自己的非同步函式,把最新事實從業務系統拉回來,再讓模型用嘴講。
前沿安全評估的寫法值得單獨讀一遍。Google 說 Gemini 3.8 Audio 屬 Gemini 3 系列,評估對象其實是 Gemini 3.7 Flash,結論是未達到任何 Tracked 或 Critical Capability Level;再推論 3.8 Live 與 Extended Thinking「沒有有意義的新能力或實質性能提升」,因此不太可能跨過那些門檻。這是在告訴安全審查者:語音軌道不算新的前沿能力躍遷。對想拿 Live 做客服的團隊,這句話降低的是「會不會被當成高風險模型」的合規摩擦;它沒有降低銀行任務失敗率,也沒有把知識截止日期往前推。
從 3.1 Flash Live 搬過來,預設行為已經換過一套
9to5Google 把上一世代定在 3 月的 3.1 Flash Live。開發者文件這次給的不是「換型號字串就好」,而是一張會讓舊客戶端出錯的變更表。
模型字串要從 gemini-3.1-flash-live-preview 改成 gemini-3.8-live。3.8 Live 不支援 thinking_level,工作階段設定裡放 thinking_config 會不適用,必須拿掉。非同步函式呼叫變成預設,behavior: NON_BLOCKING;要舊的同步阻塞,得在工具宣告上顯式寫 BLOCKING。函式排程仍可用 SILENT、WHEN_IDLE、INTERRUPTED。send_client_content 整段工作階段都能送,角色要標 user 或 model;turn_complete=true 會無條件打斷正在生成的內容。主動語音永遠開啟,設 proactive_audio: false 會報錯。情感對話(affective dialogue)從 API 移除,enable_affective_dialog 必須刪。回應模態以音訊為準,若應用需要文字稿,要另外打開輸出音訊轉寫。
Extended Thinking 的協定更麻煩。文件寫:turnComplete: true 不再代表模型閒置,伺服器可能還在跑背景推理或工具;客戶端必須繼續聽後續的工具呼叫與音訊幀。判斷是否真的結束,要看 interaction_status:IN_PROGRESS 表示還在處理、推理或等工具回來;IDLE 才是全部做完、等使用者下一句。思考檔位用 thinking_config 的 low/medium/high,沒有 MINIMAL。誰若把「回合結束事件」當成掛斷條件,Extended Thinking 會在工具還沒回來時就把連線拆掉。
這些變更直接改AI 代理的狀態機。舊的語音機器人多半假設:使用者說完 → 模型想完 → 模型說完 → 下一輪。3.8 Live 的預設是:使用者還在聽回覆時,工具已經在背景跑;Extended Thinking 還能在回覆進行中繼續推理。產品示範裡的「讓我查一下」不是文案,是把延遲藏進對話禮儀。代價是可觀測性變難。若你的質檢系統只抓完整回合文字,而轉寫又要另外開啟,線上監看會漏掉半句。
Reddit 上跑 3.1 Flash Live 電話代理的開發者,已經把這層摩擦寫成實測。有團隊從亞洲打到美國節點,端到端平均約 922 毫秒,低於部分人口中的「低於 300 毫秒」,美國東岸同業回報約 400–600 毫秒;有人在歐盟看到 2 秒,有人把音訊先送進自己的伺服器再轉發,往返拉到 3 秒以上甚至 7 秒。社群共識很土:真正串流、20–40 毫秒的二進位 PCM 幀、同區域、長連線、一聽到位元就開始播放;一做緩衝或 Base64 轉碼,官方的「近即時」就會消失。另一個常踩的坑是通話中文字稿:有人以為只能通話結束後才拿到,有人指出 Live API 可在 setup 打開 inputAudioTranscription 與 outputAudioTranscription,轉寫會跟音訊塊一起從 serverContent 流出。3.8 文件把「需要文字就開輸出轉寫」寫成正式要求,等於承認語音軌道預設不給你一份乾淨逐字稿。
開發者部落格同期還把上個月上線的 Gemini 3.5 Transcribe 拉進同一套音訊工具箱:85 種以上語言,串流詞錯誤率 4.0%、非串流 2.6%,支援句中切換語言、最多 1,000 詞的自訂詞彙偏置,以及去掉語助詞的「智慧轉寫」。它不是 Live 模型,但說明 Google 把「聽」和「聊」拆成兩條可買的能力。客服場景很常見的做法會是:Live 負責對話,Transcribe 負責事後質檢與工單。兩者價目與延遲不能混著估。
消費者端先鋪 Search 與 Workspace,企業端仍是預覽
對沒用 API 的人,這次更新會先出現在已經存在的語音入口。3.8 Live 進 Search Live,也就是搜尋裡用講的那條路。Extended Thinking 進 Gemini Live 應用,並接到 Docs Live、Gmail Live、Keep Live。9to5Google 把這三個 Workspace 入口翻譯成可執行的事:Gmail 用對話找信、Docs 用語音起稿與改稿、Keep 用語音做筆記。Google AI Pro 與 Ultra 訂戶在 Docs 拿到 Extended Thinking;Gmail 與 Keep 則寫成所有 Google AI 訂戶。企業工作區的 Docs Live 仍標「即將提供」。
這套鋪法跟文字旗艦很不一樣。Flash 系列在搶編程與智能體化 AI 的工作馬市場;Live 系列在搶「手沒有空、眼睛盯著別的東西」的分鐘數。產品示範包括即時視覺引導新人到職、看棋盤講下一步、把草圖加語音回饋變成 React 元件、多步訂位與非同步函式、以及用語音現場組商業計畫。這些影片證明的是管線接得上,不是銀行級任務已經過關。
Gemini Enterprise 與 Customer Experience 仍是私人預覽。Salesforce 被寫進夥伴名單,和本週 Dreamforce 的企業代理敘事疊在同一周,但不等於 Koa 或 ClaudeForce 已經預設走 3.8 Live。採購時該問的是:預覽名額、資料駐留、與現有 Gemini Enterprise 代理平台是否共用同一個 Live 端點,以及 EVA-Bench 那次「官方自測」能不能在你自己的工單資料上重跑。
安全與合規有兩條平行線。一條是 SynthID,音訊輸出帶隱形浮水印,官方用來打假。一條是前沿安全框架,結論是這兩顆 Live 模型不太可能跨過高風險能力門檻。中間缺的是:通話內容怎麼留存、轉寫預設關閉時質檢怎麼做、浮水印在電話網路再編碼後還能不能偵測、以及知識截止日期停在 2025 年 1 月時,模型會不會用自信口吻講過期事實。這些不是模型發表會的主題,卻是客服、金融、醫療語音代理上線前一定會被法務問到的題。
對開發者工作流,這次真正改動的是狀態機與帳單,不是又一個聊天機器人皮膚。Pipecat、LiveKit、Vercel 這類串流層被官方點名,代表 Google 承認大多數團隊不會自己碰 16-bit PCM。函式預設非阻塞,代表提示詞與工具描述必須能容忍「模型先應聲、結果後到」。沒有快取,代表長通話無法靠 context caching 省錢,只能靠你自己截斷歷史。沒有程式碼執行,代表它不是雲端 IDE。沒有結構化輸出,代表你不能假設它會回穩定 schema,要把結構放在你的工具層。
競爭位置可以收成三句,不用再喊贏家。對價格敏感、要視覺、要 97 語、要自己接工具的團隊,Google 把每小時語音層壓到大約 1.38 美元,並把 Search 與 Workspace 的現成入口一起打開。對要邊聽邊說、把推理明確拆給可選後端模型的團隊,GPT-Live-1 的 0.05 美元/分鐘加上另開的腦力帳單,架構更接近「嘴與腦分帳」,也仍被第三方聽感判斷為更自然。對已經在亞洲或經代理伺服器跑 Gemini Live 的人,922 毫秒到 3 秒的實測提醒:官方示範裡的流暢,高度依賴區域與是否零拷貝串流。τ-Voice-banking 的 35.1% 則是一條紅線——語音代理可以先做導覽、預約、內部協助,把受監管的銀行對話留到你自己的評測集過關再談。
要驗證這次發布夠不夠買,不必等下一場發表會。用你實際所在區域對 gemini-3.8-live 打 50 通兩分鐘的真電話,記下首音延遲與整段往返;同一組腳本再打 Extended Thinking,核對 interaction_status 何時才變 IDLE,以及推理 Token 帳單比基礎 Live 高出多少。把相機打開與關掉各跑一次,看影片幀預設上傳把費用拉多少。拿十件真實銀行或保險對話對過 τ-Voice-banking 的精神,而不是只看 82.6 的品質指數。最後把 GPT-Live-1 的語音層 3 美元/小時加上你實際會委派的後端模型,跟 1.38 美元那張 Google 發票放在同一張試算表。誰便宜,要看你的工具有多吵、你的使用者會不會中途打斷,以及你能不能接受知識停在 2025 年 1 月的模型,靠工具把今天的事實補回來。
