旗艦還在遲到,工作馬先降價出閘。Google 上線 Gemini 3.7 Flash,官方定位「目前最聰明的工作馬」——專打編程、AI 代理與知識工作。距離 3.6 Flash 只隔約三週。導入價把每百萬 token 壓到輸入 0.75 美元、輸出 3.75 美元,至年底;2027 年元旦起回到 1.50/7.50。Google 官方部落格、Cloud 文件、DeepMind 模型卡、VentureBeat、Decrypt、MarkTechPost 同步放出規格與對照表。
這不是「又一個更快聊天模型」。產品敘事把重點放在:少重試、少人盯、多步規劃與工具呼叫更勤——代理帳單通常不是單次問答,而是一串推理+工具回合。半價導入等於用幾個月窗口,讓團隊用真實任務成本驗證這句話。官方示範也往這個方向堆:用 3.7 搭配影像模型即時生成可玩 3D 遊戲素材、編排子代理做互動落地頁、在三代理迴圈裡幫機器人訓練加速、把年報 PDF 轉成帶即時圖表的網頁故事。這些是行銷片,不是基準;但它們說明 Google 想賣的是「工作流編排」,不是單輪聊天 Elo。
規格:1M 上下文、多模態進、文字出
Cloud 文件把模型 ID 寫成 gemini-3.7-flash,GA。上下文 1,048,576 token,最大輸出 65,536。輸入支援文字、影像、音訊、影片;輸出文字。工具面含 Google 搜尋/地圖 grounding、程式碼執行、函式呼叫,以及 Computer use 預覽。Thinking、系統指令、結構化輸出、隱式/顯式 context caching 皆支援;Gemini Live API 與微調則標不支援。區域可走 global 以及 us/eu 多區域。
相對 3.6,Google 說 3.7「想得更勤」:遇到路障會改路線、必要時釐清意圖、指令遵循更緊。這和 3.6 曾強調「少推理步、少對話輪、少工具呼叫以免 spiraling」不太一樣——這次比較像把努力花在規劃品質,而不是把步數壓到最低。Batch、Flex/Priority PayGo、Provisioned Throughput 等消耗選項寫進 Cloud 價目;固定配額則標不支援。對高併發代理,這比「能不能聊天」更決定能不能上線。
基準:編程大躍,但不是全面稱霸
官方表相對 3.6 Flash 的代差很硬,對競品則互有勝負:
| 基準 | 3.7 Flash | 3.6 Flash | 對照(Google 表) |
|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% | Sonnet 5 42.7%;GPT-5.6 Terra 41.3% |
| DeepSWE v1.1 | 65.3% | 約 49% | Terra 69.6% 仍領先 |
| WebDev/Code Arena Elo | 1588 | 1538 | Sonnet 5 1541;Terra 1523 |
| Terminal-bench 2.1 | 85.8% | 78.0% | Terra 87.4% |
| Terminal-bench 3.0 | 14.9% | 5.4% | Terra 20.8% |
| AutomationBench | 30.4% | 17.0% | Sonnet 5 10.7%;Terra 23.6% |
| GDP.pdf | 34.0% | 22.0% | Sonnet 5 28.0%;Terra 24.7% |
讀法應壓住:3.7 在生產程式碼品質、網頁 Arena、企業工作流與複雜 PDF 上對自家上代與部分中階對手明顯前移;長視野軟工與終端代理,Terra 仍常領先。Artificial Analysis Intelligence Index 敘事約 56(3.6 約 52),未回到 Opus 5 那一檔。Arena 早期人類偏好暫列整體約第九、網頁開發約第八——這是工作馬定位,不是「全面取代旗艦」。
價格戰的真正單位:成功完成一次任務要多少錢
導入價相對 3.6 標準檔(1.50/7.50)約半價;context cache 導入約 0.075/百萬,2027 年元旦起約 0.15。Google 表上 Sonnet 5 約 2/10、Terra 約 2/12——3.7 導入檔明顯更便宜。代理場景一次使用者請求可能觸發長串模型呼叫與推理 token,每百萬單價低但重試多,總帳不一定贏。Google 賭的是:首過準確率與少監督,能把「每次成功任務成本」壓下來。這要各團隊用自己的 repo、工具 schema 與失敗模式驗,不能只看價目表。
通路、安全與和 Ultrafast 怎麼並讀
通路已鋪開:Gemini API(AI Studio、Android Studio)、Antigravity、Gemini Enterprise Agent Platform/Enterprise app;個人則是 160 餘國 Google AI Pro/Ultra 訂戶的 Gemini Spark(24/7 個人代理)改跑 3.7,強調 Workspace 工具使用——整檔、起草郵件、更新狀態文件。安全面稱更新 CBRN 與網路攻擊濫用護欄。模型卡另列可調 thinking,讓品質、成本、延遲可切。企業若把 3.7 當高頻代理腦,應同時量測:thinking 開多大時單位任務成本仍划算、Computer use 預覽在真實桌面任務的失敗模式、以及半價結束後是否要備援路由到更便宜的執行層模型——這和前兩日 Nemotron Lightning 執行層 的分工邏輯可以並存,不必把所有步驟都丟給 3.7。
同一天 OpenAI 也把速度當產品:Decrypt 等報導 GPT-5.6 Sol Ultrafast 屬邀請制服務檔,跑的是既有 Sol、靠 Cerebras 把輸出推到約 750 token/秒、約為標準 Sol 的 14 倍——不是新權重,是更快的軌道。Google 走「全面 GA+半價工作馬」;OpenAI 走「旗艦能力、限量加速」。兩邊都在從「誰最聰明」轉到「代理能不能等得起下一輪工具呼叫」。3.7 的優勢在可買、可鋪、可算帳;Ultrafast 的優勢在延遲敏感場景(語音棧被客戶點名),但還不是人人能開。
為什麼這則和「Pro 失蹤」必須並讀
同一則發布沒有給 Gemini 3.5 Pro 時程。Reuters/Axios 等指出:原訂夏季旗艦仍在夥伴測試或內部未達標(尤其編程),公司最新公開通用 Pro 仍是較早的 3.1 Pro;另有 Gemini 4 訓練中的敘事。這落在 Hassabis 改任主席、Jeff Dean 離職創 Discovery Loop 之後:日常 Gemini 鏈更集中在產品導向的營運手上,Flash 三週一更,像在證明「算法改進不必等下一代旗艦才能進生產」。外界解讀從「組織修復」到「雲生意優先、自有旗艦讓位」都有;Google 未證實取消 3.5 Pro,官方仍稱延遲。Gemini app 月活據報已逾 9.5 億,分發優勢不完全綁死在排行榜第一。
對開發者,節奏本身也是營運成本:模型變快,生產線仍要回歸測才敢切。對企業,3.7 給的誘因是——在中階價帶裡把編程/文件/工作流代理跑起來,用年底前的半價窗口算清楚單位任務成本;元旦翻倍後,優勢能不能留下,取決於生產可靠度,不是再刷一輪 Arena。
採購上不該只問「比 Terra/Sonnet 便宜多少」。該問的是:你們的代理平均幾輪工具、thinking 預設開哪一檔、失敗重試佔多少 token、cache 命中率能不能把有效輸入價打到導入檔的十分之一量級。Google 表上 3.7 並未全面壓過 Terra;若工作負載偏 Terminal-bench 3.0 或 OS 桌面,半價也買不回缺口。若負載偏 PDF 工作流、網頁生成與中等軟工,導入窗口值得認真跑影子流量。CharXiv 類題官方表甚至出現相對 3.6 的小幅回落——代差不是單調上升,回歸測清單裡要留「不該變差的題」。
旗艦敘事要等 Pro 或 4;這則新聞先把工作馬的價錢與代差釘上桌。下一步驗證:獨立基準是否複製 FrontierCode/AutomationBench 代差;Spark 在 Workspace 的工具錯誤率;2027 價目生效前後的實際切換率。Google 用三週一更證明 Flash 還能跑——能不能補上缺席的 Pro,是下一則該寫的題。
