六週內第三個 Flash,旗艦還是沒現身。google|Google 上線 gemini|Gemini 3.8 Flash,官方把它寫成「目前最聰明的工作馬」:軟體工程、[agentic-ai|智能體化 AI](/dictionary/agentic-ai|智能體化 AI) 任務,以及專業領域的多步推理,都要比三週前的 3.7 Flash 再往上跳一截。同日還有第二個封套——3.8 Flash Cyber,走 Fairwind Program,只給通過審核的防禦端。The Decoder、9to5Google、Artificial Analysis 與多家產業媒體同步拆官方數字;共同主線很清楚:便宜的工作馬又變聰明了,但「每百萬 token 不變」不等於「每件事一樣便宜」。
你如果剛換完 3.7,第一反應大概是:又來了?這正是這則消息的張力所在。Google 新任 DeepMind 負責人 Koray Kavukcuoglu 公開強調,公司不是只在做性價比優化,仍想在原始能力上領先。可市場眼前看到的,仍是 Flash 系列以三週節奏連續出貨,而 Gemini 3.5 Pro、Gemini 4 這類前沿旗艦的公開時間表依舊缺席。節奏本身可以讀成執行力,也可以讀成用工作馬填補旗艦空窗——兩種讀法都成立,端看你站在採購、投資還是研究那一側。
兩個封套:公開工作馬,與上鎖的防禦版
3.8 Flash 是通用推理與編程模型;3.8 Flash Cyber 則承接先前 3.5 Flash Cyber 的位置,不公開對一般開發者開放。Google 透過 Fairwind Program,把 Cyber 版發給政府機構、關鍵基礎設施營運商與軟體維護者。官方說法是:為了做防禦向的自主漏洞發現,它的安全閘門比標準版更鬆——這句話本身就說明,能力與存取控制被拆成兩條產品線,而不是同一個 API 開關。
對一般開發者與企業團隊,今天真正能摸到的仍是標準 3.8 Flash。入口包括 Google AI Studio、Google Antigravity、Android Studio、Gemini api|API,以及企業端的 Gemini Enterprise。消費端則進 gemini|Gemini App(Google AI Pro/Ultra)、Search 的 AI Mode,付費訂閱還能在 Google Sheets 裡用到。知識截止日期官方寫得相當誠實:部分領域到 2026 年 3 月,另一些領域你可能會感覺模型知識仍停在 2025 年 1 月附近——遷移評測時,別假設「新版本=全世界都更新到昨天」。
標價沒變,單任務帳單卻可能變貴
導入價維持與 3.7 Flash 同一檔:每百萬 token 輸入 0.75 美元、輸出 3.75 美元,優惠吃到年底(12 月 31 日);2027 年元旦起回到常規 1.50/7.50。對照同日仍在市面上的前沿標價,Claude Opus 5 約 5/25,GPT-5.6 Sol 約 4/20——就算導入期結束,3.8 Flash 的每 token 單價仍明顯低於那一層。
真正要盯的是 Artificial Analysis 的「每任務成本」。在 Intelligence Index 同檔水準上,3.8 Flash 仍落在 Pareto 前沿,單任務約 0.58 美元,是該智力檔裡最便宜的之一;但相對 3.7 Flash 的約 0.40 美元,大約貴了四成。每 token 價沒漲,任務帳單卻上漲——官方自己也解釋了原因:複雜任務上,3.8 會多跑推理步、迭代呼叫工具,「工作更勤」。勤快換來基準分數,也換來更多 reasoning-tokens|推理標記 與工具回合。Google 因此公開建議:若你最在意算力效率,可以調低 reasoning 等級,或乾脆繼續用仍受支援的 3.7 Flash。
| 模型 | 輸入/輸出(美元/百萬 token) | 備註 |
|---|---|---|
| Gemini 3.8 Flash(導入至年底) | 0.75/3.75 | 與 3.7 導入價相同 |
| Gemini 3.8 Flash(2027 起常規) | 1.50/7.50 | 仍遠低於 Opus/Sol 門面價 |
| Claude Opus 5 | 約 5/25 | 前沿層 |
| GPT-5.6 Sol | 約 4/20 | 前沿層 |
吞吐面上,高 reasoning 時 3.8 Flash 輸出大約每秒 300 token,平均每任務約 2.5 分鐘;低 reasoning 可壓到約 48 秒。同檔對照:Claude Fable 5.1 約 2.1 分鐘、舊的 3.7 Flash 約 2.2 分鐘、GPT-5.6 Luna/Terra 約 2.6/3.3 分鐘。換句話說,3.8 不是靠「更快吐字」贏,而是靠「願意多想幾步」換分——這會直接反映在代理流水線的延遲與發票上。
基準:DeepSWE 貼上 Opus 5,但真實體感仍要自己跑
Google 自報長程軟體工程基準 DeepSWE v1.1:3.8 Flash 73.7%,只差 Claude Opus 5 的 74.0% 一點點,明顯高於 Claude Sonnet 5 的 53.8%、GPT-5.6 Sol 的 72.7%,以及前任 3.7 Flash 的 65.3%。官方還強調,在許多基準上 3.8 Flash「常常逼近更高價的前沿模型」;9to5Google 轉述的官方語彙則是:軟體工程、代理任務與專業領域多步推理都有「substantial gains」。
| 基準/指標 | Gemini 3.8 Flash | 對照 |
|---|---|---|
| DeepSWE v1.1 | 73.7% | Opus 5 74.0%;Sol 72.7%;3.7 Flash 65.3%;Sonnet 5 53.8% |
| Artificial Analysis Intelligence Index | 59 | 3.7 Flash 56;與 Sol(xhigh)、Grok 4.6(medium)同檔 |
| HLE-Verified | 54.9% | 官方用來展示多步推理與專業分析 |
| 單任務成本(AA) | 約 0.58 美元 | 3.7 Flash 約 0.40 美元 |
定量與專業代理場景,Google 點名 Vals Finance Agent V2 與 Harvey 的 Legal Agent Benchmark:3.8 Flash 勝過 3.7,也勝過部分前沿對照。這些是垂直代理榜,不是「聊天 Elo」;對做財務自動化、法務草稿管線的團隊,意義比通用問答榜更直接。官方示範則繼續走「工作流編排」敘事:在 Antigravity 裡用單一 prompt|提示詞 生成 3D 小遊戲,貼圖交給 Nano Banana 影像模型——行銷片不是基準,但說明產品想賣的是 code-generation|程式碼生成 加上工具鏈,而不是單輪對話。
獨立評測端,Artificial Analysis 把 Intelligence Index 從 56 拉到 59,增益主要來自代理向的工具使用與編程任務。這和 Google 自己強調的「多推理、多工具」一致。提醒一句老話:基準會騙人,真實 repo、真實權限、真實延遲與真實發票才不會。3.8 若在你的內部套件上多花 40% token 才換來 5% 通過率,那它對你就不是 Pareto,只是比較會加班的實習生。
Flash Cyber:Fairwind 上的防禦專線
3.8 Flash Cyber 不進公開價目表。Google 說它在自主漏洞發現上接近前沿水準。CyberGym(C/C++ 漏洞偵測產業基準)官方報 86.2%,高於前代 3.5 Flash Cyber 的 77.5%,也高於 GPT-5.6 Sol 的 83.6% 與 GPT-5.5-Cyber 的 85.6%。外部 CWE-Bench 自動修補 Pass@1 來到 47.2%,幾乎貼上領先前沿模型的 47.8%,但成本敘事仍是「便宜一個數量級的工作馬去做接近前沿的防禦活」。
提示詞注入抗性同樣被拿出來打。Gray Swan IPI 上,標準 Gemini 3.8 Flash 的攻擊成功率約 5.5%;DeepSeek V4 Pro 約 60.1%、Kimi K3 約 52.7%、Grok 4.6 約 51.8%。anthropic|Anthropic 的 Claude Opus 5 約 4.8%,略優;若再加上 Claude 生態內的額外安全選項,還能再壓低。對會把外站內容、郵件、工單原文直接塞進 ai-agent|AI代理 的團隊,這個數字比「又一個資安模型」更有採購意義——它談的是prompt-injection|提示詞注入成功率和代理失控半徑。
把 Cyber 線放回更大的產業脈絡:同日 openai|OpenAI 也在把 Astra 的網路能力標成 Critical、把進階能力鎖進 Daybreak 藍隊軌道。Google 選擇的是另一條路——用獨立封套+受審分發,而不是把最強攻防能力直接掛上一般 API。兩邊都在回答同一件事:前沿 llm|大型語言模型 的網路能力已經不能再用「聊天產品安全政策」隨便包一層。
實務上,標準 3.8 的 5.5% IPI 攻擊成功率,已夠讓多數消費級與一般企業代理拿來當「相對抗注入」的參考點;但別把它讀成免疫。灰天鵝式攻擊、多輪社會工程、以及工具回傳裡夾帶的惡意指令,仍會穿過任何單一基準。Cyber 版則是另一個採購宇宙:你要的是自主挖洞與修補接近前沿的通過率,代價是審核、合約與可能永遠進不去的等候名單。
跟誰比、什麼時候該留在 3.7
同日 Anthropic 還放出 Fable 5.1,主打快取讀取大砍、高度代理工作負載可省到約四成五。兩邊打法不同:Fable 用「讀已處理上下文更便宜」去降代理帳單;Gemini 3.8 用「願意多想、多呼叫工具」去推基準,再誠實告訴你 token 用量可能上升。若你的瓶頸是長上下文反覆前綴,Fable 的快取故事更刺耳;若你的瓶頸是長程軟體工程分數與工具規劃品質,3.8 的 DeepSWE 貼邊 Opus 才是新聞點。
相對自家 3.7,遷移清單可以很務實:
- 先用同一組內部評測集,固定 temperature/reasoning 檔位,比通過率、平均 token、平均牆鐘時間三欄,不要只看官方表。
- 代理流水線若工具呼叫本來就密,預設假設單任務成本上漲,再決定要不要用低 reasoning 檔換回來。
- 效率優先、分數已夠用的批次任務,留下 3.7 完全合理——官方自己也這麼說。
- 需要防禦向自主挖洞、且你進得了 Fairwind,才去評估 Cyber;一般 SaaS 後端排程用不到那條線。
- 旗艦空窗還在:若你的路線圖綁的是「等 Gemini 前沿 Pro/4 再上生產」,Flash 連發改變的是過渡期工具選擇,不是把旗艦時程變出來。
開發者工作流上,Antigravity、AI Studio 與 Gemini API 同步可取,意味著「新模型先在 IDE/代理編排器裡被用起來」比「先發一篇研究博客」更像這次的預設路徑。對已經把 3.7 嵌進 CI、code review bot 或多代理編排的團隊,升級成本主要在評測與成本監控,不在換 SDK。對還沒建立 token 儀表板的團隊,3.8 反而可能變成帳單驚喜——因為標價看起來沒變。
企業採購與路由:別被「導入價沒變」骗到
採購問卷若只問「百萬 token 單價」,3.8 會看起來像 3.7 的免費升級。真正該改的欄位是:平均每任務 token、P95 延遲、工具呼叫次數、以及在固定預算下能跑完的任務數。Artificial Analysis 把單任務成本從約 0.40 拉到約 0.58,等於用同一張價目表,告訴你模型變勤快之後,錢包要重新校準。
對已簽 Gemini Enterprise 或雲端承諾用量的團隊,這通常變成路由策略問題,而不是「要不要換成 Google」的二選一。高分、高風險、長程工程任務走 3.8 high;摘要、分類、格式轉換、已穩定的批次 ETL 留在 3.7 或更低檔。官方保留 3.7 支援,等於默許雙模型並存。別急著在控制台把預設模型一鍵切掉——先做影子流量兩週,看發票曲線與失敗率哪個先爆炸。
另一個常被忽略的細節是輸出長度與context-window|上下文窗口策略。代理若習慣把整倉 diff、整份測試紀錄、整段瀏覽器 DOM 來回塞,3.8 的「多想幾步」會把本來就肥的上下文再放大。此時該優化的是檢索與摘要層,而不是指望換 Flash 小版本自動變便宜。換句話說:3.8 獎勵的是「問題難、步驟長、工具要迭代」的工作;它懲罰的是「上下文髒、提示詞鬆、工具亂槍打鳥」的工作。
跟同日戰場的對照,不只是分數表
把鏡頭拉遠,這天的產品新聞幾乎像排好的對照實驗。Google 用 3.8 Flash 證明:工作馬可以把 DeepSWE 推到貼齊 Opus 5,同時維持個位數美元級的百萬 token 導入價。anthropic|Anthropic 的 Fable 5.1 則證明:旗艦層也可以靠快取讀取大砍,讓高度代理帳單掉一截。OpenAI 同日的敘事重心卻在能力分級與網路風險——Astra 被標成 Critical 網路能力,進階能力鎖進受控軌道。三家都在賣「能幹更久的代理」,但一家用更勤快的推理換分,一家用更便宜的上下文重讀換帳單,一家用更嚴的能力閘門換部署許可。
對開發者社群,這意味著 2026 下半年的預設問題不再是「哪個聊天比較會寫詩」,而是:
- 你的任務是分數瓶頸,還是帳單瓶頸?
- 你的代理失敗比較常出在規劃品質,還是出在重複上下文太貴?
- 你有沒有資格/需求去碰防禦向專線(Fairwind、Daybreak 之類)?
答得清楚,模型選擇就清楚;答不清楚,就會變成每三週追一次 Flash 版本號的疲勞賽。
三週前的 Gemini 3.7 Flash 已經把「編程與代理主力+年底前半價導入」這套劇本演過一輪。3.8 幾乎是同一劇本的加強版:導入價不動、基準再跳、再加一條 Cyber 封套,並更直白地承認 token 用量可能上升。若你當時因為 3.7 的 DeepSWE 65.3% 而觀望,現在 73.7% 貼邊 Opus,觀望理由變少;若你當時已經因為帳單可控而全量切到 3.7,現在反而要小心「看起來免費的升級」。
下一步要驗證什麼
這不是「Google 又贏一輪」的收束句,而是一張可執行的觀察清單。
首先看 DeepSWE、Vals Finance、Harvey Legal 這類代理榜,會不會在第三方複測裡被壓回現實;官方表漂亮,不代表你的權限模型與私有工具鏈同樣漂亮。其次看導入價結束後,企業合約是否仍能鎖住接近 0.75/3.75 的有效單價——若 2027 年一開年就被迫吃 1.50/7.50,再加上更高的每任務 token,總成本曲線會比今天簡報上的數字刺眼。第三看 Fairwind 的實際准入速度與使用條款:Cyber 分數再貼前沿,進不去、不能用於你的資產範圍,就等於沒有產品。第四看旗艦是否繼續缺席;若 Flash 還以三週節奏出貨,而 Gemini 3.5 Pro/Gemini 4 持續無日期,市場會更篤定地把 Google 的前沿敘事讀成「工作馬策略」,投資人與研究社群的耐心會分開計價。
最後,也是最土的一條:把 3.7 與 3.8 在你自己的 repo、同一組隱藏測資上跑同一夜,並列通過率、平均 token、P95 延遲、人工介入次數。通過率漲幅蓋得過那大約 40% 的單任務成本,再切預設路由;蓋不過,就讓 3.8 先當評測分身與高難度分流,別急著全站升級。工作馬可以很聰明,但發票不會因為官方形容詞而自動客氣。
