返回資訊
AI趨勢入門

Gemini 4 Argon 先給 Fairwind:輸出 100 萬 token、導入價 2/10;獨立榜智力 53 打平 Astra,幻覺 15%

2026年10月1日
易賺Ai團隊
21 分鐘閱讀
#Gemini#Google#Argon#Fairwind
Gemini 4 Argon 先給 Fairwind:輸出 100 萬 token、導入價 2/10;獨立榜智力 53 打平 Astra,幻覺 15%

Google 把旗艦模型的價目表先貼出來了:導入期每百萬 Token 輸入 2 美元、輸出 10 美元,上下文緩存 再打九五折;導入期結束後改成 4/20。公開的 Gemini API 目錄裡,此刻找不到 Argon 的 model ID。Koray Kavukcuoglu——Google DeepMind 資深副總裁兼首席 AI 架構師——在官方部落格寫:Gemini 4 Argon 先滾給 Fairwind Program 裡一組受信任的網路防禦夥伴;公司內部團隊拿到的是拿掉網路護欄的版本。付費 API 客戶與 Google AI Ultra 訂戶排在「下一步」,日期寫的是 as soon as possible。

Sundar Pichai 在 X 上說,外面討論很多,他想盡早給一個 early look。DeepMind 主管 Kavukcuoglu 上週才在活動上講這顆 大型語言模型 已進後訓練、希望比年底更早放出初版。這次交出來的是預覽加受限部署,不是消費者能打開的聊天室。TechCrunch、SiliconANGLE、The New Stack、The Decoder、Axios、CNBC、Ars Technica 與科技新報同日把同一套數字攤開;Bloomberg 另有一條員工側寫,說榜上好看、真寫程式有人覺得吃力。Google 回 Bloomberg:說 Argon 在編程上不如預期,並不準確。

官方先講了什麼、沒講什麼

Kavukcuoglu 把定位寫成三塊:真實世界軟體工程、法律與金融這類企業知識工作、網路安全防禦。官方句子是「在複雜、長時程工作流上維持深度推理」。Safely releasing 這一級能力「需要分階段」。公司說正在參加美國政府自願性的前沿模型發布前取用流程——同一週白宮才讓六家實驗室簽了沒罰則的 Super Intelligence 協議,站內已拆過那兩頁紙寫了什麼。

能核對的硬規格,官方部落格寫死的是輸出上限:從上代 Gemini 的 6.4 萬 token 拉到 100 萬。理由寫得很直:單次軌跡能生出數十萬 token,才有空間把難題一次想完。The Decoder 補了一句部落格沒用同樣字眼寫清楚的話:輸入 上下文窗口 仍是 100 萬 token;接受文字、影像、影片、音訊,輸出只出文字。The Rundown 的產品頁更謹慎,說發布文沒有另列一條公開的輸入上限,不該把「輸出 100 萬」直接讀成「輸入也是新數字」。Vals 上這顆模型的最大輸出記成 26萬2144 token,跟官方「100 萬輸出」對不上——現在能看見的服務端配額,跟行銷頁不是同一張紙。

公開目錄沒有 model ID、沒有配額、沒有地區、沒有工具與快取的計費細則。買了 Ultra 也不等於今天能調到 Argon。The Decoder 寫 Google 會在 Gemini API 加 Long Decode Continuation:長回應先暫停,再用後續請求接回去,避免推理撞超時。這項能力有沒有進 Fairwind 現網,官方沒給時間表。

Fairwind 本身不是新牌子。SiliconANGLE 寫這個計畫 9 月 3 日跟著較小的 Gemini 3.8 Flash Cyber 開張,至今簽了逾 650 個組織,名單裡有 CrowdStrike 與 Palo Alto Networks。成員與 Google 內部拿到的 Argon,網路護欄是拿掉的:官方說模型能自主找出、驗證並修補關鍵軟體漏洞。一般開發者看到的那個拒絕「幫我寫攻擊」的版本,不是防禦夥伴手上的那份。

官方圖表贏了多數,編程不是全勝

Google 自己貼出的對照表,The New Stack 把 18 項逐列排過。VentureBeat 數過,18 項裡 Argon 獨走 12 項。知識工作那一欄差距最大。

項目Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
Vals Index68.9%63.1%65.8%67.0%
AutomationBench51.3%41.4%31.4%42.5%
Vals Finance Agent v265.4%53.5%58.9%58.6%
Harvey Legal Agent19.6%5.4%6.7%3.8%
DeepSWE v1.177.9%74.1%67.4%74.2%
FrontierSWE v255.0%65.5%56.3%62.3%
Vibe Code Bench91.9%89.6%90.3%90.3%
Terminal-bench 4.057.4%58.2%57.9%66.4%
PostTrainBench45.3%44.3%40.2%49.3%
Terminal-Bench Science57.6%68.1%52.6%63.3%
GraphWalks(至 128k)99.7%98.7%91.4%90.6%
GraphWalks(256k–1M)84.2%71.8%65.0%66.8%
Agent's Last Exam39.5%34.2%—38.2%
OSWorld-2.0(離線子集)69.2%72.6%——
Chartography71.6%71.0%46.2%66.3%
LVBench91.7%87.5%79.7%83.7%
CWE-bench v168.0%68.0%58.0%67.0%

DeepSWE v1.1 的 77.9% 被官方程式標成新高,量的是長時程軟體工程。站內寫過 Gemini 3.8 Flash 在 DeepSWE 拿 73.7%、貼近當時的 Opus 5;Argon 再往上推了約 4 分,對上現役的 Claude Opus 5.5(Google 表上 74.2%)與 GPT-6 Astra(74.1%)。The New Stack 把編程欄拆開看:FrontierSWE v2 Argon 55.0%,Astra 65.5%,落後 10.5 分;Terminal-bench 4.0 被 Opus 5.5 以 66.4% 拿走,Argon 57.4%。Vibe Code Bench 四家都在 89% 以上,91.9% 的領先不到 3 分。官方愛講的「編程 SOTA」,指的是 DeepSWE 這一條,不是所有倉庫遷移與終端代理題。

知識工作才是官方圖表真正拉開的地方。Zapier 的 AutomationBench 51.3% 對 Opus 5.5 的 42.5%。Harvey 法律代理基準 19.6%,大約是 Fable 的三倍,也代表完整做完的題目仍只有大約五分之一。GraphWalks 在 25.6 萬到 100 萬 token 那一檔,Argon 84.2%、Astra 71.8%、Opus 66.8%。長影片理解 LVBench 91.7%。CWE-bench v1 修補漏洞 68%,與 Astra 並列;The New Stack 提醒這張榜把模型跟各自的 agent harness 綁在一起量,Astra 走 Codex、Opus 走 Claude Code,不是裸模型對裸模型。

獨立榜把價差算回去

Artificial Analysis 的 Intelligence Index 在 The Decoder 見報時,Argon 開到 High 推理檔拿 53 分,與 Astra(max)以及 Claude Fable 5.1 打平,比 GPT-6.1 Sol(max)多 1 分。Anthropic 仍在上面:Opus 5.5 58、Sonnet 5.5 56。對 Google 上一顆前沿 Gemini 3.1 Pro Preview,Argon 跳了 23 分。The Decoder 寫這是 Google 七個多月來第一顆前沿模型,中間的 Gemini 3.5 Pro 被跳過;Bloomberg 同樣寫 3.5 Pro 已拿掉。

價差不能只看每百萬 token 標價。導入期跑一題 Intelligence Index,The Decoder 算 Argon 約 1.99 美元,大約是 Astra 3.26 美元的六成,卻是 GPT-6.1 Sol 的 2.7 倍。導入期結束後同一題升到約 3.98 美元,比 Astra 貴約兩成。便宜來自單價,不是來自省 token:Argon 平均一題吐約 6.2 萬輸出 token,Astra 約 2.7 萬。100 萬輸出上限讓模型有空間「一次想完」,帳單也跟著變長。

每百萬 tokenArgon 導入Argon 後期GPT-6 AstraClaude Fable 5.1Claude Opus 5.5
輸入2 美元4 美元10 美元10 美元4 美元
輸出10 美元20 美元50 美元50 美元20 美元
快取讀取約 0.10 美元約 0.20 美元1 美元0.25 美元0.20 美元

導入期快取讀取是輸入價的 5%,The Decoder 換算約每百萬 0.10 美元;後期約 0.20 美元。Google 沒公布導入期哪天截止,也沒公布快取寫入價。Astra 與 Fable 的快取寫入在公開表上仍是另一筆。The Rundown 用一組固定算術當例子:2 萬輸入加 5 千輸出,導入期約 0.09 美元、後期約 0.18 美元——這是加減,不是實測任務成本。重試、工具呼叫、長 推理標記 都會把帳單往上推。

AA 的代理題,The Decoder 寫 Argon 補上 Gemini 線以往偏弱的那一塊。AutomationBench-AA 77.5%,比 Sonnet 5.5(max)高 6 分。Terminal Bench 4 拿 57%,比 3.1 Pro Preview 跳 53 分,仍低於 Sonnet 64%、Opus 60%、Astra 59%。AA-Omniscience 測的是事實與「會不會承認不知道」:Argon 幻覺率 15%,Astra(max)51%、Sol(max)54%。準確率只有 50%,比 3.1 Pro Preview 低 5 分,比 Astra(max)的 63% 低 13 分。綜合分 42,與 Astra 43、Sol 42 幾乎同一條線。比較願意說「我不知道」,不等於比較常答對。

Vals 即時頁把 Argon 放在指數 68.90% ±0.97,Finance Agent v2 65.40% 排第 1/73,Vibe Code Bench v1.1 91.91%。同一頁也露出短板:CUA-bench 4.83% 排 7/8,ProgramBench 2.50%。Vals Index 單次測試成本記 15.68 美元,延遲 46 分 33 秒。Arena.ai 的 Text Arena,The Decoder 寫 Argon(High)1525 分排第一,比 Claude Opus 4.6(High)高 20 分;網頁開發的 Code Arena: WebDev 1679 分排第八,比 3.8 Flash 進步 96 分、名次從 29 跳上來,仍沒進前段班。Arena 用導入期混合單價約每百萬 8 美元,把 Argon 畫到 Text Arena 的 Pareto 前沿。

Investing.com 引 Reuters:Alphabet 盤後約漲 2%。那是股價對「Google 又有旗艦了」的瞬間反應,不是對 Fairwind 鎖門、也不是對獨立榜打平 Astra 的定價。

內部案例寫得很滿,員工側寫不一樣

官方舉了三組已經在 Google 裡跑的工作。量子計算研究員用 Argon 壓子程序的時空資源(qubit × gate),有一例在幾分鐘內比已發表基線好 40%。一組 Argon AI代理 掃全艦隊 profiling,已釋出逾 300 tebibyte 記憶體,預估總量 500 TiB 到 1 PiB。C/C++ 遷 Rust:從 re2、libgav1 這種數萬行核心庫,拉到 Fuchsia 的 Zircon 核心逾 80 萬行。libgav1 這例,代理從既有 Rust 移植出發,用多輪 profile-guided 實驗換掉 3.2 萬行 SIMD,改成讓編譯器自己向量化的安全 Rust;官方程式說速度是舊 Rust 移植的 2.7 倍,影像輸出相同。這類改寫都還在自動加人工稽核、模擬測試,沒寫已經全數進生產。

Kavukcuoglu 寫「數千名」Googler 用 Argon 做專門編程、更深的研究與寫作品質。同一天 Bloomberg 引「直接接觸這項工作的人」:榜上好看,員工真拿去幹活比較普通,某些編程任務吃力。Google 對 Bloomberg 的回應是,講 Gemini 4 在編程這類領域表現不佳並不準確;另有員工說公司內部有「很大共識」認為模型已在前沿。兩套敘事並存。站內 9 月中寫過 Google 工程師可在 Antigravity 用 Claude Opus 5,當時仍規定 Gemini 是主力、不准開 Claude Code。Argon 若要改寫這條內部配額,官方這次沒宣布。

The Decoder 另點 Google 現在的弱點不在權重、在套件:跟 Claude Cowork、ChatGPT Work 比,Gemini 應用仍落後。模型分數追上,不自動等於工作流追上。Arena 的 Text Arena 把 Argon(High)放到 1525 分第一,寫作、長提問、指令跟隨都在前列;網頁開發 Code Arena 卻停在第八。這跟官方圖表裡「DeepSWE 新高、FrontierSWE 與 Terminal-bench 落後」是同一條縫:長推理與知識工作往前,終端與真實倉庫的髒活沒有同步封頂。員工側寫說某些編程任務吃力,獨立榜把這條縫量化了,不必把它讀成「模型很差」,但也不該讀成「編程全面領先」。

官方還寫 Argon 擅長圖表與長影片,LVBench 91.7%、Chartography 71.6%。後者只比 Astra 高 0.6 分,前頭那句「多模態明顯勝出」主要靠長影片與對 Fable 的 Chartography 落差。輸入吃影像、影片、音訊,輸出只出文字——能看懂圖,不能把圖生回來。法律與金融代理題則是另一種「看起來贏很多、絕對值仍低」:Harvey 19.6% 是相對倍數,不是可以無人值守的完成率。

防禦版先出門,護欄還在加

資安這條線,官方寫 Argon 為防禦而訓練,能自主找洞、驗證、打補丁。CWE-bench v1 修補 68%,並列第一。內部綜合漏洞基準涵蓋 20 種語言;對上 3.8 Flash Cyber,The New Stack 引官方數字:內部漏洞發現 85.8% 對 71.0%,Wiz 黑盒滲透 70.9% 對 58.2%。這些對照只跟自家上一代比,沒放 Astra 或 Opus。

Wiz——Google 今年 3 月以 320 億美元買下的雲端資安公司——已把 Argon 接進免費的 Scan for Good,掃公共基礎設施。官方說模型在全球醫院使用的醫療軟體裡,挖到一處會暴露個資的嚴重漏洞,先前的前沿模型沒抓到。醫院名稱、CVE、修補進度,發布文都沒給。Fairwind 成員手上那份沒有網路護欄的權重,能力與風險是同一把刀。

廣泛放行前,官方列了四層補強。濫用:拒絕協助網路攻擊與 CBRN(化學、生物、放射、核)武器,同時保留正當雙用途科研,走 Frontier Safety Framework;監測內部 activation,內外部 紅隊測試 用過人工加自動攻擊。間接 提示詞注入:官方稱 Argon 是他們對 Gray Swan IPI 基準最硬的一顆。失配(misalignment):監測 思維鏈 與行動,必要時停執行;訓練時用過類似系統告警事故小組,且刻意不把發現餵回訓練,避免模型學會躲監測。系統硬化:高風險訓練或評測前把沙盒隔離封死,對齊他們的 agent control 路線圖。

對齊 這一段,官方點名希望業界在能力上升時保留推理透明度,讓模型的想法仍能被用來診斷失配。這句話是對 opaque recurrence 那條線說話——Astra 發布時外界吵過思維鏈被擋住的問題。Google 這次選擇把「看得到在想什麼」寫進發布文,當成自己的安全賣點。

現在能買的、還不能買的

導入價 2/10 對上 Astra 的 10/50、Opus 5.5 的 4/20,紙面上像半價旗艦。獨立榜把輸出量算進去之後,導入期單題智力成本仍高過 Sol,後期會貴過 Astra。快取九五折只在「同一段上下文反覆餵」時划算;長軌跡、高推理檔、一次生出數萬 token 的代理任務,輸出才是大頭。沒有 model ID 之前,這些數字都還不能進正式採購單。

下一棒官方寫的是付費 API 與 AI Ultra,再來才是開發者、企業、消費者。沒有日期。3.5 Pro 跳票的記憶還在:I/O 承諾 6 月,後來一串 Flash,旗艦改名叫 Argon。The Decoder 把它寫成「七個多月來第一顆前沿模型」。消費者端現在能繼續用的,仍是 3.8 Flash、3.8 Live、3.8 TTS 那一組已開賣的線。

同一天 Google 還有另一條硬體新聞:Suncatcher 原型星排上 Transporter-18,四顆 Trillium 張量處理單元 在軌道上大約只能連續跑 Gemini 15 分鐘。那是另一件事,站內另有發射清單與冷卻上限。Argon 這次沒宣布新的雲端 SKU、也沒宣布這顆權重要跑在哪一代 TPU。

單次長任務的帳單,用官方自己的數字就能估。假設一次倉庫遷移吃掉 8 萬輸入、12 萬輸出——這在 100 萬輸出上限面前不算誇張——導入期大約 0.16+1.20=1.36 美元;後期 0.32+2.40=2.72 美元。同一題若重試三次、再加工具回傳,輸出很容易翻倍。The Decoder 量過 Intelligence Index 平均 6.2 萬輸出 token,比 Astra 的 2.7 萬多一倍有餘;「導入期比較便宜」只在你的任務輸出量接近 Astra 時成立。法律或金融代理若真的把 Harvey 那類題目跑完,19.6% 的完整成功率代表五次裡有四次要人接手工。Vals Index 單次 15.68 美元、46 分鐘,已經把「知識工作第一名」的單位成本寫在榜上。

站內寫過 Gemini 3.8 Flash 導入價仍 0.75/3.75,單任務成本卻上漲。Argon 導入 2/10,大約是 Flash 輸入的 2.7 倍、輸出的 2.7 倍;後期 4/20 對齊 Opus 5.5 的標價,不是對齊 Flash。把日常補全留在 Flash、把失敗過的長任務留給 Argon 評測,比一上線就切旗艦更接近官方自己的分階段敘事。

兩份權重、一張還沒開門的價目表

Fairwind 無護欄版能自主找洞、打補丁;公開版被設計成拒絕網路攻擊與 CBRN。Wiz 在醫院軟體挖到的那處漏洞,官方用來證明防禦能力,也同時證明這顆模型找洞的能力已經超過先前放行的前沿模型。650 家 CrowdStrike、Palo Alto 這一級的夥伴先用,一般開發者還在等 model ID。雙用途就卡在這裡:防禦夥伴需要的能力,與濫用者想要的能力,技術上是同一條軌。Google 的答案是身分審核加分階段,不是把能力從權重裡拿掉。

自願性發布前取用,跟白宮那張沒罰則的協議疊在同一週。協議要公司自己找外部稽核、自己修;Argon 這次把「我們有參加政府流程」寫進發布文,但沒寫審查結果、沒寫哪一個機關看過、沒寫不過會怎樣。這不是新法生效,是同一套自願框架的產品實作。

評測與切換的最低條件其實很窄。要有官方 model ID 與地區。要用自己倉庫裡已經失敗過的長任務對打 3.8 Flash、Astra、Opus 5.5,不要只用 DeepSWE 或 Vals 指數做決定。要分開記「導入期 2/10」與「後期 4/20」,並量實際輸出 token,不要假設 100 萬上限用得到、也用得起。資安場景要確認拿到的是 Fairwind 無護欄版還是公開拒絕版——兩份權重不是同一個產品。Bloomberg 那條員工側寫不必當成結論,但 FrontierSWE 與 Terminal-bench 落後、AA 準確率低於 Astra,已經夠讓「編程全面領先」這句話從官方圖表裡拿掉。法律採購尤其不該只看 Harvey 的相對倍數:三倍於 Fable,仍是五題只完整過一題。