Mistral Studio 的模型清單裡,現在可以選到 mistral-large-4。官方部落格把它暱稱為 le Chonk,文件標 Public Preview、Open、v26.10。這是法國 Mistral 目前最大、也是公司自稱能力最強的一顆大型語言模型:文件寫總參數 1.05 兆、每個詞元激活 490 億,外加 16 億參數的視覺編碼器,架構是細粒度混合專家模型。同一天能核對的事實還有一條更硬:權重還沒放上 Hugging Face。預覽走公司自己的歐洲機房 API;開放權重被官方寫成「本月底」。
官方公告的第一句是「今天推出公開預覽」,能試的地方是 Mistral Studio。權重、架構細節、額外基準與後訓練方法,被一起排到月底再講。VentureBeat、WSJ、Quartz 把那一天寫成 10 月 27 日,並說授權會是 Mistral 自訂條款,不是 Large 3 用過的 Apache 2.0。Hugging Face 上預定頁 Mistral-Large-4.0-1T05-A52B 的倒數卻指著 10 月 31 日。三個日期目前並存:官方頁面沒寫死月日,第三方報導寫 27 日,開發者託管頁寫 31 日。
現在能核對的規格,以及三處對不上的數字
官方部落格把模型寫成「1 兆參數、原生多模態、激活 490 億」。文件頁把總參數寫成 1.05 兆,並補上 16 億參數視覺編碼器。Hugging Face 預定頁則拆得更細:每個詞元激活 490 億,若把嵌入層與輸出層算進去是 520 億。Artificial Analysis 的模型卡把總參數記成 1,000B。寫進採購單時,1.05 兆是文件數字,1 兆是官博四捨五入。
上下文窗口是第二處對不上。Mistral 文件寫 100 萬詞元。Vals 的模型資料寫 512K,Artificial Analysis 寫 524K。Kingy 核對後沒有判定哪一邊過期、哪一邊是評測端設定。在正式契約或壓測計畫裡,應以實際打到的那個 endpoint、那個模型版本回傳的上限為準,而不是把三個數字平均。
訓練卡數是第三處。官博寫 3,800 顆 NVIDIA Grace Blackwell GPU,全部在歐洲自有機房、從頭訓起,預覽也跑同一套基礎設施。TechCrunch 引科學副總裁 Pierre Stock 的說法是「只用 4,000 顆」,並稱這比中國對手少兩到三倍、比閉源對手更少。VentureBeat 與觀點網也寫約 4,000 顆、歷時約兩個月。3,800 與 4,000 量級相同,但不是同一句官方原文。
聯席創辦人、首席科學家 Guillaume Lample 對 VentureBeat 確認:輸入可以是文字加圖像,輸出仍只有文字。文件列出的能力包含結構化輸出、函式呼叫、文件問答、前綴補全、批次、以及 agents/conversations 端點上的內建工具。模型識別碼是 mistral-large-4。
| 項目 | 目前能核對的數字 | 對不上或未公開的部分 |
|---|---|---|
| 總參數 | 文件 1.05 兆;官博寫 1 兆 | Artificial Analysis 記 1,000B |
| 激活參數 | 每詞元 490 億 | Hugging Face 含嵌入/輸出層寫 520 億 |
| 視覺編碼器 | 16 億參數 | 權重未出,無法獨立量測 |
| 上下文 | 文件寫 100 萬詞元 | Vals 512K、Artificial Analysis 524K |
| 訓練卡 | 官博 3,800 顆 Grace Blackwell | TechCrunch/VentureBeat 寫約 4,000 |
| 訓練地 | 歐洲自有機房、從頭訓起 | 完整訓練帳單未公開 |
| 語言模型覆蓋 | 官博寫逾 160 種、含歐盟全部官方語言 | 不是每種語言的正確率保證 |
| 授權 | 權重未出 | VentureBeat:自訂條款,不是 Apache 2.0 |
| 權重日 | 官方「本月底」 | WSJ/VentureBeat 寫 27 日;Hugging Face 倒數 31 日 |
Kingy 另做了一組重量算術,用來提醒「激活 490 億」不是「只要 490 億參數的機器就能跑」。混合專家模型每個詞元只叫醒一部分專家,但整顆模型的權重仍要存、要搬、要在裝置間通訊。按兩位元組/參數粗算,1.05 兆參數約 2.10 TB 原始權重;一位元組約 1.05 TB;理想四位元組裝約 525 GB。這些是從廣告參數推的載荷估計,不含 KV 快取、激活、冗餘與執行環境。沒有量化檢查點、沒有支援的執行時、沒有可重現的分散式設定之前,不能把它寫成筆電或單卡消費級部署。
預覽價是半價,獨立榜用的是劃掉的那一行
文件頁把價格疊成兩層。現在顯示的是每百萬詞元輸入 0.68 美元、快取輸入 0.07 美元、輸出 2.09 美元。劃掉的牌價是 1.36、0.14、4.18。Artificial Analysis 的 LinkedIn 摘要寫,前兩週五折,所以 0.68/2.09 對應 1.36/4.18 的一半。文件頁自己沒寫折扣哪一天結束。Artificial Analysis 與 Vals 第一批結果用的是牌價。VentureBeat 拿到的發布材料裡根本沒有 API 價,價是後來才出現在文件頁。
Artificial Analysis 目前只列一個供應商:Mistral 自己。混合價(快取:輸入:輸出 = 7:2:1)約 0.79 美元/百萬詞元。中位輸出速度 116 token/秒,首包 1.46 秒,端到端約 23 秒,其中推理時間約 17.23 秒。上下文在這張供應商表上寫 524k。換句話說,獨立測速頁現在認的上下文,比 Mistral 文件少一半。
| 模型 | 輸入/百萬詞元 | 輸出/百萬詞元 | 備註 |
|---|---|---|---|
| Mistral Large 4 現顯示價 | 0.68 美元 | 2.09 美元 | 文件頁;折扣截止日未寫 |
| Mistral Large 4 劃掉牌價 | 1.36 美元 | 4.18 美元 | Artificial Analysis/Vals 第一批用這檔 |
| GLM-5.3 | 1.40 美元 | 4.40 美元 | 與 ML4 牌價接近 |
| DeepSeek V4.1 Flash 峰值 | 0.30 美元 | 1.20 美元 | 比 ML4 預覽價更低 |
| GPT-6.1 Sol 標準短輸入 | 2.00 美元 | 10.00 美元 | Kingy 對照表 |
| Claude Opus 5.5 標準 | 4.00 美元 | 20.00 美元 | 同表 |
| OpenAI GPT-6 Astra 標準短輸入 | 10.00 美元 | 50.00 美元 | 同表 |
Kingy 用「1 萬輸入 + 2 千輸出」做單次成本:ML4 現顯示價約 0.011 美元,牌價約 0.022 美元,Astra 約 0.20 美元,Opus 5.5 約 0.08 美元,DeepSeek V4.1 Flash 峰值約 0.0054 美元。這不是真實工作負載帳單,只說明:預覽價把 ML4 放到開源中國模型與美系閉源旗艦中間;折扣結束後,它會跟 GLM-5.3 同一帶,仍遠比 Astra 便宜,也仍比 Flash 貴。
智力指數從個位數跳到 38,離第一排還有 20 分
Mistral 在 X 上的說法是:在彙總基準上,它是美國或歐洲做出來的最強開放權重模型,網安、製造、金融稱開源裡的先進水準,視覺定位甚至超過部分閉源前沿。這句話的地理邊界很清楚:不是全球所有模型第一,也不是今天就能下載。
獨立數字先看 Artificial Analysis Intelligence Index。The Decoder 寫,ML4 得 38 分。前代 Large 3 在同一套指數只有 9 分,最近的 Medium 3.5 是 14 分。38 分略過 Mistral 自己平台上架的 GLM-5.2,也跟 GPT-6 Luna(max,38)、DeepSeek V4.1 Flash(max,39)同一帶。第一名是 Claude Opus 5.5(Max)58 分。差距約 20 分。Artificial Analysis 在權重釋出前仍把 ML4 標成 proprietary,因為下載檔還不存在。
Vals Index v2.1 是另一張表,不能跟 38 分平均。Kingy 截到的快照:ML4 Preview 48.05%,在顯示的 44 個模型裡排第 32。同表 Gemini 4 Argon 68.90%、Claude Sonnet 5.5 67.04%、Opus 5.5 66.97%、GPT-6 Astra 63.13%、GPT-6.1 Sol 61.15%、DeepSeek V4.1 Flash 51.32%、Qwen 3.8 Max 48.27%。Vals 這次給 Large 4 的設定是高推理力度、溫度 1、top-p 0.95。單次測試成本被寫成 13.78 美元,比 Sol 的 3.24 美元貴,比 Astra 的 18.46 美元便宜。
這兩張獨立榜共同能成立的句子是:對 Mistral 自己,這是一次大跳;對閉源第一排,它還沒站上去;對中國開源,它開始能坐上同一張桌子,但沒有把桌子掀掉。九月 D 輪時,站內寫過Medium 3.5 指數仍停在 30——當時用的是較舊的指數版本與不同對照組。這次 Decoder 用的是同一家指數對 Large 4 的新讀數。兩篇不應把 30 與 14 直接相減。
82% 那條網安頭條,有一半是對手拒答
官博把最大篇幅給了網路安全。公司說,在 Artificial Analysis Cyber Index 上,ML4 進全球前五,並大幅領先中國以外的開放權重模型。其中一項測試要求模型「在開源軟體裡複現真實漏洞,再打補丁」:官博寫 82%,是所有模型最高。Cybench 40 題官方寫解出 93%。
ThreatFrontier 在公告當天稍後抓了 Artificial Analysis 嵌入資料。公開預覽的「Mistral Large 4 Preview」在 CyberGym-E2E-AA 是 81.7%,18 個模型裡最高,安全攔截次數為 0。Cyber Index 綜合分 49.5,第 5/18。VentureBeat 截稿時還寫「模型還沒出現在 AA 公開評測」;ThreatFrontier 抓到的時候已經在了。預覽分數在權重落地前仍可能改。
對手接近零分的原因,AA 資料寫得很直。Claude Opus 5.5(Max,Default Fallback)0.8%,98.5% 的題被安全攔截;GPT-6 Astra(Max)0%,100% 攔截。Anthropic 與 OpenAI 在這項上幾乎整表拒答。AA 把拒答記成安全攔截、分數為零。因此這項第一名量的是「肯做」,不只是「比較會做」。在沒有拒答的模型裡,領先很窄:ML4 81.7%,小米 MiMo-V2.6-Pro 78.6%,GPT-6 Luna 77.9%,Grok 4.7 與 GLM-5.3 Flash 74.0%。綜合指數第一是 Grok 4.7 的 56.4,接著 MiMo 56.1、Luna 52.7、GLM-5.3 Flash 49.9,ML4 49.5。Astra 仍有 33.4、Opus 5.5 有 28.7,因為另外兩項(CWE-Bench-AA、DeepsecBench-AA)它們沒有整表拒答。ML4 在 DeepsecBench-AA 只有 16.0%,Grok 4.7 是 26.9%;CWE-Bench-AA 是 50.8%。弱項是漏洞發現,強項是「肯把洞再打出來並補上」。
Mistral 把拒答寫成防禦方的問題:供應商層級的拒絕會擋住合法的漏洞研究與事故回應;事故中途失去能力本身就是風險;攻擊者又在越獄同一批閉源模型。Lample 對 Quartz 的表述是,網安防禦能力讓企業與政府能對抗「越獄閉源模型來做攻擊」的對手。官博還說,內部測試裡模型能用來分析惡意程式、排漏洞優先順序、寫偵測規則;權重落地後可跑私有雲或地端。
同一份公告又強調:在 JailbreakBench、StrongREJECT、AgentHarm 的惡意網安提示上,ML4 的平均拒答率高於所有開源模型。Lakera B3 攻擊抵抗官方寫 93.3%,公司稱沒看到更高的對手分數。The Decoder 點出缺口:它沒有解釋模型如何穩定區分「合法漏洞研究」與「攻擊準備」。ThreatFrontier 補了一句更具體的:精選夥伴與國家機關拿到的是「降低審核、擴大網安能力」的同一顆模型,公開預覽不是那一檔。甄選標準、放寬了哪些審核、日誌與可接受使用條款,官方都沒寫。AA 自己的 Cyber Index 方法論也提醒:31% 的通過案例補的是目標以外的真實崩潰,人工審查補丁仍然必要。
編程分數能進開源前段,終端自主還接不住閉源旗艦
官博報的編程數字是 Artificial Analysis 三項等權:DeepSWE v1.1 61.7%、SWE-Atlas-QnA 59.4%、Terminal-Bench 4 28.3%,合成 Coding Agent Index 49.8%,排在 DeepSeek V4 Pro 0813 與 Qwen3.8 Max 前面。Surge AI 盲測裡,專業標註者打 1 到 5 分:ML4 Preview 3.74,五個模型裡第二,高於 Kimi K3 的 3.59、GLM-5.3 的 3.60、GLM-5.2 的 3.40,低於 Claude Opus 5 的 4.22。
VentureBeat 把 DeepSWE 放到活榜上對了一輪。Mistral 自己的圖把 Reflection Beam 寫成 44%、Qwen 3.8 Max 51%、DeepSeek V4 Pro 0813 57%、GLM-5.3 61%,ML4 62%。活榜若取每個模型已發表的最佳配置,GLM-5.3 與 Kimi K3 約 69%,GPT-6 Astra、Gemini 3.8 Flash、Claude Opus 5 約 74%。62% 對西方開放權重(例如剛亮相的 Beam)有競爭力,但不是跨所有模型與所有 harness 的編程第一。
Vals 用 Mini-SWE-agent 跑的 Terminal-Bench 4 更低:ML4 22.73%,同表 Opus 5.5 65.15%、Sonnet 5.5 64.14%、Astra 59.60%、Sol 55.05%、GLM-5.3 38.89%。22.73% 與 AA 的 28.3% 不應平均成一個新基準;任務子集、脚手架與執行預算都可以造成差距。實務上能寫進評估清單的是:ML4 可以當開源編程候選人,困難的長程終端任務仍應留一顆閉源旗艦對照,並用「可接受變更的單價」含修復次數與審查時間來算,而不是只看合成指數。
AI 代理工作流方面,官博寫 AutomationBench(657 個跨 Gmail、Sheets、Slack、Salesforce 的商務流程)59.9%,高於 Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro。AA-Briefcase 長程知識工作 1,393 Elo,也寫成高於 V4 Pro。The Decoder 另寫:自動化商務流程上 ML4 略低於 GLM-5.3。兩句可以同時成立,因為不是同一張表。
法律與金融是少數能把 Astra 壓下去的欄位
Vals 的 Harvey Legal Agent Benchmark 是這次比較乾淨的外部交叉檢查。Kingy 截到:ML4 任務通過率 15.83%,單測成本 4.18 美元。同表 Astra 與 Sol 都是 5.42%,Opus 5.5 3.75%,Sonnet 5.5 2.92%。開源對照裡 Kimi K3 12.92%、Qwen 3.8 Max 10.42%、GLM-5.3 8.33%。Mistral 自己的圖寫約 15%,與 Vals 同量級。顯示結果裡它排第 6/75。絕對通過率仍低:15.83% 不是「另外 84% 可以交給模型」。同一模型在 Legal Research Bench 是 31.73%,排第 38/74。一個代理基準上的強、一個研究基準上的中,不能合成「法律第一」。
Finance Agent v2:ML4 54.68%,成本 1.20 美元,延遲 26 分 02 秒。Astra 53.54%、6.82 美元、11 分 33 秒。ML4 在這張表上以更低成本超出 Astra 1.14 個百分點,但花兩倍以上時間。Gemini 4 Argon 仍以 65.40% 領先,Opus 5.5 58.59%,Sonnet 5.5 58.10%,GLM-5.3 55.84%。官博另引 vals.ai,稱法律與金融任務都超過 GPT-6 Astra;Finch(FinWorkBench)官方圖寫 67%,與 V4 Pro 並列、高於 GLM-5.3 的 65%。VentureBeat 找不到 Finch 上那些較新模型分數的獨立公開來源。
視覺定位是官博少數直接點名贏過 Astra 的欄位:Dense 200 上 ML4 42%、Astra 41%。官博示範包含十億畫素衛星圖、工程圖放大核對、PDF 取證。差距是 1 個百分點。DIOR-RSVG 官方材料寫 73%,VentureBeat 說對照組的 Astra、Kimi、DeepSeek 精確分數未在它查到的公開基準來源出現。
科學與數學:官博稱 SciCode-Verified 在開放權重裡先進;內部 STEM 人評相對 GLM-5.3,CAD 與 STEM 偏好 ML4,金融與編程接近。這些是公司內部評,不是 Vals 或 AA 的公開表。
強化學習還沒跑完,D 輪的錢正被寫進程式
官博把後訓練寫得很具體。共用介面把單輪聊天、複雜科學題、安全對齊、事實性、長程工具使用塞進同一輪。強化學習庫讓新環境容易加進去。執行時,自動伸縮的 actor 艦隊平行產生數萬條 rollout,訓練異步進行。當前規模約 3,000 顆 GPU,單輪每天約產生 330 億詞元,過濾與遮罩後約 160 億是可訓練的完成詞元。官方說預覽背後這輪 RL 仍在跑、沒有飽和跡象,後面幾週還會再往上。Lample 對 Quartz 說,D 輪之後拉高訓練產能,能力還會再改善。
這把產品狀態說清楚了:現在上架的是「還在長」的預覽檢查點,不是凍結的最終權重。獨立榜上的 38 分、81.7%、48.05%,全部綁在這個還會改的版本。月底若權重與預覽不是同一顆,今天的表要重跑。
錢從哪來,公司寫進同一篇公告:ML4 是30 億歐元 D 輪路線圖的第一個里程碑,該輪是歐洲科技公司有史以來最大股權融資,投後估值逾 210 億歐元,三星領投。官博說資金已在擴歐洲自有機房。The Decoder 回看三月那筆8.3 億美元巴黎機房貸,以及 2027 年底歐洲 200 百萬瓦算力的計畫。VentureBeat 寫科學團隊從 3 名研究員擴到約 300 人。訓練用的環境,官博說就是賣給客戶的 Mistral Forge——站內先前寫過Forge 與 Small 4 那條企業自建路線。
主權被寫成可檢查的部署,而不只是口號。官博說會在多個地區提供服務,其中一條歐洲部署由 Mistral 端到端營運、不依賴其他數位服務商、受歐洲法律約束。TechCrunch 引法國總統馬克宏先前「AI 第三條路」的表述:閉源美系模型能被拔插頭,開放權重又常是中國做的,Mistral 要把 ML4 擺在中間。Stock 對該報說,開放權重比較好審計;在權重釋出前,會與可信夥伴與政府合作,「確保開源權重能用來防禦,而不是用來做惡意攻擊」。怎麼保證,公告沒有機制圖。
執行長 Arthur Mensch 今年五月已在法國國會委員會講過同一條恐懼:歐洲若在網安上依賴美系模型,法國軍方程式碼不該被 Anthropic 的 Mythos 掃描。ML4 的網安敘事是把這句話產品化。Lample 對 VentureBeat 的商業解釋是另一層:客戶要的不只是模型權限,還有部署、基礎設施、客製與工程;公司賭的是權重會商品化,高價值生意轉到權重周圍的系統。這也解釋為什麼旗艦願意開權重:API 鎖客不是唯一條路。
授權是這條故事裡還沒填的空格。Large 3 是 Apache 2.0。Large 4 被多家媒體寫成自訂 Mistral 授權。條款對商用、修改、再散布、產出物歸屬寫什麼,要等權重頁。在那之前把它叫「開源」不準,準的是「預告中的開放權重」。
開發者現在能做的,與還不能做的
現在能做的是打 API。文件列出聊天、對話、批次、代理端點。預覽跑在 Mistral 自己的歐洲機房。ThreatFrontier 對防禦團隊的提醒很具體:預覽是託管服務,在核對資料處理條款之前,不要把專有原始碼或事故資料送進去。精選網安檔若要申請,應要求書面甄選標準、日誌與可接受使用條款。
現在不能做的是本機複現。Hugging Face 組織頁上沒有 Large 4 檢查點,只有 Large 3、Small 4、Medium 3.5、Devstral 2 等舊集合。預定頁寫「Waiting for the release」。沒有檢查點就沒有獨立量化、沒有第三人推理引擎、沒有「我這張卡跑不跑得動」的實測。Implicator 寫得直:這顆模型大到不能在桌機或筆電上跑,對部分大學也不實際。
Reflection 前一天剛把 Beam 定位成「中國以外最能打的開放權重,激活只有 230 億/總參數 5010 億」。Mistral 的 DeepSWE 圖把 Beam 放在 44%。兩邊都還沒把最終權重交到公共倉庫。對要在十月底做開源選型的人,時間表會擠在一起:ML4 預告月底、Beam 也寫「本月稍後」。誰先落地、授權誰比較能進企業法務,會變成實際決策,而不是誰的官博圖片比較好看。
六月網路上流行過一個虛構模型梗「Le Chaton Fat」(肥貓),假基準圖把一顆不存在的法國大模型寫成能越過美中。Business Insider 寫過這個梗;Mensch 還在 X 接過話。VentureBeat 問 Lample,ML4 是不是那個梗的實體版。他說公司喜歡這個梗,ML4 可以看成那個想法的初版,後面還有更大的。內部暱稱 le Chonk 是故意向那群催更的人點頭。這解釋了名字,不解釋基準。
採購上現在能寫進清單的驗證條件很窄。預覽期間:用你真正在跑的法律、金融或文件流程,對同一套工具與接受標準測 ML4,同時留一顆更強的通才模型接它做不來的編程與終端任務;核對你打到的那個 endpoint 上下文上限,不要假設 100 萬;把帳單算兩次,一次用 0.68/2.09,一次用 1.36/4.18。權重落地之後:核對授權是不是真的能商用與地端;核對公開檢查點與預覽是不是同一顆;自己的程式庫重跑漏洞複現與補丁審查,不要把 81.7% 當成一般網安能力;假設攻擊者也拿得到同一顆權重,補丁速度與暴露面收斂要比模型評分更先排進行事曆。
