基座沒換,分數卻翻了好幾倍。智譜(Z.ai,港股 2513.HK)推出 GLM-5.3:與 GLM-5.2 共用同一座約 7430 億參數的混合專家模型,官方把全部能力增益寫成後訓練 scaling——長程任務環境擴到原先的數十倍、環境類型更雜、後訓練時間更長。公司稱它是當前編程最優的開放權重模型,編程與AI 代理能力接近 Claude Fable 5。完整權重還未上架;官方承諾約兩週後、安全評估與加固完成才開放。澎湃、網易、MarkTechPost、The New Stack、Decrypt 與人人都是產品經理轉載的官方稿同步整理。
這則該先記住的不是「又一個更大的大型語言模型」,而是實驗設計本身:預訓練凍結,只加碼後訓練,長程終端與網路安全分數仍大幅移動。若第三方複現站得住,開源陣營追趕短板的路徑會從「再燒一輪基座」改成「把環境與強化學習做大」。
繼承規格:換的不是骨架
GLM-5.3 沒有新的架構表。官方反覆強調「Scaling post-training is all we did」:5.2 把訓練棧搭好,過去一個月只在同一座基座上繼續加環境、加任務、加算力。公開材料把繼承規格寫成約 7440 億總參數、約 400 億激活;上下文窗口沿用家族上限約 100 萬詞元,補全上限約 12.8 萬。基準腳註則依題使用 30 萬、40 萬或 100 萬,並不是每道題都灌滿窗口。
推理模式不能關。模型識別碼為 glm-5.3,reasoning_effort 分 low/high/max,文件把 max 當預設。Claude Code 路徑可用 glm-5.3[1m] 打開百萬級窗口與對應的壓縮設定。max 檔會拉高延遲與輸出 token;智譜主張它在正確率與 token 效率之間較划算,但官方按 token 計價的 API 價目在發布當下尚未單獨列出 GLM-5.3 一列,不能把 5.2 的單價直接套進來。
Coding Plan 還有一處遷移細節:文件寫明,對 GLM-5.2 或 5.1 的呼叫會自動轉到 5.3。想拿前代做乾淨 A/B 的團隊,必須核對代理回傳的實際模型 ID,否則會以為自己還在測舊版。
後訓練到底加了什麼
智譜沒有用更大參數解釋這次升級。它把提升歸到更長、更複雜的後訓練:讓模型反覆處理需要規劃、工具呼叫與結果檢查的任務;有些訓練題模擬完整軟體生命週期——找 bug、起草修補、寫碼、跑測試、交付結果——官方稱單題工作量對得上資深工程師連續數日。訓練棧點名 IndexShare、SAO,以及持續演進的新一代 Slime 框架,在與 5.2 完全相同的基座上推進強化學習。官方自己也留了一句:這個基座的智能上界「可能還遠未被開發完」。
這解釋了為什麼跳最兇的不是靜態問答,而是「環境會變」的代理題。長程編程代理不只是吐一段長回答,它要巡視倉庫、摸清慣例、形成計畫、呼叫工具、解讀結果、改多個檔、跑測試、判斷驗收條件是否滿足。每一步都會改下一步所依賴的狀態;倉庫地圖畫錯,後面幾分鐘的實作與測試都會被帶偏。後訓練把題目從「下一個答案對不對」改成「複雜工作能不能一路盯住」。
編程基準:長程題跳最兇,閉源仍未全面追上
下列為官方自報或官方引用、尚未獨立複現。代差集中在真終端與長視野;與閉源前沿比,多數列仍落後或互有輸贏。
| 基準 | GLM-5.2 | GLM-5.3 | 官方表上的對照 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | Fable 5 33.7;GPT-5.6 Sol 34.6;Kimi K3 17.4 |
| DeepSWE v1.1 | 46.2 | 66.9 | Sol 72.7;Fable 5 69.7;Kimi K3 67.5;DeepSeek V4 Pro 0813 62.7 |
| Agents' Last Exam(CLI) | 23.8 | 28.5 | Sol 28.6;Kimi K3 27.6 |
| AutomationBench 1.0.6 | 26.2 | 48.2 | 官方表上領先所列系統 |
| Toolathlon Verified | 59.9 | 73.0 | 低於 Kimi/DeepSeek/Fable/Sol 一截 |
| GDPval-AA v2 | 1508 | 1769 | Fable 5 1743;Sol 1730 |
| 內部 Z.ai Code Bench | Max 23.4%@約 9.6 萬輸出 token | High 31.4%@約 5 萬;Max 34.5%@約 7.5 萬 | Opus 4.8 約 29.5%@12 萬;Fable 5 最大努力約 39.5% 仍領先 |
公開更難的編程套件上,官方承認仍落後 GPT-5.6 Sol 與 Fable 5。內部榜用較少輸出 token 追近 Opus 4.8,智譜的解釋是私有基準比較不怕污染——這句要當廠商立場,不是獨立審計。The New Stack 另把 DeepSWE 66.9 拿來對 Gemini 3.7 Flash 約 65%,並提醒 harness 不同,不能直接當頭對頭。
Token 效率可能比「開源第一」這句口號更值得盯。官方私有編程榜上,5.3 Max 比 5.2 Max 分數更高、輸出少約 2.1 萬 token;High 檔保住大部分 Max 分數,輸出又比 Max 少約三分之一。若這套行為能搬進真實倉庫,影響的是延遲、額度與「完成一題要花多少錢」,而不只是排行榜小數點。代理經濟學看的是成功交付,不是單顆 token 多便宜;愛重試、愛講廢話的便宜模型,算完失敗次數之後可能更貴。這份私有榜外部無法只靠百分比複現,團隊仍得在自己的 repo 量總輸入、快取輸入、推理/輸出 token、牆鐘時間與客觀成功率。
網安是「意外長出來的」
智譜自己把這段標成超預期。原本加漏洞發現資料,只想讓單 bug 推理更好;後訓練一擴,模型開始對完整利用鏈做連貫規劃。任務鏈被拆成審查→驗證→利用→真實攻防;官方說目前優勢在前半段。
| 基準 | GLM-5.2 | GLM-5.3 | 對照(官方表) |
|---|---|---|---|
| CyberGym(白盒源碼觸發故障、識別並驗證) | 77.2% | 84.5% | Mythos 5 83.8%;GPT-5.6 Sol 83.6%;Kimi K3 80.0% |
| ExploitBench(根因+可運作 exploit) | 24.4% | 54.4% | Mythos 5 78.0%;Sol 76.5% |
| ExploitGym(兩小時/六小時完成題數) | 29/39 | 105/130 | Mythos 5 181/247 |
模式一致:越往利用鏈深處,相對 5.2 的增益越大,對閉源前沿的落差也越大。會找洞,不等于會打穿系統。
發布前聯合清華、南開,以及雲起無垠、綠盟科技、賽博崑崙、DARKNAVY、騰訊玄武等安全團隊紅隊。官方稱初篩去重後,在 269 個專案找出 2436 個有效漏洞,其中 1097 個中高危,涵蓋系統核心、作業系統、瀏覽器引擎、開源基礎元件、互聯網應用與協議;最早的 bug 據報可追溯到約 1981 年。漏洞陸續提交 CNNVD/CNVD。公司另建「Z.ai 安全披露賬本」:已修復的公開細節,仍在協調披露的先公開雜湊供後續核驗。發布材料列舉的已披露案例包括 Cursor、微軟郵件與辦公系統、某國民級通訊 App、可追溯至 1983 年的 DNS 協議,以及一家人形機器人廠商產品。
同步開「開源的盾」:對重點開源專案持續安全審計(公開入口指向 Hugging Face 上的 zai-org/OpenVuln)、向開源維護者申請免費模型額度做防禦任務、在 ZCode 提供程式碼審計。官方金句是「當最強的矛被鎖在少數人手裡,最好的盾必須屬於所有人」——這句要當產品定位,不是獨立驗證。
三層閘控:權重一落地,前兩層就走了
智譜為 GLM-5.3 設計三層安全措施。外層是輕量分類器,標記並攔截大規模濫用請求;中間是推理監控器,在推理過程中即時審查任務意圖;最裡層是模型自身的深度安全對齊,讓模型自行識別並拒絕惡意請求。前兩層依賴伺服器端。開發者下載權重在本地部署,它們不會跟著模型一起交付。官方寫得很清楚:深度安全對齊,是開放權重場景下唯一仍然有效的一層防線。
最敏感的網安能力另走「網路安全受信訪問/可信訪問」:只向經過驗證的使用者開放,不隨開源權重一起放出。這和 OpenAI Daybreak 的 Blue/Red 雙軌 是同一類產品選擇:能力先湧現,閘控後補上。漏洞防禦和漏洞利用共用一段能力鏈——讀懂大型程式庫、安排長程任務、呼叫工具並驗證結果,可以幫維護者補洞,也可能把一次攻擊繼續往前推。所以這份新能力既是賣點,也是推遲開放權重的原因。
今天能用什麼、兩週後才算開源事實
當天進入官方編程工具 ZCode、效率工具 AutoClaw,以及 GLM Coding Plan 全量使用者;Coding Plan 額度同日重置。TraeWork/TraeCode/扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode 等編碼平台開放搶先體驗。The New Stack 另確認可經 Anthropic 相容與 OpenAI 相容端點接到 Claude Code、Cline、OpenCode 與 Codex。API 官方中文稿寫「即將上線」,英文媒體有的寫已通、有的寫仍 listed as coming soon——發布當下較穩妥的讀法是:訂閱與 IDE 路徑先開,裸 API 與完整權重分階段走安全評估。
「約兩週後開放權重」意味著今天寫「開源第一」仍是能力敘事,不是可下載事實。對開發者工具、雲基礎設施、應用安全、金融/電商工程團隊,可以立刻試長程 CLI 代理、CI 失敗分診、白盒漏洞發現;受資料駐留或供應商審查綁死的企業,仍得等權重、授權檔與本地閘控方案。MSSP/安全廠商訊號最濃,政策暴露也最大——CyberGym 略超 Mythos 5 的數字若被複現,採購問卷會立刻問:可信訪問誰核可、紅隊發現如何披露、開源權重會不會把利用鏈能力一併放出。
同週對照:阿里已把 Qwen3.8-2.4T-A95B 的 Max 級權重丟上架,那是「旗艦可自架」;GLM-5.3 是「同一基座、只靠後訓練把終端與網安抬起來」。DeepSeek 同週也用後訓練把 V4 Pro 的代理分數抬高,但那是另一條產品線。兩條開源路驗證標準不同:一個看你有沒有機架,一個看兩週後權重是否真的來、分數是否被第三方複現。
港股當日智譜股價據報下跌逾 4%。市場不一定為「開源第一」加價,更可能先消化「權重未出、基準自報、網安能力要閘控」。開發者該盯的是 Z.ai Code Bench 的 token 效率能不能在自己的 repo 重現,以及 ExploitBench 對 Mythos 5 的大落差會不會在真實紅隊裡變成「會找洞、不太會打穿」。
下一步只看幾件可驗證的事:權重是否如期出現、授權條款與檔案雜湊、獨立 Terminal-Bench/CyberGym/ExploitBench 複現、可信訪問的實際門檻、「開源的盾」有沒有公開漏洞帳本,以及本地部署時只剩對齊層是否擋得住。後訓練 scaling 把編程與網安一起抬起來——開源社群接下來要比的,是這份能力能不能在可下載權重上被關進該關的籠子。
