2.4 兆參數的 Max 權重要機架;多數人真的會下載到磁碟的,是另一份。Qwen3.8-27B 已在 Hugging Face 與 ModelScope 上架,Apache 2.0,官方卡片寫成帶視覺編碼器的稠密因果語言模型:約 270 億參數、原生理解圖像與影片,上下文窗口 262,144、可用 YaRN 延到 100 萬。開放權重這件事,Max 那條線我們已經寫過;27B 這條線要回答的是另一個問題——單機、可商用、還能不能在AI 代理與電腦操作基準上壓過剛開源的 Muse Glimmer 30B。The Decoder、OfficeChai、官方模型卡與社群量化指南把規格對過一遍。
授權先講清楚。27B 是 Apache 2.0:下載、修改、再散布、商業使用,沒有使用規模上限。同代 Qwen3.8-2.4T-A95B 走另一份 Max 授權,第三方讀授權文指出超過一定營收規模的 AI 服務業務要另洽許可。兩份權重同一週出現,不代表兩份法律地位相同。要做產品、要微調、要把模型嵌進AI 代理,27B 這張 Apache 檔才是多數團隊能直接簽字的那一份。
規格:不是小一號的 Max,是本機用的稠密多模態
官方模型卡把 27B 寫成 Qwen3.5 架構家族上的後訓練成果,不是把 2.4T 混合專家模型剪小。類型是 Causal Language Model with Vision Encoder。隱藏維度 5120、64 層;層配置為 16 組「3×(Gated DeltaNet→FFN)再 1×(Gated Attention→FFN)」——也就是約四分之三層走線性注意力、四分之一層走完整門控注意力。這解釋了社群為什麼說長上下文的 KV cache 比同尺寸稠密模型省:完整注意力層比較少。FFN 中間維 17408,詞嵌入填充到 248320,並訓練了多步 MTP(Multi-Token Prediction)。
思考預設開,可依請求關掉;reasoning_effort 分 xhigh(預設)、medium、low;preserve_thinking 預設保留歷史思考上下文。官方提醒:多輪代理任務裡,把力度調低不一定省總時間——單輪變快,分析不夠就重試,延遲與 token 反而上升。取樣建議思考模式 temperature 1.0/top_p 0.95,指令模式 0.7/0.80。Qwen Cloud 託管版「即將」提供預設 1M 上下文與官方內建工具,發布當下仍以可下載權重為準。推論框架點名 Transformers、vLLM、SGLang、TokenSpeed。
BF16 safetensors 官方倉約 55.6GB、18 個分片。FP8 官方檔約 25GB 量級。這不是筆電隨手放進顯存的尺寸。社群 GGUF 才把「單卡」變成可執行的句子:Q4_K_M 約 17.1GB,24GB 級顯示卡是常被點名的甜蜜點;16GB 卡得改走 IQ4_XS(約 15.7GB)或 3-bit;12GB 只剩 2-bit 檔,品質折損要當已知條件。視覺投影器 mmproj 另約 0.9GB,沒下這個檔就只是文字模型。原生 262K 若硬灌滿,KV cache 本身就會把 24GB 卡推過界——實務是 4-bit 加 32K 到 64K 上下文,而不是廣告數字直接塞滿。
官方基準:對 Glimmer 全勝已測列,對 Opus 4.6 有贏有輸
下列皆為通義自報,獨立實驗室尚未複現。評測多走 Claude Code harness、256K 窗口;SWE-bench Pro 還註明修正過有問題的題目並重跑基線。把「開源第一」讀成這張表,風險在 harness 與題目修訂都由發布方掌握。
| 基準 | Qwen3.8-27B | Qwen3.6-27B | Muse Glimmer-30B | Opus 4.6 Max |
|---|---|---|---|---|
| Terminal Bench 2.1 | 73.0 | 63.4 | 51.7 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 51.2 | 53.4 |
| DeepSWE 1.1 | 42.2 | 13.3 | — | — |
| LiveCodeBench v6 | 90.3 | 83.9 | — | 88.8 |
| IFBench | 79.5 | 69.1 | 77.0 | 62.5 |
| GPQA Diamond | 89.2 | 87.8 | 83.5 | 91.3 |
| HLE | 30.8 | 24.0 | 22.0 | 40.0 |
| OSWorld-Verified | 84.3 | 63.9 | 65.9 | 72.7 |
| AndroidWorld | 81.9 | 70.3 | — | 62.0 |
| MathVision(無 CI) | 90.0 | 85.1 | — | 65.5 |
OfficeChai 的整理與模型卡一致:凡是 Glimmer 有數字的列,27B 都領先;差距最大的是終端代理,73.0 對 51.7。Glimmer 在 NL2Repo、DeepSWE、JobBench、LiveCodeBench 等較難列缺席,不能把「全面壓過 30B」外推到沒測的題。對自家更大的 Qwen3.7-Plus,27B 在 SWE-bench Pro、QwenSWEBench、Agents' Last Exam 等多數列反而領先——這是發布方用來支撐「稠密小模型打過上一檔 Plus」的敘事,Plus 的參數規模官方沒披露。
對 Opus 4.6 Max 則是分工:終端、倉庫級生成、GPQA、HLE 仍落後;SWE-bench Pro、指令遵循、競賽編程、電腦使用(OSWorld)與部分視覺題,官方表寫 27B 超車。視覺側還有 WebArena-Verified 64.8、SWE-MM 38.6、OmniDocBench 1.5 的 91.1、BabyVision 帶 CI 85.6。這些是多模態本機模型的賣點,也是「只下文字 GGUF、沒下 mmproj」的人測不到的部分。
官方表上多數編程題用 Claude Code harness、temperature 1.0、256K 窗口;SWE-bench Pro 還改過有問題的題並重跑基線。本機用 Ollama 或 llama.cpp 跑 4-bit,既不是同一套工具鏈,也不是同一組取樣。分數能當選型起點,不能當「下載 GGUF 就會得到 61.7」。生產路徑官方點的是 vLLM/SGLang;消費卡路徑才是社群量化。模板、enable_thinking 與 mmproj 任一接錯,視覺與代理體感會先崩,基準數字還在模型卡上好看。
和 Max、和 Glimmer,不是同一場比賽
Max 級 2.4T/95B 激活解決的是「要不要自架旗艦」;27B 解決的是「要不要把資料留在自己的機器」。Apache 2.0 讓後者能進產品;單卡 4-bit 讓後者能進工作室。Meta 的 Glimmer 同樣 Apache、同樣瞄準本機代理,發布只早幾天,官方對照表幾乎是衝著它來的。獨立評測若翻盤,這場 27B 對 30B 的敘事會立刻變;在那之前,開發者能做的是用同一套 harness、同一組倉庫,自己跑一遍 Terminal-Bench 與一輪帶螢幕截圖的電腦操作。
雲端替代仍在。Qwen Cloud 託管版尚未作為「已上線、預設 1M」的事實;第三方路由有把 27B 標到每百萬輸入約 0.33、輸出約 2.40 美元的價,那是通路價,不是阿里官方 27B 價目。不要把 Max 的 2/6 美元表直接貼到 27B 頭上。
下一步只看幾件可下載之後才成立的事:授權檔是否維持 Apache 2.0、Unsloth/llama.cpp 模板是否穩定、24GB 卡上 4-bit 加中等上下文能不能複現官方 SWE-bench Pro 的體感,以及 mmproj 接上之後 OSWorld 類任務會不會明顯掉分。Max 權重證明旗艦可以開;27B 權重證明開源家族裡,真正能在一張消費級顯示卡上跑完一輪代理的,仍是這檔稠密模型。
