返回資訊
AI趨勢入門

Qwen3.8-27B 權重落地:Apache 2.0 稠密多模態,262K 原生、官方稱單卡可打 Muse Glimmer

2026年8月16日
易賺Ai團隊
8 分鐘閱讀
#Qwen#多模態#開放權重#Apache 2.0#Qwen3.8-27B#本機部署
Qwen3.8-27B 權重落地:Apache 2.0 稠密多模態,262K 原生、官方稱單卡可打 Muse Glimmer

2.4 兆參數的 Max 權重要機架;多數人真的會下載到磁碟的,是另一份。Qwen3.8-27B 已在 Hugging Face 與 ModelScope 上架,Apache 2.0,官方卡片寫成帶視覺編碼器的稠密因果語言模型:約 270 億參數、原生理解圖像與影片,上下文窗口 262,144、可用 YaRN 延到 100 萬開放權重這件事,Max 那條線我們已經寫過;27B 這條線要回答的是另一個問題——單機、可商用、還能不能在AI 代理與電腦操作基準上壓過剛開源的 Muse Glimmer 30B。The Decoder、OfficeChai、官方模型卡與社群量化指南把規格對過一遍。

授權先講清楚。27B 是 Apache 2.0:下載、修改、再散布、商業使用,沒有使用規模上限。同代 Qwen3.8-2.4T-A95B 走另一份 Max 授權,第三方讀授權文指出超過一定營收規模的 AI 服務業務要另洽許可。兩份權重同一週出現,不代表兩份法律地位相同。要做產品、要微調、要把模型嵌進AI 代理,27B 這張 Apache 檔才是多數團隊能直接簽字的那一份。

規格:不是小一號的 Max,是本機用的稠密多模態

官方模型卡把 27B 寫成 Qwen3.5 架構家族上的後訓練成果,不是把 2.4T 混合專家模型剪小。類型是 Causal Language Model with Vision Encoder。隱藏維度 5120、64 層;層配置為 16 組「3×(Gated DeltaNet→FFN)再 1×(Gated Attention→FFN)」——也就是約四分之三層走線性注意力、四分之一層走完整門控注意力。這解釋了社群為什麼說長上下文的 KV cache 比同尺寸稠密模型省:完整注意力層比較少。FFN 中間維 17408,詞嵌入填充到 248320,並訓練了多步 MTP(Multi-Token Prediction)。

思考預設開,可依請求關掉;reasoning_effortxhigh(預設)、mediumlowpreserve_thinking 預設保留歷史思考上下文。官方提醒:多輪代理任務裡,把力度調低不一定省總時間——單輪變快,分析不夠就重試,延遲與 token 反而上升。取樣建議思考模式 temperature 1.0/top_p 0.95,指令模式 0.7/0.80。Qwen Cloud 託管版「即將」提供預設 1M 上下文與官方內建工具,發布當下仍以可下載權重為準。推論框架點名 Transformers、vLLM、SGLang、TokenSpeed。

BF16 safetensors 官方倉約 55.6GB、18 個分片。FP8 官方檔約 25GB 量級。這不是筆電隨手放進顯存的尺寸。社群 GGUF 才把「單卡」變成可執行的句子:Q4_K_M 約 17.1GB,24GB 級顯示卡是常被點名的甜蜜點;16GB 卡得改走 IQ4_XS(約 15.7GB)或 3-bit;12GB 只剩 2-bit 檔,品質折損要當已知條件。視覺投影器 mmproj 另約 0.9GB,沒下這個檔就只是文字模型。原生 262K 若硬灌滿,KV cache 本身就會把 24GB 卡推過界——實務是 4-bit 加 32K 到 64K 上下文,而不是廣告數字直接塞滿。

官方基準:對 Glimmer 全勝已測列,對 Opus 4.6 有贏有輸

下列皆為通義自報,獨立實驗室尚未複現。評測多走 Claude Code harness、256K 窗口;SWE-bench Pro 還註明修正過有問題的題目並重跑基線。把「開源第一」讀成這張表,風險在 harness 與題目修訂都由發布方掌握。

基準Qwen3.8-27BQwen3.6-27BMuse Glimmer-30BOpus 4.6 Max
Terminal Bench 2.173.063.451.778.2
SWE-bench Pro61.753.551.253.4
DeepSWE 1.142.213.3
LiveCodeBench v690.383.988.8
IFBench79.569.177.062.5
GPQA Diamond89.287.883.591.3
HLE30.824.022.040.0
OSWorld-Verified84.363.965.972.7
AndroidWorld81.970.362.0
MathVision(無 CI)90.085.165.5

OfficeChai 的整理與模型卡一致:凡是 Glimmer 有數字的列,27B 都領先;差距最大的是終端代理,73.0 對 51.7。Glimmer 在 NL2Repo、DeepSWE、JobBench、LiveCodeBench 等較難列缺席,不能把「全面壓過 30B」外推到沒測的題。對自家更大的 Qwen3.7-Plus,27B 在 SWE-bench Pro、QwenSWEBench、Agents' Last Exam 等多數列反而領先——這是發布方用來支撐「稠密小模型打過上一檔 Plus」的敘事,Plus 的參數規模官方沒披露。

對 Opus 4.6 Max 則是分工:終端、倉庫級生成、GPQA、HLE 仍落後;SWE-bench Pro、指令遵循、競賽編程、電腦使用(OSWorld)與部分視覺題,官方表寫 27B 超車。視覺側還有 WebArena-Verified 64.8、SWE-MM 38.6、OmniDocBench 1.5 的 91.1、BabyVision 帶 CI 85.6。這些是多模態本機模型的賣點,也是「只下文字 GGUF、沒下 mmproj」的人測不到的部分。

官方表上多數編程題用 Claude Code harness、temperature 1.0、256K 窗口;SWE-bench Pro 還改過有問題的題並重跑基線。本機用 Ollama 或 llama.cpp 跑 4-bit,既不是同一套工具鏈,也不是同一組取樣。分數能當選型起點,不能當「下載 GGUF 就會得到 61.7」。生產路徑官方點的是 vLLM/SGLang;消費卡路徑才是社群量化。模板、enable_thinking 與 mmproj 任一接錯,視覺與代理體感會先崩,基準數字還在模型卡上好看。

和 Max、和 Glimmer,不是同一場比賽

Max 級 2.4T/95B 激活解決的是「要不要自架旗艦」;27B 解決的是「要不要把資料留在自己的機器」。Apache 2.0 讓後者能進產品;單卡 4-bit 讓後者能進工作室。Meta 的 Glimmer 同樣 Apache、同樣瞄準本機代理,發布只早幾天,官方對照表幾乎是衝著它來的。獨立評測若翻盤,這場 27B 對 30B 的敘事會立刻變;在那之前,開發者能做的是用同一套 harness、同一組倉庫,自己跑一遍 Terminal-Bench 與一輪帶螢幕截圖的電腦操作。

雲端替代仍在。Qwen Cloud 託管版尚未作為「已上線、預設 1M」的事實;第三方路由有把 27B 標到每百萬輸入約 0.33、輸出約 2.40 美元的價,那是通路價,不是阿里官方 27B 價目。不要把 Max 的 2/6 美元表直接貼到 27B 頭上。

下一步只看幾件可下載之後才成立的事:授權檔是否維持 Apache 2.0、Unsloth/llama.cpp 模板是否穩定、24GB 卡上 4-bit 加中等上下文能不能複現官方 SWE-bench Pro 的體感,以及 mmproj 接上之後 OSWorld 類任務會不會明顯掉分。Max 權重證明旗艦可以開;27B 權重證明開源家族裡,真正能在一張消費級顯示卡上跑完一輪代理的,仍是這檔稠密模型。