返回資訊
AI趨勢入門

阿里兌現 Max 級開源:Qwen3.8-2.4T-A95B 權重上線,2.4T/95B 激活、原生約 256K

2026年8月13日
易賺Ai團隊
8 分鐘閱讀
#Qwen#Hugging Face#開源權重#MoE#阿里#Qwen3.8#ModelScope
阿里兌現 Max 級開源:Qwen3.8-2.4T-A95B 權重上線,2.4T/95B 激活、原生約 256K

「下周開源」這句話,這次真的變成下載連結。阿里 Qwen 團隊把 Qwen3.8-2.4T-A95B 權重放到魔搭 ModelScope 與 Hugging Face:總參 2.4 兆、每 token 約激活 95B 的稀疏混合專家模型——官方稱這是 Qwen-Max 級模型首次開源權重。IT之家、RuntimeWire、NVIDIA 技術部落格、Top AI Product、AIReiter 等同步整理;這正好兌現站內 Qwen3.8-Max 正式發布時「首輪 Max 級權重下周開源」的承諾。

數字很唬人,門檻也一樣。這不是筆電玩具:報導指即便約 4-bit 量化,權重體積仍可到約 1.2TB 量級,幾乎只適合資料中心級服務。開源檔與雲端 Qwen3.8-Max 也不是同一個產品面——下載版更窄、更「重思考」。

架構與介面:512 專家、強制 thinking、純文字

模型卡把骨架寫死:因果語言模型;約 92 層;每層 MoE 約 512 專家,每 token 選 10 個路由專家並同時激活 1 個共享專家;隱藏維約 8192;token embedding 約 248,320(含 padding)。架構延續 Qwen3.5 一脈的混合注意力/線性注意力+MoE 敘事,並做過多步 MTP(Multi-Token Prediction)訓練,方便支援相應機制的推論引擎一次預測多個後續 token。

項目開源權重 Qwen3.8-2.4T-A95B雲端 Qwen3.8-Max(對照)
參數2.4T 總/約 95B 激活同底座+生產能力
模態純文字含視覺輸入等
思考模式強制 thinking(可調 effort)可非 thinking
上下文原生 262,144,可擴至約 1,010,000預設約 1M 等敘述
工具/產品化自架+vLLM/SGLang/TokenSpeed 等內建工具、託管推論
授權Qwen3.8 專用條款(非 Apache)雲端服務條款

reasoning_effort 支援 xhigh(預設)/medium/low;preserve_thinking 可保留先前訊息的推理上下文。重點是:文件介面上關不掉 thinking——每個回答先走思維鏈。對延遲與成本敏感的批次任務,這是硬約束,不是小開關。

基準:官方表互有勝負,PaperBench 亮眼

官方評測覆蓋編程 Agent、通用 Agent、專業工作與長上下文等;與 Opus 4.8、Fable 5、GPT-5.6 Sol 等對照「互有高低」。模型卡/整理稿常見數字包括:Terminal-Bench 2.1 約 86.6、SWE-bench Pro 約 67.7、PaperBench 約 93.0、GPQA Diamond 約 92.6。相對 Fable 5,SWE-bench Pro 仍明顯落後(約 80.0 對 67.7);PaperBench、部分 Agent 題則寫成所列模型中較高。

RuntimeWire 提醒:公開材料多半是託管 Max 的公司自測,下載權重的第三方獨立複現與真實服務成本,仍待社群跑出來。讀表時要把「官方 harness 分數」與「你機房裡的 tok/$」分開。

後訓練敘事也很「Agent 產品化」:擴真實環境並把任務/工作區/Harness 解耦;統一獎勵系統涵蓋執行校驗、文本與渲染視覺 rubric、agentic 檢查;線上資料均衡器壓低 batch 梯度方差以撐 RL 擴算力。這解釋了為什麼官方強調長週期AI 代理與辦公 cowork,而不只是單輪問答。

授權與硬體:開權重 ≠ 開源自由

多篇英文整理指出授權是 qwen3.8-max/專用商業條款,不是 Apache 2.0——「開權重,不是(OSI 意義上的)開源」。大規模產品/MaaS 可能觸發署名或另簽商業協議之類門檻(細節以倉庫授權檔為準)。法務與採購不能拿「能下載」當「可任意白牌轉售」的通行證。

服務面:Transformers 格式權重;vLLM、SGLang、TokenSpeed Day-0 相容敘事;另有 FP8 等量化路徑與社群 GGUF 嘗試。NVIDIA 同步示範在 GB300 NVL72 等機架上服務該模型,並可用 NeMo AutoModel 做 SFT/LoRA——這也把故事接回硬體商的「開源推升算力」算式,與前一日 Nemotron 3.5 Lightning 的執行層路線形成對照:一邊是可單卡跑的高頻執行 MoE,一邊是旗艦級自架大腦。

和美系本週開源潮並讀:Meta Muse Glimmer 主打本地稠密代理;NVIDIA Lightning 主打吞吐執行層;Qwen3.8 則把近前沿總容量丟進可下載權重。中國開源陣營在「旗艦可自架」這一格再插一旗——但電費與機架數會先篩掉大多數個人開發者。對照 Kimi K3 等級的超大開源權重敘事,Qwen 這次不是靠「總參第一」搶版面,而是靠「Max 產品線第一次可下載」改企業採購劇本:私有化標案終於能寫進可驗證的旗艦級權重,而不只是 API SLA。

部署現實:Day-0 引擎與仍在空中的成本曲線

權重格式走 Hugging Face Transformers;vLLM、SGLang、TokenSpeed 被寫成 Day-0。另有 FP8(細粒度、block 128 等敘述)與社群 GGUF 嘗試——有助縮傳輸與顯存,但 95B 激活本身仍決定單步算力地板。NVIDIA 示範在 GB300 NVL72 機架服務該模型,並可用 NeMo AutoModel 做全量 SFT 或 LoRA:這等於告訴基礎設施買家——開源旗艦的「可下載」會立刻轉成「要租/要買的機架」。

成本曲線目前多半還在空中。官方基準沒有附你機房的美元/百萬 token;RuntimeWire 也明說第三方部署的效能與成本尚未被公開證據釘死。實務上,團隊應先用小流量影子流量對打雲端 Max,再決定要不要為私有化買單。強制 thinking 會讓「短指令、高併發」場景特別貴——若產品其實只需要分類或抽取,開源旗艦可能是錯工具。

誰該下載、誰該繼續用 API

資料中心與有私有化剛需的企業:值得評估自架/專有雲,換資料主權與客製後訓練空間。中小團隊與個人:多數情況 API/Token Plan 仍較合理——權重下載只是證明「能力可複現」,不是證明「你負擔得起複現」。合規團隊:先讀授權檔與出口/管轄限制,再談上線。代理產品團隊:優先驗證長週期 cowork/編程 harness,而不是再刷一輪聊天 Arena。

下一步觀察:獨立基準是否複製官方表;社群對強制 thinking 的延遲代價;授權爭議案例;以及是否還有更小、可關思考的衍生權重。Qwen 把 Max 級權重放進開源生態——接下來要比的,是誰能把它跑穩,而不是誰先截圖參數表。