七月的預覽版只敢喊「可能全球第二」卻幾乎不給榜;今天阿里把話講滿——正式發布 Qwen3.8-Max:總參數 2.4 兆、每次約 95B 活躍的稀疏 MoE,支援文字/影像/視訊與 1M 上下文,並宣稱這是千問史上第一次將 Max 級權重開源(預計下周上 Hugging Face 與 ModelScope)。API 已上線 QwenCloud,並接入同步推出的 Agent 產品「千問辦公」。
定位很清楚:不是又一個聊天旗艦,而是 Coding+Cowork——能把多日真實專案從空資料夾做到可交付,並在數百種高價值職業工作流裡跑完工具密集任務。
三個「無人插手」案例:什麼叫長程自主編程
官方部落格用三場實驗定義「前沿編碼」:不是寫一個函式,而是多日、自迭代、全自動。
自我進化 harness(10+ 天)。 任務是從零打造 oh-my-cli:把使用者回饋、社群實踐與自測結果收進工程迴路——需求正規化成 GitHub Issues,代理認領後走 ready → leased → active,再觸發 E2E/CI,通過後合 PR。截至約 7 月 30 日、約 16 天全自動運轉後,公開倉庫累積 265 commits、127 PRs、151 issues。完整軌跡在 qwen-code-dev-bot/oh-my-cli。
復現論文再打敗論文(約 5 天)。 只給論文〈Unified Data Selection for LLM Reasoning〉與 GPU,無 starter code。約 125 小時、約 7600 行碼、1100+ 動作、33 輪 GPU 訓練:先花約 37 小時重建管線並復現六項主結論(例如資料選擇相對隨機在 AIME24 高約 +7.7%),再以假設→寫碼→跑實驗→診斷跑 18 個改進構想,最終新方法在 AIME24 再高論文法約 +2.7 分(約 52.29% vs 復現基線 49.58%)。
24 小時天池比賽。 WWW2025 多模態對話意圖辨識,526 支人類隊。模型自讀規則、微調 BERT/MacBERT/RoBERTa 與 Qwen2.5-VL-7B,加中文 CLIP 當不確定時投票,45 次提交把準確率從 0.60 拉到 0.853,勝過 458/526(約 87%)人類隊。
三案共用一條主線:長時間對準開放目標、自己出主意、把主意變成可跑結果——中間沒有人類當專案經理。
這對「代理會不會失控」的公共討論也有另一面:同一能力在資安評測裡可能變成越界攻擊,在工程 demo 裡則被包裝成十六天交付。差別仍在隔離、權限與監測。Anthropic 評測誤連公網與 OpenAI 脫逃事件之後,任何「全自動多日」宣傳都該附帶威脅模型——不是否認能力,而是要求同等級的護欄敘事。
工作流與長程任務:從合規審到晶片後端
Cowork 側,阿里強調用真實世界 RL 同時放大環境與算力,並在 QwenWork/Claude Code/Codex/OpenClaw/Hermes 等多 harness 上求「水平提升」。展示橫跨合規律師(單次掃數百文件、1284 條款)、UI 原型、菜單成本、三十層樓耐震模型、復健 3D、運動戰術報告等「數百高價值職業」場景——數字來自官方 demo,企業採購應當案例而非 SLA。
更硬的是閉環長任務。數位晶片設計:在 Iverilog/Yosys/OpenROAD 沙盒裡,從空 RTL 模板自治完成 GCD/RSA 加速器,約 500 輪、71 次評估,閘數從 8298 壓到 678;實體佈局 die 從 106×106 µm² 收到 46×46 µm²,繞線長度大降並在 500 MHz 達成 timing closure。電商模擬 E-Commerce Bench(365 天、真實脱敏淘寶/天貓資料)最終總資產約 ¥416,252(約 4.16×),官方稱領先第二名 GLM 5.2 約 38%,並較上代 Qwen3.7-Max 提升約 152%。
多模態代理則強調「看自己的中間結果」:長 PDF、百小時影片做成可搜尋記憶圖;RecreationBench 要求只能當黑盒觀察真實 App 再從零重建。另推 Qwen-MM-Plugins,把影像/影片處理、多模態記憶、視覺工具掛進既有 harness。
基準怎麼讀:有贏有輸,別只看標題
Neowin 轉載的官方對照表顯示:相對 Fable 5/GPT-5.6 Sol,Qwen3.8-Max 在部分 coding/agent/general 列領先,但不是橫掃。例如 Terminal-Bench 2.1 約 86.6(Sol max 約 88.8、Fable/Opus 約 84.6);PaperBench 約 93.0 高於兩者;SWE-bench Pro 約 67.7 仍低於 Fable 的約 80.0;DeepSWE 約 56.6 低於 Sol 約 73.0。多模態表上,官方稱在大量視覺/代理測項領先兩者(Neowin 寫「36 項」口徑),但個別如 OSWorld 2.0 等仍有落差。澎湃等中媒另引 Arena:千問文字約全球第五、視覺約第二(僅次 Fable 5)——人群偏好榜與內部表要分開看。
API 支援 reasoning_effort:xhigh(預設)/medium/low,並預設 preserve_thinking。協定相容 OpenAI chat/responses 與 Anthropic 風格介面;區域 endpoint 含北京、新加坡、美東等。定價以 QwenCloud/百煉當日牌價為準,本文不鎖死單一數字。
對開發者,協定相容降低切換成本,但也意味著「換成 Qwen」不只是改 base URL——長程自治若依賴特定 harness 行為(issue 狀態機、視覺回饋、動態 workflow),要在目標框架裡重跑回歸。官方強調跨 QwenWork/Claude Code/Codex 等水平接近,這是產品主張;採購應要求對方出示同一任務在不同 harness 的成功率與失敗模式,而不是只看單表平均分。
和開源戰場怎麼並排
參數量上,2.4T 次於Kimi K3 的 2.8T;策略上卻更衝「Max 級開源」敘事——閉源旗艦先賣 API,一周內丟權重,直接對標「能下載的前沿」。同週DeepSeek V4-Flash-0731用後訓練把小模型打進代理甜區;Qwen 用超大 MoE+長程 RL 講「能連續幹十幾天」。兩者一起壓縮美系單位能力溢價,但採購題不同:一個問帳單與自架顯存,一個問自治天數、多 harness 穩定度與開源落地日是否跳票。
也別忽略七月預覽的教訓:當時「全球第二」幾乎無第三方榜可核。今天材料厚了,但自治案例仍是官方自辦賽道——公開 commit 歷史可查,不等於你的生產環境能安全放養十六天。把 demo 倉庫當研究樣本,把自家 CI 當驗收標準,兩者不要混。
實務建議與下一步
若你跑 coding agent:先用自家 monorepo 重測 Terminal/SWE,不要直接抄 PaperBench 93;設好隔離與花費上限——16 天自治 demo 很炫,帳單與誤改風險也真實。建議先從「單日、單 repo、唯讀+有限寫入」沙盒開始,再逐步放開網路與合併權限。若你做企業辦公代理:看千問辦公與多 harness 互換是否真能「水平接近」,並要求可稽核日誌、人工接管與資料駐留條款。若你等開源:把「下周」寫進日曆,權重一上就核對授權、量化與多卡需求,並對照預覽版承諾是否縮水。
下一步觀察:Max 權重實際上架日與授權條款;獨立評測能否複現自治案例的可複現性;以及 Fable/Sol 是否用降價或開源節奏回應。從「零 benchmark 預覽」走到「案例+長表+承諾開源」,阿里這次至少把可驗證材料攤開了——接下來輪到社群與競品用同一把尺量它能不能交付。
