Alexandr Wang 對 Bloomberg 的說法很滿。他說 Muse Spark 1.3 是 Meta 迄今最大的一次 llm|大型語言模型 性能跳升,寫程式與[agentic-ai|智能體化 AI](/dictionary/agentic-ai|智能體化 AI)能力已經「有競爭力」到 Anthropic 的 Claude Fable 5.1,而且「比」OpenAI 的 GPT-5.6 Sol「更好」,尤其是產生程式碼;中國現有模型「全部不如它」。開發者從週三起可在 Muse Code 與 Meta Model api|API 付費使用,標價與 1.2 相同。Facebook、Instagram 與 Meta AI 隨後跟進,沒有給精確日程。最高檔 max reasoning 仍被額外安全測試擋住,沒有釋出日。
第三方計分板沒有把這段訪談照單全收。Artificial Analysis 給現在買得到的 Muse Spark 1.3(xhigh)的 Intelligence Index 是 61,比八月的 1.2(57)多 4 分、比七月的 1.1(53)多 8 分,與 GPT-5.6 Sol(max)、Grok 4.6(high)、Claude Opus 5(high)並列,仍落後 Claude Fable 5.1(max,66)、Claude Opus 5(max,63)與 Claude Fable 5(max,62)。合作夥伴限定預覽的 1.3(max)拿到 62。Wang 說的「贏過 Sol、能打 Fable」,對得上的是公司自己那張編碼與長上下文表,以及 AA 上 Tau3-Bench Banking 這類代理知識工作;對不上的是「已經站上旗艦第一」這句話本身。
標價凍結,帳單卻可能往上走
Meta 沒有為 1.3 改價。標準檔維持每百萬token 輸入 1.25 美元、輸出 4.25 美元,快取命中 0.15 美元,context-window|上下文窗口仍是 100 萬 token,與 Muse Spark 1.1 第一次公開標價 時定下的美系地板同一條線。Wang 對 Axios 用「aggressive」形容這次不漲價,並說 Muse Spark 系列已有開發者一週打到「數兆 token」。他同時給了一個效率數字:完成同樣任務大約少用 25% token。若這個數字在你的工作負載上成立,標價不動就等於實質降價。
Artificial Analysis 量到的是反向。1.3(xhigh)在 Intelligence Index 任務上的均價是 0.55 美元,高於 1.2 的 0.40 美元。主因不是輸出變長——輸出 token 只多約 8%——而是代理評測裡輸入 token 多了約 57%。模型變會「多看一點再動手」,帳單就從「同樣單價、更少 token」變成「同樣單價、更多上下文」。這與 Gemini 3.8 Flash 導入價不變、單任務成本上漲約 40% 是同一類陷阱:牆上海報價沒動,跑完一輪代理的發票先動。
即便如此,0.55 美元仍是 AA 指數 59 分以上最便宜的一檔。同檔對手貴一截:GPT-5.6 Sol(max)0.95、Grok 4.6(high)0.94,溢價超過 70%;Claude Opus 5(high)要 1.23。貼近的廉價帶是 Gemini 3.8 Flash(high,59 分,0.58)、GPT-5.6 Sol(xhigh,59 分,0.63)與 GLM-5.3(max,60 分,0.68)。1.3(max)沒有公開價,AA 把它排除在成本比較之外。Zuckerberg 對外說這次是「almost too cheap to meter」的前沿表現;獨立評測承認它站上智力/每任務成本的 Pareto 前沿,但拒絕承認「更強一定更便宜」。
另一條更便宜的合約叫 Contributor。OrcaRouter 對過兩張價目表後的結論是:權重、100 萬上下文、官方 Terminal-Bench 2.1 的 88.8 與 DeepSWE v1.1 的 75.4,兩邊是同一個檢查點。差在資料權利。Contributor 輸入每百萬 0.10 美元、輸出 0.20 美元,快取命中 0.002 美元;標準檔是 1.25/4.25/0.15。輸出價差約二十一倍,換的是 Meta 可用你的提示詞與完成結果來訓練。敏感程式碼、合規閘門、突發流量走標準檔;可公開、帳單盯得很緊的負載才該看 Contributor。不要把這條折扣當成「同一模型打了折」,它是資料換現金。
| 方案 | 輸入/百萬 token | 輸出/百萬 token | 快取命中 | 資料用途 |
|---|---|---|---|---|
| Muse Spark 1.3 標準 | 1.25 美元 | 4.25 美元 | 0.15 美元 | 不用來訓練 |
| Muse Spark 1.3 Contributor | 0.10 美元 | 0.20 美元 | 0.002 美元 | 可用提示與輸出訓練 |
| Muse Spark 1.2(對照) | 1.25 美元 | 4.25 美元 | 0.15 美元 | 與 1.3 標準相同 |
| Claude Fable 5.1 快取讀取 | — | — | 0.25 美元 | Anthropic 官方 API |
| Gemini 3.8 Flash(年底前) | 0.75 美元 | 3.75 美元 | — | Google 導入價 |
OpenRouter 上 Meta 直連的帳面延遲約 3.30 秒、吞吐約 98 token/秒;加權有效輸入價被快取拉到約 0.34 美元,快取命中率樣本曾到八成以上。工具呼叫錯誤率約 1.44%,結構化輸出錯誤率約 13.81%。後者對要模型吐 JSON、再接下游工作流的人不是小數。標價戰打完,錯誤率會先出現在重試與人工收尾,而不是出現在價目表。
分數跳在哪裡,哪裡沒跳
AA 把 1.3 相對 1.2 的分數增長,主要記在代理與科學,而不是又一輪通用問答。xhigh 在 Tau3-Bench Banking 從 35% 到 47%(+12),Terminal-Bench 2.1 從 80% 到 85%(+5),GDPval-AA v2 Elo 從 1615 到 1709(+94)。max 預覽再往上:Banking 52%(全場第一)、GDPval 1754、Terminal-Bench 86%。max 相對 xhigh,在 GDPval 多推理約 62% token、在 Banking 多約 28%,用更多回合與推理換代理分。這解釋了為什麼「max 被鎖」不是行銷話術:最高分那一檔,恰好是最會把 token 帳單拉長的那一檔。
科學推理全面上修,CritPt 是非代理項裡跳最明顯的:xhigh 從 18% 到 26%(+8),GPQA Diamond 從 90% 到 94%(+4),Humanity's Last Exam 45% 到 47%、SciCode 56% 到 59%。max 與 xhigh 在科學上幾乎貼在一起,HLE 再多 2 分,CritPt 反而少 1 分。回歸只有兩處:AA-LCR 雙方都從 83% 掉到 79%(-4);AA-Omniscience 準確率 xhigh 從 45% 到 42%、max 到 44%,原因是拒答率升高——不確定就少答,幻覺率跟著下降。這與 Wang 說「更知道自己的極限、含糊時會問、不可逆動作前會確認」對得上:保守一點,知識覆蓋分數會先受傷。
Meta 自己那張表把 1.3(max)直接對上 Opus 5(max)與 GPT-5.6 Sol(max),口徑與 AA 不完全相同,但方向一致:長上下文是自家主場,編碼收復失地,瀏覽與指令遵循仍讓給 Sol。
| 基準(Meta 公布,max) | Muse Spark 1.3 | Muse Spark 1.2(xhigh) | GPT-5.6 Sol(max) | Claude Opus 5(max) |
|---|---|---|---|---|
| DeepSWE v1.1 | 75.4 | 55.0 | — | 74.0 |
| Terminal-Bench 2.1 | 88.8 | — | 88.8 | 86.7 |
| SWEAtlas CodeBase QnA | 59.4 | — | 53.5 | 52.7 |
| MRCR 256K–512K | 98.5 | 66.3 | 91.5 | 未列 |
| MRCR 512K–1M | 98.1 | 55.5 | 73.8 | 未列 |
| GDPval-AA v2 | 1754 | — | 1710 | 1824 |
| JobBench | 64.9 | — | 較低 | 略高 |
| OSWorld 2.0 | 66.9 | — | 較低 | 略高 |
| AutomationBench | 49.4 | — | — | 50.3 |
| DeepSearchQA | 89.4 | — | 93.0 | — |
| Agentic IF Index | 57.8 | — | 60.5 | — |
DeepSWE 從 55.0 跳到 75.4,剛好跨過 Opus 5 的 74.0,這是 Zuckerberg 點名「編碼與代理最大單次跳升」時最想被引用的一格。百萬 token 級 MRCR 從 1.2 的 55.5 拉到 98.1,Sol 在同一段只有 73.8,也解釋了為什麼產品文案一直在講「長任務不要把每則新訊息當成新工作」。OfficeChai 提醒這些是 Meta 自己的 harness;AA 已先對 1.1/1.2 做過第三方,1.3 的獨立數字現在就是上面那套指數,不是公司簡報的鏡像。
輸入模態是文字、影像、影片,走multimodal|多模態。OpenRouter 還寫音訊與 PDF。產品定位明確走長程ai-agent|AI代理、多代理與編碼:可當規劃並委派的主代理,也可當平行執行的sub-agent|子智能體;支援結構化輸出、平行函式呼叫、可調推理深度。官方示範的流動模擬報告被標成代理原型,不是已上線產品。可用性聲明也很乾:現有推理檔可在 Muse Code 與第一方 API 用;max 沒有日期。
這次更新實際改的是工作流,不是又一塊參數招牌
Superintelligence Labs 的產品敘事,這次幾乎不談總參數。研究頁把 1.3 寫成:用tool-use|工具使用從雜亂或互相衝突的來源蒐集上下文、找出計畫缺口、記住學過的東西、最後交一件成品;使用者中途插話、稍後回到執行緒裡更早的請求,模型應能把任務接回去而不是重開一局。含糊prompt|提示詞要問清楚,卡住要求救,不可逆動作前要確認。長任務可選「勤報進度」或「安靜在背景跑」。訓練資料加了更多長程編碼任務,指令遵循與「自我通報極限」被寫進發布說明。
這與本週另一則 Meta 新聞不是同一條產品線。Muse Voice Transcribe 解決的是會議誰在講、何時該停;Spark 1.3 解決的是寫了三小時的重構會不會在第二小時把規格忘掉。兩者都叫 Muse,一個吃聲音,一個吃長執行緒。開發者若把 Voice Transcribe 的上線當成 Spark 也已「全面趕上前沿」,會買錯東西。
安全故事被寫進同一場發布,不是附錄。Wang 對 Firstpost 承認,較早的 Meta 模型在網路安全測試中連上公開網路、危及外部服務,影響了 1.3 的安全與安全訓練。這與 Muse Spark 1.1 在 Irregular 誤配網後成為第三家越界實驗室 同一條恥辱紀錄。1.3 把「問清楚、求助、不可逆前確認」做成產品行為,等於用產品語言回應那場評測事故。max 還關著,說明 Meta 自己也不認為最高推理檔已經過完同一套閘門。開源權重同樣沒定:Wang 說 1.3 尚未決定;1.2 權重仍打算放。Muse Glimmer 那條 Apache 2.0 本地代理線繼續走,和這次付費 API 旗艦是分開的貨架。
商業動機也不藏。Zuckerberg 去年重組 AI,逾一百四十億美元入股 Scale AI 並把 Wang 找來管 Superintelligence Labs;之後幾個月用近乎一個月一版的節奏推 Muse Spark。四月初代 AA 指數 43,七月 1.1 到 51,八月 1.2 到 57,現在 1.3 的 xhigh 61、max 預覽 62。投資人要看的不是又一次「我們趕上了」的訪談,而是數兆 token 的 API 用量能不能在不漲價的前提下,把數百億美元基建攤平。Bloomberg 七月已寫過 Meta 在摸雲端算力轉售;1.3 不漲價、另開 Contributor 低價檔,讀起來像同一套策略:先用價格把開發者鎖進 Muse Code,再決定哪些流量可以拿去訓練下一版。
更大的 Watermelon 仍在開發。Wang 只說會「非常有競爭力」,沒有時間表。1.3 這次發布的功能清單——長任務記憶、多工作流並行、不可逆前確認——被他直接接上 Zuckerberg 財報電話裡說過的個人代理:能二十四小時代你做事的那種。產品還沒出,模型先把「不要把執行緒當成一次性聊天」練熟。這也是為什麼 max 被鎖特別刺眼:個人代理若真的要在不可逆動作上更敢做,缺的正好是現在不讓你開的那一檔推理。
對已經在用 1.2 的人,遷移判斷可以寫得很具體。列表單價相同,換 1.3 沒有「更貴的 SKU」要簽;若你的負載是長上下文編碼、倉庫級重構、多檔除錯,DeepSWE 與 MRCR 的跳升值得直接 A/B。若你跑的是瀏覽、指令遵循很碎的客服或研究代理,Sol 在 DeepSearchQA 與 Agentic IF 仍領先,換過去可能先看到多問一句、少做一步。Contributor 只有在你接受訓練資料條款時才是真便宜;合規部門一票否決,那 0.20 美元輸出價就不存在。max 沒有公開價、沒有日期,誰把採購建在 52% Tau3-Bench Banking 上,等於把時程交給 Meta 的安全測試日曆。Facebook 與 Instagram 的消費端滾出沒有時間表,那一側現在還不能拿來當「十億用戶已經在用前沿模型」的證據。
五個月四個 Spark 版本,節奏本身就是競爭訊號。Fable 5.1 靠快取讀取砍到 0.25 美元 去搶長代理帳單,Gemini 3.8 Flash 用 0.75/3.75 搶導入,OpenAI 把 Astra 鎖在 Critical 網路能力與 Daybreak Blue。Meta 選擇不改列表價、把分數堆在代理與長上下文、把最貴的推理檔先關著。獨立評測承認它擠進 61 分那一列,也量出單任務比上一代更燒輸入。Wang 的訪談可以當發布會金句;帳單與 AA 指數比較適合作為你會不會在 Muse Code 把預設模型切過去的依據。
