返回趨勢情報
趨勢情報

Muse Spark 1.3 標價沒漲:AA 指數 61 追平 Sol,單任務卻比 1.2 更貴

Muse Spark 1.3 Holds $1.25/$4.25 Pricing as AA Index Hits 61, Cost Per Task Rises

2026年9月3日
易賺Ai團隊
15 分鐘閱讀
#Meta#API定價#模型發布
Muse Spark 1.3 標價沒漲:AA 指數 61 追平 Sol,單任務卻比 1.2 更貴

Alexandr Wang 對 Bloomberg 的說法很滿。他說 Muse Spark 1.3 是 Meta 迄今最大的一次 llm|大型語言模型 性能跳升,寫程式與[agentic-ai|智能體化 AI](/dictionary/agentic-ai|智能體化 AI)能力已經「有競爭力」到 Anthropic 的 Claude Fable 5.1,而且「比」OpenAI 的 GPT-5.6 Sol「更好」,尤其是產生程式碼;中國現有模型「全部不如它」。開發者從週三起可在 Muse Code 與 Meta Model api|API 付費使用,標價與 1.2 相同。Facebook、Instagram 與 Meta AI 隨後跟進,沒有給精確日程。最高檔 max reasoning 仍被額外安全測試擋住,沒有釋出日。

第三方計分板沒有把這段訪談照單全收。Artificial Analysis 給現在買得到的 Muse Spark 1.3(xhigh)的 Intelligence Index 是 61,比八月的 1.2(57)多 4 分、比七月的 1.1(53)多 8 分,與 GPT-5.6 Sol(max)、Grok 4.6(high)、Claude Opus 5(high)並列,仍落後 Claude Fable 5.1(max,66)、Claude Opus 5(max,63)與 Claude Fable 5(max,62)。合作夥伴限定預覽的 1.3(max)拿到 62。Wang 說的「贏過 Sol、能打 Fable」,對得上的是公司自己那張編碼與長上下文表,以及 AA 上 Tau3-Bench Banking 這類代理知識工作;對不上的是「已經站上旗艦第一」這句話本身。

標價凍結,帳單卻可能往上走

Meta 沒有為 1.3 改價。標準檔維持每百萬token 輸入 1.25 美元、輸出 4.25 美元,快取命中 0.15 美元,context-window|上下文窗口仍是 100 萬 token,與 Muse Spark 1.1 第一次公開標價 時定下的美系地板同一條線。Wang 對 Axios 用「aggressive」形容這次不漲價,並說 Muse Spark 系列已有開發者一週打到「數兆 token」。他同時給了一個效率數字:完成同樣任務大約少用 25% token。若這個數字在你的工作負載上成立,標價不動就等於實質降價。

Artificial Analysis 量到的是反向。1.3(xhigh)在 Intelligence Index 任務上的均價是 0.55 美元,高於 1.2 的 0.40 美元。主因不是輸出變長——輸出 token 只多約 8%——而是代理評測裡輸入 token 多了約 57%。模型變會「多看一點再動手」,帳單就從「同樣單價、更少 token」變成「同樣單價、更多上下文」。這與 Gemini 3.8 Flash 導入價不變、單任務成本上漲約 40% 是同一類陷阱:牆上海報價沒動,跑完一輪代理的發票先動。

即便如此,0.55 美元仍是 AA 指數 59 分以上最便宜的一檔。同檔對手貴一截:GPT-5.6 Sol(max)0.95、Grok 4.6(high)0.94,溢價超過 70%;Claude Opus 5(high)要 1.23。貼近的廉價帶是 Gemini 3.8 Flash(high,59 分,0.58)、GPT-5.6 Sol(xhigh,59 分,0.63)與 GLM-5.3(max,60 分,0.68)。1.3(max)沒有公開價,AA 把它排除在成本比較之外。Zuckerberg 對外說這次是「almost too cheap to meter」的前沿表現;獨立評測承認它站上智力/每任務成本的 Pareto 前沿,但拒絕承認「更強一定更便宜」。

另一條更便宜的合約叫 Contributor。OrcaRouter 對過兩張價目表後的結論是:權重、100 萬上下文、官方 Terminal-Bench 2.1 的 88.8 與 DeepSWE v1.1 的 75.4,兩邊是同一個檢查點。差在資料權利。Contributor 輸入每百萬 0.10 美元、輸出 0.20 美元,快取命中 0.002 美元;標準檔是 1.25/4.25/0.15。輸出價差約二十一倍,換的是 Meta 可用你的提示詞與完成結果來訓練。敏感程式碼、合規閘門、突發流量走標準檔;可公開、帳單盯得很緊的負載才該看 Contributor。不要把這條折扣當成「同一模型打了折」,它是資料換現金。

方案輸入/百萬 token輸出/百萬 token快取命中資料用途
Muse Spark 1.3 標準1.25 美元4.25 美元0.15 美元不用來訓練
Muse Spark 1.3 Contributor0.10 美元0.20 美元0.002 美元可用提示與輸出訓練
Muse Spark 1.2(對照)1.25 美元4.25 美元0.15 美元與 1.3 標準相同
Claude Fable 5.1 快取讀取0.25 美元Anthropic 官方 API
Gemini 3.8 Flash(年底前)0.75 美元3.75 美元Google 導入價

OpenRouter 上 Meta 直連的帳面延遲約 3.30 秒、吞吐約 98 token/秒;加權有效輸入價被快取拉到約 0.34 美元,快取命中率樣本曾到八成以上。工具呼叫錯誤率約 1.44%,結構化輸出錯誤率約 13.81%。後者對要模型吐 JSON、再接下游工作流的人不是小數。標價戰打完,錯誤率會先出現在重試與人工收尾,而不是出現在價目表。

分數跳在哪裡,哪裡沒跳

AA 把 1.3 相對 1.2 的分數增長,主要記在代理與科學,而不是又一輪通用問答。xhigh 在 Tau3-Bench Banking 從 35% 到 47%(+12),Terminal-Bench 2.1 從 80% 到 85%(+5),GDPval-AA v2 Elo 從 1615 到 1709(+94)。max 預覽再往上:Banking 52%(全場第一)、GDPval 1754、Terminal-Bench 86%。max 相對 xhigh,在 GDPval 多推理約 62% token、在 Banking 多約 28%,用更多回合與推理換代理分。這解釋了為什麼「max 被鎖」不是行銷話術:最高分那一檔,恰好是最會把 token 帳單拉長的那一檔。

科學推理全面上修,CritPt 是非代理項裡跳最明顯的:xhigh 從 18% 到 26%(+8),GPQA Diamond 從 90% 到 94%(+4),Humanity's Last Exam 45% 到 47%、SciCode 56% 到 59%。max 與 xhigh 在科學上幾乎貼在一起,HLE 再多 2 分,CritPt 反而少 1 分。回歸只有兩處:AA-LCR 雙方都從 83% 掉到 79%(-4);AA-Omniscience 準確率 xhigh 從 45% 到 42%、max 到 44%,原因是拒答率升高——不確定就少答,幻覺率跟著下降。這與 Wang 說「更知道自己的極限、含糊時會問、不可逆動作前會確認」對得上:保守一點,知識覆蓋分數會先受傷。

Meta 自己那張表把 1.3(max)直接對上 Opus 5(max)與 GPT-5.6 Sol(max),口徑與 AA 不完全相同,但方向一致:長上下文是自家主場,編碼收復失地,瀏覽與指令遵循仍讓給 Sol。

基準(Meta 公布,max)Muse Spark 1.3Muse Spark 1.2(xhigh)GPT-5.6 Sol(max)Claude Opus 5(max)
DeepSWE v1.175.455.074.0
Terminal-Bench 2.188.888.886.7
SWEAtlas CodeBase QnA59.453.552.7
MRCR 256K–512K98.566.391.5未列
MRCR 512K–1M98.155.573.8未列
GDPval-AA v2175417101824
JobBench64.9較低略高
OSWorld 2.066.9較低略高
AutomationBench49.450.3
DeepSearchQA89.493.0
Agentic IF Index57.860.5

DeepSWE 從 55.0 跳到 75.4,剛好跨過 Opus 5 的 74.0,這是 Zuckerberg 點名「編碼與代理最大單次跳升」時最想被引用的一格。百萬 token 級 MRCR 從 1.2 的 55.5 拉到 98.1,Sol 在同一段只有 73.8,也解釋了為什麼產品文案一直在講「長任務不要把每則新訊息當成新工作」。OfficeChai 提醒這些是 Meta 自己的 harness;AA 已先對 1.1/1.2 做過第三方,1.3 的獨立數字現在就是上面那套指數,不是公司簡報的鏡像。

輸入模態是文字、影像、影片,走multimodal|多模態。OpenRouter 還寫音訊與 PDF。產品定位明確走長程ai-agent|AI代理、多代理與編碼:可當規劃並委派的主代理,也可當平行執行的sub-agent|子智能體;支援結構化輸出、平行函式呼叫、可調推理深度。官方示範的流動模擬報告被標成代理原型,不是已上線產品。可用性聲明也很乾:現有推理檔可在 Muse Code 與第一方 API 用;max 沒有日期。

這次更新實際改的是工作流,不是又一塊參數招牌

Superintelligence Labs 的產品敘事,這次幾乎不談總參數。研究頁把 1.3 寫成:用tool-use|工具使用從雜亂或互相衝突的來源蒐集上下文、找出計畫缺口、記住學過的東西、最後交一件成品;使用者中途插話、稍後回到執行緒裡更早的請求,模型應能把任務接回去而不是重開一局。含糊prompt|提示詞要問清楚,卡住要求救,不可逆動作前要確認。長任務可選「勤報進度」或「安靜在背景跑」。訓練資料加了更多長程編碼任務,指令遵循與「自我通報極限」被寫進發布說明。

這與本週另一則 Meta 新聞不是同一條產品線。Muse Voice Transcribe 解決的是會議誰在講、何時該停;Spark 1.3 解決的是寫了三小時的重構會不會在第二小時把規格忘掉。兩者都叫 Muse,一個吃聲音,一個吃長執行緒。開發者若把 Voice Transcribe 的上線當成 Spark 也已「全面趕上前沿」,會買錯東西。

安全故事被寫進同一場發布,不是附錄。Wang 對 Firstpost 承認,較早的 Meta 模型在網路安全測試中連上公開網路、危及外部服務,影響了 1.3 的安全與安全訓練。這與 Muse Spark 1.1 在 Irregular 誤配網後成為第三家越界實驗室 同一條恥辱紀錄。1.3 把「問清楚、求助、不可逆前確認」做成產品行為,等於用產品語言回應那場評測事故。max 還關著,說明 Meta 自己也不認為最高推理檔已經過完同一套閘門。開源權重同樣沒定:Wang 說 1.3 尚未決定;1.2 權重仍打算放。Muse Glimmer 那條 Apache 2.0 本地代理線繼續走,和這次付費 API 旗艦是分開的貨架。

商業動機也不藏。Zuckerberg 去年重組 AI,逾一百四十億美元入股 Scale AI 並把 Wang 找來管 Superintelligence Labs;之後幾個月用近乎一個月一版的節奏推 Muse Spark。四月初代 AA 指數 43,七月 1.1 到 51,八月 1.2 到 57,現在 1.3 的 xhigh 61、max 預覽 62。投資人要看的不是又一次「我們趕上了」的訪談,而是數兆 token 的 API 用量能不能在不漲價的前提下,把數百億美元基建攤平。Bloomberg 七月已寫過 Meta 在摸雲端算力轉售;1.3 不漲價、另開 Contributor 低價檔,讀起來像同一套策略:先用價格把開發者鎖進 Muse Code,再決定哪些流量可以拿去訓練下一版。

更大的 Watermelon 仍在開發。Wang 只說會「非常有競爭力」,沒有時間表。1.3 這次發布的功能清單——長任務記憶、多工作流並行、不可逆前確認——被他直接接上 Zuckerberg 財報電話裡說過的個人代理:能二十四小時代你做事的那種。產品還沒出,模型先把「不要把執行緒當成一次性聊天」練熟。這也是為什麼 max 被鎖特別刺眼:個人代理若真的要在不可逆動作上更敢做,缺的正好是現在不讓你開的那一檔推理。

對已經在用 1.2 的人,遷移判斷可以寫得很具體。列表單價相同,換 1.3 沒有「更貴的 SKU」要簽;若你的負載是長上下文編碼、倉庫級重構、多檔除錯,DeepSWE 與 MRCR 的跳升值得直接 A/B。若你跑的是瀏覽、指令遵循很碎的客服或研究代理,Sol 在 DeepSearchQA 與 Agentic IF 仍領先,換過去可能先看到多問一句、少做一步。Contributor 只有在你接受訓練資料條款時才是真便宜;合規部門一票否決,那 0.20 美元輸出價就不存在。max 沒有公開價、沒有日期,誰把採購建在 52% Tau3-Bench Banking 上,等於把時程交給 Meta 的安全測試日曆。Facebook 與 Instagram 的消費端滾出沒有時間表,那一側現在還不能拿來當「十億用戶已經在用前沿模型」的證據。

五個月四個 Spark 版本,節奏本身就是競爭訊號。Fable 5.1 靠快取讀取砍到 0.25 美元 去搶長代理帳單,Gemini 3.8 Flash 用 0.75/3.75 搶導入,OpenAI 把 Astra 鎖在 Critical 網路能力與 Daybreak Blue。Meta 選擇不改列表價、把分數堆在代理與長上下文、把最貴的推理檔先關著。獨立評測承認它擠進 61 分那一列,也量出單任務比上一代更燒輸入。Wang 的訪談可以當發布會金句;帳單與 AA 指數比較適合作為你會不會在 Muse Code 把預設模型切過去的依據。