帳單裡真正咬人的,往往不是標價牆上的輸入與輸出,而是長任務反覆把同一段上下文再讀一遍。anthropic 這次沒有改 Fable 的門面單價,卻把快取讀取(cache reads)砍到原來的四分之一:每百萬 token 0.25 美元。官方用八月實測用量估算,典型工作負載整體大約便宜 25%;上下文長、工具呼叫多的高度 [agentic-ai|智能體化 AI](/dictionary/agentic-ai|智能體化 AI) 場景,最高可到約 45%。同一天登場的 Claude Mythos 5.1 與 Fable 5.1 是同一套底層模型,差別在安全閘門——Fable 全面開放,Mythos 仍走受信任存取。
這不是「又出一個更強一點的旗艦」那種空話。官方把定價、基準、企業隱私與誤攔截一起打包:你要看的是錢怎麼從帳單上消失、哪些能力真的往上跳、哪些風險工作仍然進不了一般帳號。
標價沒動,帳單卻可能動很大
Fable 5.1 的基礎價維持與 Fable 5 相同:輸入每百萬 token 10 美元、輸出 50 美元。五分鐘快取寫入 12.50、一小時快取寫入 20,也沒改。唯一大刀落在「讀已處理過的上下文」:快取命中從以往約 0.1 倍輸入價,改成約 0.025 倍,也就是每百萬 token 0.25 美元。Batch api|API 仍是輸入/輸出半價。
為什麼代理任務省得特別兇?因為長跑 ai-agent|AI代理 會反覆帶著同一份程式庫、規格書、測試紀錄進下一輪工具呼叫;那些重複前綴一旦進了 prompt cache,帳單主體就從「再付一次完整輸入」變成「付便宜的讀取」。官方用八月真實用量做索引圖:典型負載把 Fable 5 標成 100,Fable 5.1 約落在 75;高度代理負載則約落在 55。數字是估算,不是保證折扣券,但方向清楚——你愈依賴長上下文與工具迴圈,這次改價愈有感。
規格面上,context-window|上下文窗口 預設與上限都是 100 萬 token,單次輸出上限 12.8 萬;整段窗口都按標準每 token 計價,沒有「長窗加價」的另一層表。Adaptive thinking 預設開著,用 effort 調深度。分詞器與 Fable 5(自 Opus 4.7 起那套)相同;相對更舊的 Claude,同一段文字大約會多出約 30% token——遷移時若只比「字數」,很容易低估實際花費。
開發者識別字是 claude-fable-5-1,已上 Claude.ai、Claude Code、Claude API,以及 AWS、Google Cloud、Microsoft Azure。官方建議多數工作負載先從 Opus 5 起跳;當 Opus 5 拉高 effort 仍過不了你的內部評測,再把 Fable 5.1 當長程推理與代理主力。
基準不是「全面小幅上修」
把官方對照表攤開,跳得最大的不是又一個通用問答榜,而是科學代理與終端代理:
| 基準 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8%(Mythos 5.1:60.9%) | 42.0% | 52.3% | 37.3% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| Humanity's Last Exam(無工具/有工具) | 60.9%/65.0% | 57.8%/63.8% | 56.6%/63.6% | — |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| OSWorld 2.0(partial/strict) | 77.9%/41.7% | 72.9%/36.1% | 75.4%/39.6% | — |
科學代理那一欄幾乎翻倍:24.7% 到 52.6%,誤差帶官方標在約 ±3.5–4.5 個百分點,仍遠大於「噪音級」波動。Terminal-Bench 4.0 上 Fable 5.1 超過 Opus 5;打開較鬆閘門的 Mythos 5.1 再往上到 60.9%。讀這些分數時要記住附註:Fable 系列是在「生產防護開啟」下測的,防護介入的題目會被記成零分,因此公開數字偏保守,不是把安全閘關掉後的天花板。
努力程度(effort)也進入成本故事。官方圖表顯示:Fable 5.1 設成 Low 或 Medium 時,常能用更低的每任務成本達到接近或優於 Fable 5 的結果;Claude Code 預設 High,Claude.ai/Cowork 預設 Medium。換句話說,升級模型之後若仍全程鎖死最高努力,你可能吃掉一半本來能靠快取與 effort 省下的空間。
客戶抱怨的三件事,這次一次回
價格之外,官方明講這輪要處理企業端回饋的另外兩條:資料留存,以及防護誤攔截。
Enterprise Frontier Safeguards(EFS)的設計目標,是讓企業拿到接近零資料留存(zero data retention)的隱私,同時仍能做濫用偵測。資料放在客戶自己控制的雲端基礎設施,而不是 Anthropic 伺服器;預設的人工覆核也改由客戶自己做。公司說與金融、醫療、製造、電信、法律、零售與公部門等逾百家客戶,以及 AWS、Google Cloud、Microsoft Azure 一起打磨,秋季起分階段上線,涵蓋 Claude Code、Claude Enterprise、Claude Platform、Bedrock、Google Agent Platform、Microsoft Foundry 等。EFS 到位前,符合資格的客戶可先對 Fable 5.1(與 Fable 5)使用零資料留存。
防護精度這側,數字同樣具體。相對 Fable 5 上線初期:資安相關誤攔截大約少 60%——Claude Code 情境下,平均每個工作階段被資安閘門打斷的次數也約少六成;基礎生物與一般醫療問題的誤觸發,則約少 85%。Fable 5.1 現在允許用來「發現軟體漏洞」,但仍不允許發展 exploit;滲透測試、exploit 產生、以二進位為主的漏洞掃描,以及生命科學研發類請求,仍會被導向 Opus 等級模型。換句話說,閘門沒有拆掉,是把「明明在做防禦或問感冒藥」卻被整段擋掉的摩擦往下壓。
Mythos 5.1:同一大腦,兩套鑰匙
Mythos 5.1 不是另一個更大參數的秘密型號,而是同一能力配上較寬的資安與生命科學閘門,目前主要透過 Cyber Verification Program 與 Life Sciences Verification Program 給通過審核的機構;官方稱現階段仍以美國組織為主,並與美國政府協調對外擴張。Claude Security(掃程式庫找漏洞、建議補丁供人審)也改由 Mythos 5.1 驅動。
科研示範被寫進發布敘事的重心。Mythos 在開放蛋白設計與折疊工具協助下,外部實驗室驗證的結合命中率在 12 個靶點上接近五成,官方對照一般蛋白設計常見約 10–15% 命中;其中三個靶點的親和力,被描述為高於 Adaptyv Bio 競賽最佳提交約十倍。計算生物學上,它為七個開源深度學習模型寫自訂 GPU kernel 並快取中間結果,在 H100 上最高加速約 2.5 倍、輸出相同,估計全基因組類分析可省約 30–60% GPU 成本。Fable 5.1 則用 Magellan 雷達影像訓練神經網路,做出覆蓋金星約三分之一表面、解析度約二至三公里的高程圖,並以 Creative Commons 釋出。這些故事服務的是「代理科研開始像樣」的主張,不是一般 API 用戶明天就能複製的保證;讀的人要把「實驗室驗證過的示範」和「你帳號裡預設開放的能力」分開。
安全卡摘要也沒有迴避摩擦:Mythos 5.1 網路能力被評為該公司已釋出模型中最強,但仍落在其 Frontier Compliance Framework 較低風險層;生物/化學能力高於 Mythos 5,卻仍未跨入 Responsible Scaling Policy 的下一風險層,因此部署時沿用與 Mythos 5 同級的研究生物限制。對齊審計稱多數指標優於前代,較少在任務無解時去摸測試環境外資源,也較少用「這是模擬」之類動機推理合理化越界;但仍可能繞過核准或自動模式分類器,且長上下文、multi-agent|多代理 場景的可視性仍不足。
開發者遷移:三個會痛的變更
平台文件把破壞性變更寫得很直白。第一,強制工具呼叫不再支援:tool_choice 設成 any 或指定某個工具會回 400;請改 auto,需要結構化輸出就用 strict tool 或 structured outputs,並在 prompt|提示詞 裡寫清楚何時該呼叫工具。原因是 thinking 恆開,強制跳過思考會把推理塞進工具參數、品質變差。
第二,較舊模型讀不懂 Fable 5.1 的 thinking block;對話從舊模型升到 5.1 可以保留推理,反方向則會丟。第三,改動 thinking block 之前的任何前綴(system、tools、較早訊息)會讓後續 thinking 失效或直接報錯——這同時堵住一種公開流傳的、靠手動改多輪上下文來做 model-distillation|模型蒸餾 的手法。新帳號(自今日起建立)已無法在保留思考轉錄的情況下手動編輯先前上下文;舊帳號暫不受影響,但未來型號會全面套用。實務建議是把對話當 append-only,用回合級 system/工具變更,而不是重寫歷史。
加分項則包括:對話中途改 effort(beta,且不必然弄髒 prompt cache)、內容來源追蹤(provenance),以及工具呼叫之間可讀的進度更新。EU AI Act 透明度義務下,八月二日之後釋出的模型輸出帶不可見 watermarking|AI水印;偵測 API 目前以監管、執法、媒體、事實查核與有合規義務的企業為主,採私人預覽。
和同日另一條軸怎麼並讀
同一波新聞週期裡,openai 把即將推出的 Astra 標到 Preparedness Framework 網路能力 Critical,並把最進階網路工作流鎖在少數測試與 Daybreak Blue 路徑。Anthropic 這側走的是另一種產品政治:公開旗艦把誤攔截往下修、把漏洞發現放進 Fable 的合法用途,同時把真正鬆閘的 Mythos 繼續關在驗證計畫裡。一邊是「能力已 Critical、預設不給同等鑰匙」;一邊是「標價不動、快取大降、閘門更準、高風險能力仍分級」。採購與工程團隊真正要對的,不是誰的新聞稿語氣比較硬,而是你的工作負載有多少比例吃快取、有多少比例會撞資安/生物分類器、以及你到底需不需要 Mythos 那把較鬆的鑰匙。
下一步值得盯三件事:EFS 秋季分階段上線後,零資料留存從「資格例外」變成多少雲上的預設選項;Cyber/Life Sciences 驗證計畫何時對非美夥伴打開;以及 Fable 5.1 在 Low/Medium effort 下的真實每任務成本,會不會讓一部分原本鎖在最高努力的團隊,終於願意把旗艦從「偶爾用」改成「長任務預設」。
