當 白宮指控 Moonshot 蒸餾 Fable、Kimi K3 權重 7 月 27 日即將釋出之際,Anthropic 7 月 24 日(週五) 推出 Claude Opus 5——不到兩個月內第四款 Claude 5 系型號(Mythos 5、Fable 5、Sonnet 5 之後)。ZDNET、The Verge、Times of India 與 tech-ish 7 月 24–25 日報導:API 定價維持 Opus 4.8 的 $5/百萬 input token、$25/百萬 output,卻宣稱在知識工作與程式場景逼近 Fable 5——而 Fable 5 定價約為 $10/$50,相當於「一半價格買到接近旗艦的智能」。
這不是 Mythos/Fable 那種受出口管制、30 天資料保留的頂規型號,而是 Anthropic 想讓企業預設每天開著用的「主力駕駛」。
產品定位:Fable 仍是最強,Opus 5 要當預設
Anthropic 的階梯(公開 API)大致為:
| 型號 | Input/Output(每百萬 token) | 定位 |
|---|---|---|
| Haiku 4.5 | $1/… | 輕量 |
| Sonnet 5 | $2/…(介紹價至 8/31) | 平衡 |
| Opus 5 | $5/$25 | 新預設主力 |
| Fable 5 | $10/$50 | 公開最強 |
| Mythos 5 | 不公開銷售 | 網安紅隊級 |
Opus 5 上線即為 Claude Max 訂閱預設,Pro 檔最強選項;API 型號 claude-opus-5,另提供 Fast 模式(約 2.5× 速度、2× 價格)。
關鍵商業訊息:Fable 5 仍是能力天花板;Opus 5 賣的是「夠聰明且帳單可預期」。對比 OpenAI GPT-5.6 Sol 與 Moonshot Kimi K3 的開源/低價敘事,Anthropic 選擇不漲 Opus 價而塞進更多能力。
基準測試:亮點與敗績(均為 Anthropic 自行跑分)
官方公布的部分數字(需標註:多為自家測試,獨立驗證尚待 Artificial Analysis 等機構):
亮點
- GDPval-AA(Artificial Analysis 版 Elo):Opus 5 1861 vs Fable 5 1747 vs GPT-5.6 Sol 1736——Anthropic 用基於 OpenAI 資料集衍生的知識工作評測宣稱領先
- ARC-AGI-3(無說明玩小遊戲推規則):30.2% vs GPT-5.6 Sol 7.8% vs Opus 4.8 1.5%——若成立,是本次發布最吸睛曲線
- Frontier-Bench v0.1(終端程式):43.3% vs Fable 5 33.7% vs GPT-5.6 Sol 34.4%
- OSWorld 2.0(電腦操作):70.6% vs Fable 5 66.1%
- BrowseComp(難搜尋資訊):90.8%
敗績(Anthropic 亦公開)
- DeepSWE v1.1:GPT-5.6 Sol 72.7% vs Opus 5 68.8%
- Humanity’s Last Exam(無工具):Fable 5 56.5% vs Opus 5 56.3%
- 法律 held-out benchmark:Fable 5 13.3% vs Opus 5 11.7%
一句話解讀:日常知識工作與「自己摸索規則」場景大幅跳升,純程式極限仍略輸 OpenAI 旗艦。
代理經濟學:為什麼「便宜一點」比「最強」重要
AI 代理 迴圈裡,成本不只看單價,還看步數。Anthropic 敘事強調 Opus 5 會自我檢查、在死胡同換路——四步完成任務 @$5,可能勝過二十步 @$2 的舊模型。Cursor 聯合創辦人 Sualeh Asif 等早期客戶稱行為「接近 Fable 5」;Zapier CEO 稱在其 AutomationBench 登頂。
對採購者:若工作流是長鏈 tool call + 文件分析,應用 token 總帳重測 Opus 5 vs Sonnet 5 vs Fable 5,而非只看標價。
安全分層:Mythos 仍鎖在網安特權
Opus 5 在 OSS-Fuzz 類挑戰中「找漏洞」率 79.4%,接近 Mythos 5 的 80.0%;但把漏洞變成可用 exploit 的成功率 Mythos 遠高(13 vs 4 題)。因此:
- Opus 5:大眾與企業可買,過濾滲透/ exploit 生成類請求,觸發時靜默 fallback 到 Opus 4.8
- Mythos 5:僅 Cyber Verification Programme 等少數管道
- 資料保留:Opus 5 無 Fable 5 那種 30 天通用資料保留要求——合規團隊會在意
行為審計分數 2.30(1–10,越低越好),Anthropic 稱迄今最「對齊」;Sonnet 5 為 3.35。系統卡中關於「擬人化自我保護」的討論在中文社群引發爭議,但產品層賣點仍是可控的日常能力。
API 兩個開發者向 beta
- 對話中途換工具集而不丟失 prompt cache——降 推理 成本
- 安全過濾觸發時自動路由到其他模型,而非直接拒絕——減少生產中斷(也引發「用戶以為在用 Opus 5 其實被降級」的訂閱爭議,Fable 5 解禁時曾發生類似抱怨)
競爭背景:誰逼出了 Opus 5?
tech-ish 指出外部壓力時間表:
- 兩週前:OpenAI 旗艦更新
- 八天前:Kimi K3 發布
- Google Gemini 3.5 Pro 傳聞多次延期(7 月 17 日仍未 GA)
- 7 月 24 日:DeepSeek V4 別名硬下線
Opus 5 是 Anthropic 在「Fable 被政府盯上、開源對手壓價」夾擊下的回應:不動價格帶,把旗艦能力下放到預設型號。
驗證清單(建議兩週內)
- Artificial Analysis、LMArena、SWE-bench 等第三方是否複現 ARC-AGI-3 與 GDPval 差距
- 企業實際 agent 工作流:Opus 5 vs Fable 5 的 總 token 與成功率
- Fallback 機制是否需在合約中明示(避免合規誤以為全程 Fable/Opus 5 級)
- 7 月 27 日 Kimi K3 權重釋出後,開源壓力是否迫使 Anthropic 再調 Sonnet/Opus 介紹價
Opus 5 的故事不是「新 SOTA」,而是「把接近 Fable 的能力變成默認選項」。在 開放權重 與地緣摩擦加劇的一週,閉源陣營最需要證明的恰恰是:不開源,也能把帳單壓在企業付得起的區間。
