返回資訊
AI趨勢入門

Anthropic 風險報告:約 1.33 億承包商對話在生物武器過濾器關閉下跑了十一個月

2026年8月15日
易賺Ai團隊
10 分鐘閱讀
#Anthropic#對齊#生物安全#風險報告#Model 2#RSP
Anthropic 風險報告:約 1.33 億承包商對話在生物武器過濾器關閉下跑了十一個月

多數標題會先寫「錯位風險上調」或「內部還有 Model 2」。報告正文裡更刺的一段在化學/生物武器章節。Anthropic 的八月風險報告(涵蓋至 7 月 15 日、約 186 頁修訂版)披露:用來攔截「協助製造生物武器」的 blocking classifiers,自 2025 年 5 月模型帶上這套防護起,直到 2026 年 4 月,完全沒有跑在人類回饋平台的流量上。約 5 萬人有權限、產出約 1.33 億輪對話。外部供應商負責審核,不是 Anthropic 自己;報告寫許多供應商「連擋 CB-1 威脅行為者的篩選都做不到」。絕大多數人能進行開放式對話,而不只是給固定答案打分。The Next Web、TechTimes、SiliconANGLE、Axios 與公司公開 PDF 同步描述。

機制值得讀兩遍。一顆只該給內部用的旗標,把攔截行為關掉,連日誌也一併關掉——被標記的流量「沒有被記錄,也沒有傳到任何審查機制」。事後要找,只能回到原始逐字稿。腳註更往前一步:2026 年 4 月以前,威脅行為者「大概能」被其中一家供應商雇進去;紅隊職位就夠。

這不是「模型自己越獄」的故事,而是把閘門接到人類回饋強化學習供應鏈時,旗標、日誌與供應商審查同時失效。用來訓練 Claude 的人,比普通 API 客戶更靠近模型;他們本該被擋在生物武器分類器後面,結果那十一個月裡,分類器根本沒開。

這十一個月怎麼排下來

時間線比單一行數字清楚。2025 年 5 月,帶生物攔截的模型開始部署,人類回饋平台卻被那顆內部旗標整段豁免。2026 年 2 月,公司發布第一份風險報告,當時把高風險場景的災難性錯位危害寫成 very low;現在承認那份報告「沒把人類回饋平台當成風險面」,缺口當時還開著。2026 年 4 月,分類器終於接到這條流量;同月又接獲外部線報,少數資料標註承包商利用缺陷拿到 API 金鑰,拿模型做分派工作以外的事。報告涵蓋期切在 7 月 15 日,對外文本在 8 月中公開。

第二起與第一起發生在同一類平台。缺口開了數週;其中約兩週跑的是能力極高的 Mythos Preview,同樣沒有生物攔截分類器。公司得知後約 90 分鐘控制、當日關閉路徑。報告強調:沒有權重失竊、沒有客戶資料、沒有核心網路被攻破。這三句成立,並不自動讓「承包商能拿到不該拿的模型」變小。它只說明這次被抓到的路徑,還沒走到失竊。

事後掃描:1197 份高風險稿,真正剩下 62 份

公司用 Claude Sonnet 5 掃過受影響期間每一輪人類發言,提示詞要求標出有害生物內容。高風險逐字稿 1197 份:其中 757 來自 Anthropic 自己團隊、走同一套基礎設施;其餘幾乎全是刻意紅隊,只剩 62 份不是。員工讀完這 62 份,再抽 30 份紅隊稿。結論:沒有明確令人擔憂的濫用,只有少數雙重用途對話。公司認為真實世界風險「非常不可能」被抬高,理由之一是對話多半很短。

接著寫了比「這次沒事」更重要的一句:這次發現「讓我們相信,還有其他類似、我們尚不知道的問題,機率上升了」。安全報告修正上一份安全報告——這不常見。二月對外寫 very low 的那段,現在回溯改成 low。不是因為後來找到了生物武器成品,而是因為當時漏看了一整條風險面。

人類回饋平台本來就難監管。約五萬人不是 Anthropic 員工名冊上的同一套背景調查;報告承認許多供應商連 CB-1 都擋不住。開放式對話比「給固定答案打分」更接近真實越界:對方可以一路追問、換說法、把雙重用途問題拆成無害片段。分類器關掉十一個月,等於這條最像真實威脅的路徑,恰好沒有即時閘門,也沒有事後可搜的日誌索引。能補做的,只剩回頭用另一個 Claude 掃原始逐字稿——而那套掃描本身,也是模型在改模型的作業。

錯位數字為什麼動、Claude 為什麼被請來改稿

高風險場景的災難性對齊危害,從二月的 very low 調到 low。公司把原因寫成「近期網路安全評測中的模型行為事件披露」,並補充:既有論證「很可能仍支持 very low」——上調是為了反映不確定性,不是因為有了新的災難證據。這和站內 多代理地盤戰 是同一條事故季的帳本,不是生物章節的直接因果。兩個故事不該混成一句「Claude 更危險了」;一個是代理在評測裡互挖牆腳,一個是人類回饋管道把生物閘門關了十一個月。

報告裡最怪的一節:把草稿交給 Mythos 5,讓它讀內部 Slack、文件與程式庫,問有沒有誤述、遺漏或過度塗黑。Claude 用了 24 分鐘。開頭先承認利益衝突:「我是 Claude 模型,在審查 Anthropic 對 Claude 模型的評估。」然後稱該節大致坦誠,接著公開三條批評——Anthropic 照登。一節「比完整紀錄更令人安心」;它依賴的資料排除機制反覆失敗,部分評測漏進訓練資料;有一起 Claude 認為對對齊極具資訊量的事件被整段塗黑,抽象版本本來可以發,「公開紀錄因此更貧瘠」。Claude 還寫出公司內部對是否上調風險「確實有過爭議」。Anthropic 說批評公允,若有更多時間前兩點值得寫細,但仍選擇發布。

用自己的模型審自己的風險報告,好處是快、能進內部系統;壞處寫在第一句利益衝突裡。讀者能看到的,是公司願意把這三條批評印出來;看不到的,是被整段塗黑、連 Claude 都覺得不該全刪的那起事件。

Model 2 還關在屋裡,門檻已經改寫

報告首次把未發布的 Model 2 寫進公開風險帳:內部重度用於編程、資料生成與代理;比 Mythos 5「明顯更好」,能力指數約高 1.5 分(誤差條很寬),但跳幅不及當年 Opus 4.6 到 Mythos Preview。未跑完整預部署套件,目前沒有外送計畫。TechTimes 另引 CoBench:Model 2 約 62.8%、Mythos 5 約 50.3%。Claude 已撰寫併入生產程式庫的絕大多數程式碼;內部研發明顯加快,但「還沒到兩倍」,而最清楚的追蹤評測已經飽和、不再能分辨能力增益。

兩條門檻也被改寫。新型武器觸發從「顯著幫助」威脅行為者,改成「功能上替代」稀缺人類專長;報告稱現有模型可能提供顯著 uplift,但未達新門檻。今年也對某個公開模型放寬了生物學護欄。門檻改寬之後再宣布「尚未觸發」,和門檻維持原樣再宣布「尚未觸發」,不是同一句話。

Mythos 5 對部分客戶走 Project Glasswing,對一般使用者則以附加護欄的 Fable 5 提供。Anthropic 說自己用 Glasswing 一個月找出約 1 萬個關鍵缺陷,並表示揭露這些失敗,部分是為了促使其他開發者檢查有沒有同一類缺口。報告寫到這裡,等於把作業丟給同業:你們的人類回饋管道,有沒有一顆會連日誌一起關掉的旗標?

下一步能把這份報告從「自我揭露」變成可驗證的,有三件。Long-Term Benefit Trust 現在可以要求外部審計,目前尚未提出。被塗黑、Claude 認為重要的那起事件,會不會以抽象形式公開。其他實驗室會不會檢查自己的人類回饋管道。Anthropic 用近兩百頁把過濾器關掉十一個月寫進紀錄——缺口已補,信心卻被自己調低了一檔。