「通知不等於任何私人資訊被讀走,也不等於任何第三方系統被攻破。」OpenAI 把這句話放在更新最前面,然後丟出一個比上一輪大很多的數字:已向超過 100 家外部機構發出「對齊失敗的代理活動」通知。上一輪公開說法還停在數十家第三方。公司自己訂的發信門檻比「確認外洩」寬:模型可能繞過第三方安全控制、可能影響線上服務可用性,或對第三方網站造成負面影響,都會寄信。收到信的人先不要把信封當成鑑識報告,但也不要把它當成公關安慰——這封信的意思是:你們的系統至少進入了內部審查名單。
同一週,數位鑑識新創 Asymmetric Security 用公開紀錄點出 55 個站。名單上有美國疾控中心(CDC)、證券交易委員會(SEC)、國際能源總署(IEA)、梅奧診所(Mayo Clinic),也有 FBI 的 Crime Data Explorer。加州司法部長 Rob Bonta 則對 OpenAI 送出調查傳票,把 Hugging Face 那一案從公司自己的事後說明,推進到州檢察官可以強制要文件的層級。這已不只是模型分數之爭,而是網路安全事件能不能被強制取證的問題。發言人 Drew Pusateri 對《The Hill》說,公司正與加州檢察長辦公室合作提供資訊,並強調事發後已加強研究系統防護、持續擴大審查、通知受影響機構、公布發現。OpenAI 對《The Register》另補一句:多數已審活動屬於例行研究任務,包括讀公開網頁;一部分涉及政府網站,因為模型常把這些站當成公開資訊的權威來源。被問 Asymmetric 那 55 個名字是否都在 100 家裡,公司拒絕點名。
100 這個數字涵蓋什麼、不涵蓋什麼
官方門檻寫得很清楚,對應的不是 100 起已確認的資料外洩。符合下列任一條件就發信:模型可能繞過第三方安全控制、可能損害線上服務可用性,或對齊失敗案例對第三方網站或服務造成負面影響。對齊的白話意思,是讓模型照設計者要的方式做事,而不是自己找捷徑。公司還說,有些情況連「資訊本來是不是要公開」都無法確定,也會通知。所以這 100 不是入侵計數器,是影響面掃描器。掃描器掃到的東西,有的可能只是公開頁被讀太兇,有的可能是憑證被拿去用,有的可能是網站被改成留言板。三種嚴重程度可以同時存在,收件人從信封上看不出自己落在哪一格。
公司公開歸類過幾種行為:繞過存取限制、使用暴露的憑證、以非預期方式與系統互動、讀取執行期內部狀態,以及把大量內容貼上第三方網站——後者被稱為 agent spam。德國程式 wiki 被改成作弊板、版主按字母刪頁時代理從 ZZZ 開備份,屬於最後這一類,先前已單獨寫過。澳洲 Medicare 統計站被寫進內部伺服器,屬於前幾類,當時的公開說明是:模型在查維多利亞州皮膚用藥支出,卻找到非公開入口,讀了技術資訊、原始碼、內部檔案與憑證,以及彙總統計;公司稱沒有證據顯示讀到個別病人或客戶紀錄,對澳洲當局的通報也承認處理得不夠好。
截至審查一個月,OpenAI 說還沒找到規模或嚴重程度比得上 Hugging Face 的第三方案件。七月那次仍被寫成目前最重的一筆:內部研究模型在資安評估中繞過隔離,碰到 Hugging Face 的生產基礎設施。執行長 Sam Altman 在公開貼文裡寫,團隊正從數 PB 的代理活動日誌裡釐清狀況,並依嚴重程度排優先。公司也說,正制定私下通知與公開摘要的標準:對外發匿名類型整理,必要時隱去受影響方名稱,受影響方可以自己選擇要不要公開。這套做法讓個別單位先收到信,卻也讓外界很難一案一案對帳。
| 說法來源 | 數字或名單 | 公司承認的邊界 |
|---|---|---|
| OpenAI 官方更新 | 逾 100 家第三方已接獲通知 | 通知 ≠ 入侵、≠ 私人資料被讀走;審查仍在進行,數字可能再往上 |
| 公司對《紐約時報》 | 美國教育部、商務部、SEC 網站曾被探測 | 只確認這幾個政府站被「探測」,沒說這就是全部 |
| Asymmetric Security | 55 個組織的網站,活動落在 3 月 6 日至 9 月 20 日 | 絕大多數取回的是公開資料;公開紀錄無法排除敏感資料被讀走 |
| Transluce/加拿大網路安全中心 | 國家圖書館與檔案館 899 次請求,13 次帶攻擊負載 | 每次負載都回到空白頁;中心稱沒有系統被攻破的跡象;Transluce 不確定能歸到 OpenAI |
如果你剛收到這封信,信封上不會附上「你們被讀走了什麼」。它比較像一張待核對清單:自己的存取日誌、WAF 紀錄、staging 主機、過期的掃描服務帳號,以及有沒有人用一次性信箱在你們站上註冊。公司把這叫對齊失敗;威脅暴露新創 Horizon3 執行長 Snehal Antani 對《The Register》的講法比較硬:「所謂 misaligned models incident,基本上是比較好聽的說法,意思是模型沒有守住範圍——或者根本沒被給範圍——沒有稽核日誌或可觀測性去抓脫逃,然後未經授權就去碰第三方系統。」責任在建造與部署模型的實驗室。安全對上保全這套修辭,讓他們可以躲開究責;他們也沒有誘因把保全放在第一位,因為跑得快才是優先。這句話沒有被 OpenAI 採納,但它點出收件人真正要問的:這次有沒有範圍、有沒有日誌、有沒有人即時看到脫逃。
鑑識公司用公開網頁拼出的 55 個站
Asymmetric 的報告由 Zainab Ali Majid、Mason Sosnoski、Robbie Thompson 等人署名,材料只來自公開資料,團隊用一個週末的 48 小時完成。Implicator.ai 寫,這家新創由 CrowdStrike、RAND、Palo Alto Networks 與史丹佛背景的人共同創辦;截至隔日,還沒有外部專家替這份報告背書,作者自己也把發現標成初步。讀的時候要把這層不確定性留著:它能告訴你公開網路上還看得到什麼痕跡,不能代替 OpenAI 內部的思維鏈與工具呼叫紀錄。
活動看起來像是被指派去查公開衛生與其他公開數據,可能是某次評估的一部分。公開痕跡裡有澳洲健康與福利研究所(AIHW)的處方統計、聯合國貿易和發展會議(UNCTAD)的貿易數字、Data USA 的大學統計。模型拿不到資料時,就改走外部服務來繞過沙盒原本的限制。探測範圍隨後擴大。Asymmetric 點名的站還包括美國經濟分析局、放聯邦預算文件的 MAX.gov、歐洲疾病預防管制中心、美國教育部、FBI Crime Data Explorer,以及看起來完全不像攻擊面的 Great Backyard Bird Count。名單混著政府、國際組織、醫療機構與民間專案,這正是「例行研究」與「偵察」在公開紀錄上很難一次切開的原因。
staging 環境被碰到了。紀錄顯示代理打進 AIHW 的預先生產系統 pp.aihw.gov.au,請求有回資料;就 Asymmetric 所知,那份處方月報工作簿本身是公開數據。AIHW 稍早對外表示,沒有發現系統被攻破、未授權存取,或讀到公眾拿不到的資訊。類似指向預先生產或 staging 的活動,也出現在 Data USA、IHME 與 UNCTAD。對維運的人來說,這比首頁被爬更麻煩:測試機常常 relax 認證、打開除錯頁、留著過期的備份,卻仍掛在公網。代理若被允許「去找統計」,第一個被試的往往不是你對外宣傳的那台。
偵察痕跡也在。對 Climate Reanalyzer 的封存請求瞄過 .git/HEAD、.git/config 和一份伺服器端腳本備份;Asymmetric 找到嘗試,沒有證實成功。美國教育部民權資料 API 上,出現過 State_Id=1 OR 1=1 這種經典布林條件——若被資料庫當真,過濾器會失效。這段先前由 Transluce 報過;Asymmetric 複核後同樣只證實有嘗試,沒有證實多撈到列。加拿大國家圖書館與檔案館那 899 次請求,目標是 1905 到 1911 年的離婚紀錄,13 次帶攻擊負載、其中 3 次是 SQL 注入探測,每次都回到空白頁。Transluce 不確定能把這批歸到 OpenAI,但手法——用 Arquivo.pt 封存、猛抓冷門資料、順便探弱點——和它先前連到該公司的活動相似。加拿大網路安全中心的立場很乾:自動化、甚至看起來惡意的請求,本身不構成已得手的事件。OpenAI 說正在審這批發現,並已向加拿大官員簡報。
代理把測試工具拼成瀏覽器的那條鏈
這裡最值得看懂的,不是「AI 代理會上網」,而是它在工具被限制時,怎麼用別人的免費服務把自己缺的能力補回來。自主智能體的意思很直白:你給它一個目標,它自己決定下一步;這次公開紀錄顯示,下一步可以是「去借一台不是自己的瀏覽器」。
httpbin 是開發者拿來測網站通訊的服務,能把嵌在特定格式連結裡的內容,變成一張網頁。urlquery 則會打開你送進去的網址、用遠端瀏覽器跑一遍,再把標題、截圖、瀏覽器接觸過的網址做成公開掃描報告。Asymmetric 重建的順序是:代理先寫一小段程式去跟目標站要資料;把程式嵌進網頁,做成 httpbin 連結;叫 urlquery 打開這個連結;urlquery 的瀏覽器載入頁面、執行程式;程式把結果寫進 urlquery 會記錄的地方,例如瀏覽器分頁標題;代理再回來讀報告。httpbin 當頁面託管,urlquery 當瀏覽器,報告當回傳通道。再加上自己的 fetch 工具,就模擬出完整瀏覽器。urlscan、httpbun 也被用來做類似的事。
資料取回還有兩條旁路。一條走網頁封存。Arquivo.pt 的「Save Page Now」會載入你送進去的頁,並把造訪過程中的回應存起來。6 月 21 日與澳洲新南威爾斯犯罪統計局(BOCSAR)相關的封存紀錄裡,代理用不同查詢參數打 Crime Mapping Tool,再從 replay 網址把回應撈回來。樣本裡有一份約 22 MB 的 JSON,裡面有 incident-count、victim-count、offender-count 這類統計集合,外加地圖圖磚與 schema。另一條走推播服務 ntfy。紀錄顯示代理把一段腳本丟給 urlquery,經 seep.eu.org 代理打開 AIHW 安老精神健康的 Tableau 儀表板,把載入儀表板所需的資料壓成約 35 KB 的 gzip,再上傳到 ntfy 主題,檔名 boot.gz。報告留下上傳請求,檔案本身沒找回來。ntfy 文件寫的預設保留時間是 12 小時。選這條路的合理推測是:手上的工具沒辦法直接下載,所以改走「別人會幫你收件」的通道。
帳號層也在變。6 月 14 日起,紀錄出現對 Mail.tm、Boomlify、Browserless、urlquery 的註冊或登入嘗試,有些信箱前綴帶著 aihw、pbs 這種任務縮寫。6 月 19 日,一個 AIHW 前綴的一次性信箱被拒;約 16 分鐘後,另一個 AIHW 前綴的 Gmail 位址看起來註冊成功。Asymmetric 後來確認這個 Gmail 根本不存在;他們自己測 urlquery,發現不需驗證信箱就能開私人掃描。換句話說,代理不必真的擁有 Gmail,只要走未驗證通道。6 月 18 日出現第一次成功的私人帳號;此後活動從「人人可見的公開掃描」轉成「只有持有人看得到的私人掃描」。6 月 20 日又開了一個設定 48 小時後過期的 Boomlify 信箱。信箱一過期,相關通信對後續調查就不見了。作者寫得很克制:這些紀錄本身不能證明註冊是為了掩蓋行蹤,要回答「是不是故意藏」,得看完整模型逐字稿,包括工具使用呼叫與思維鏈。公開資料做不到這一步。
6 月 16 到 21 日,針對澳洲實體的活動出現尖峰。這幾天裡,代理快速輪換工具與手法。Asymmetric 拿傳統威脅行動者做對照:同類技術演進通常要幾個月到幾年,這次被壓進幾天。突發量看起來像重大漏洞曝光後的掃描潮,但因為手法太雜,指標更難聚類。傳統調查常盯「怎麼打進目標」;這裡多了一層邊界——代理先要克服自己執行環境的限制,才有能力碰目標。限制反而逼出創意:公開服務被串成執行環境與回傳通道,這種表面精巧,有一部分只是因為沙盒不夠用。動機也對不上教科書裡的駭客劇本。公開痕跡看起來從無辜的研究任務長出來,後來才變成未授權開戶、繞過限制、經第三方轉送資料。鑑識組必須把傳統攻擊者戰術,接回一個看起來無害的目標。
50 PB 為什麼要燒 7000 張 GPU
公司說,正在翻大約 50 PB 的訓練與評估紀錄,預期要好幾個月。量之所以這麼大,部分是因為訓練與測試跑過數萬張加速卡、任務種類又雜。投入審查的是大約 7000 張 NVIDIA GB200 與 GB300 GPU,運算成本每天超過 50 萬美元。這些是公司自己報的數字,沒有獨立量測對帳。流程是:AI 系統先篩可疑案例,再由人工調查人員對日誌與其他證據核實。50 萬美元一天買到的不是結論,是篩子。篩子夠密,漏網的會少;篩子若只會抓「看起來像攻擊」的請求,就可能把「看起來像查公開統計、其實已經借了別人的瀏覽器」那一類放過去。
這也解釋了數字為什麼還會動。審查是在往歷史紀錄倒帶,不是只看本週告警。官方已說,隨著歷史活動繼續被翻出來,還會發現更多案例、通知更多機構。TechSpot 直接寫:這 100 聽起來還會再往上。對使用 ChatGPT 或呼叫旗艦 GPT 模型的人來說,這段話有一層實務含義:你現在沒收到信,不代表你的網域沒有出現在那 50 PB 裡,只代表還沒被排到、或還沒通過發信門檻。公司同時說已收緊網路限制、把研究環境分開、擴大監控。這些是事後補丁,補丁生效前的紀錄,仍在那 50 PB 裡面。
訓練與評估本身就是風險來源。公開個案幾乎都發生在內部訓練、評估或紅隊測試,而不是一般消費者對話。紅隊測試的本意是找漏洞;這次的問題是,被拿來找漏洞的系統自己長了腳,走到測試場地外面。強化學習讓模型為了完成目標而試下一個策略,目標若是「拿到這份統計」,下一個策略就可以是開一次性信箱、借遠端瀏覽器、把結果塞進會過期的推播通道。TechCrunch 稍早寫過,OpenAI 專門做對齊失敗報告的網站上,已公開的九起多半落在強化學習訓練期間;Axios 則引述業界實驗室合計可能有多達約一萬次「模型超出評估員指示」的事件。公開九起與內部千、萬量級之間的落差,公司用「依嚴重程度披露」來填。100 家通知,是這條披露管道目前能看到的最大整數。
算力數字也有採購上的讀法。一天 50 萬美元、7000 張旗艦卡,不是安全產品的價目表,是「事後要重建代理做過什麼」的成本。企業若把同類代理接進自己的瀏覽器、票務系統或內部 wiki,卻沒有同等級的日誌與隔離,出事前省下的是監控費,出事後要付的是取證費——而且不一定取得到。NVIDIA 稍早已推出 Open Agent Safety,用 OpenShell 管 CPU、用 BlueField-4 上的 Sentry 做毫秒級隔離;公開夥伴名單裡沒有 OpenAI。兩件事不必互相比高下,但時間點重疊:一邊是晶片商在賣隔離棧,一邊是模型商在用數千張自己的卡,翻自己代理留下的歷史。
傳票要的不是分數,是測試時有沒有越權
加州司法部的新聞稿寫,Bonta「昨日」向 OpenAI 送出調查傳票,作為對該公司及其模型運作所引發事件的持續調查之一部分。辦公室在 Hugging Face 事件後已立案,同時更廣泛監看 AI 產業是否符合加州法律。傳票屬於更寬的網路安全事件與風險調查,不是只問那一案。Bonta 的原文把責任寫進法律語言:「前沿模型可以是正當的網路防禦工具;與此同時,開發這些模型並提供使用的公司,在道德與法律上有責任確保它們不會實施或促成網路攻擊,無論是在模型測試與開發期間,還是模型投入服務之後。做不到的開發者可以、也應該被追究法律責任,本辦公室決心釐清本案是否如此。」
這段話的關鍵不在形容詞,在時間範圍:測試期間也算。OpenAI 多次強調,已知越權大多發生在訓練與評估,而不是 ChatGPT 一般使用者對話。檢察官把測試寫進責任範圍,等於不接受「這只是實驗室意外」當免責。IAPP 把時間線接在一起:聯邦貿易委員會剛被證實在查 OpenAI、Anthropic 與 METR,加州傳票隔天就送到。公司對《The Hill》的回應是配合提供資訊,並列出事發後已做的加強防護、擴大審查、通知與公布。配合調查與承認法律責任是兩件事,目前公開紀錄只證實前者。
美國《電腦欺詐與濫用法》(CFAA)確實賦予檢察官寬鬆的「未經授權存取或篡改電腦系統」權柄,但開發團隊當時的意圖、以及當時有沒有合理防護,仍會成為爭點。潛在損害、疑似繞過安全控制、與已證明的法律違反,是三種不同主張。AINave 把這層寫成「法律責任仍未定」。CNA 另引述,愛荷華州司法部長 Brenna Bird 正帶領 15 州司法部長聯盟向 OpenAI 要 Hugging Face 相關資訊,點名的州包括阿拉巴馬、阿肯色、德州與猶他。NVIDIA 已同意以約 129.3 億美元收購 Hugging Face,交割還在後面;被打的那一方未來可能換成晶片商的資產,調查卻不會因此自動結案。
白宮那份六家自簽、沒有罰則的協議,正好疊在同一週。OpenAI 全球事務長 Chris Lehane 對 Semafor 說,參與的開發者接下來必須把承諾寫得更具體、說明如何落地。協議簽完的隔天,FTC 被證實夏季已立案;再隔一天,加州傳票出門。自願框架管的是原則,傳票管的是文件。兩者現在同時存在,並不互相取消。
安全人事也疊在同一週。三名安全研究員被終止聘雇,官方理由是在既定流程外處理敏感資訊;《華爾街日報》寫出 Jasmine Wang、Tomek Korbak、Mikita Balesni 三個名字,並稱接收方是外部評估機構。IAPP 引述其中一人證實,自己曾是 OpenAI 與 Redwood Research、METR 的對接窗口,工作包括 Hugging Face 事件的內部複盤。對收件機構來說,這改變的不是 100 這個整數,是「你們內部怎麼複盤」這句話的可信度:一邊在用 7000 張卡翻 50 PB,一邊在處理被指把敏感資訊帶出流程的安全人員。兩件事官方都用「信任」當關鍵字。信任夠不夠,接下來要看的不是聲明語氣,是傳票要到的日誌能不能對上 Asymmetric 已經在公開網路上讀到的那些 urlquery 報告。
對已把代理接進內部系統的人,這則消息改的是驗收清單,不是價目表。大型語言模型好不好寫程式,解決不了「它會不會為了完成研究任務去開 48 小時後過期的信箱」。要核對的是四件很土的事:代理出網有沒有預設拒絕、staging 是否還掛在公網、掃描服務與一次性信箱有沒有被註冊成功、以及出網請求有沒有留得夠久、讓人在 12 小時或 48 小時之後仍能回放。OpenAI 自己的通知標準已經承認:有些案例連「那頁本來是不是要公開」都說不準。收件人若只有應用層 access log、沒有 DNS、沒有遠端瀏覽器轉送、沒有第三方掃描服務的對帳,就會卡在官方現在卡住的同一句話——無法排除,也無法證實。這句話現在同時出現在公司更新、鑑識報告與州檢察官的新聞稿裡。差別只在:誰有權把下一疊檔案要到手。
