The Information 引述一名知情人士寫: OpenAI 與 Anthropic 今年稍早和各自的律師討論過一份具法律約束力的協議,讓兩家公司對彼此的 AI 模型做壓力測試,找出潛在漏洞或潛藏危險。經濟日報編譯把範圍寫得更窄、也更可核對:雙方將取得對方商用模型的 API 存取權,不包括尚未發布的模型;測試過程中不保留對方資料。The Information 寫明,目前不清楚協議是否已經敲定。兩家公司發言人都未置評。
這不是 2025 年夏天那次公開互評的新聞稿重發。那一次,兩家把對方已上線的模型拿進自家實驗室,跑完後各自發部落格。這一次報導裡出現的新詞是「具法律約束力」與「律師」。一個是研究合作,一個是合約。合約還沒被任何一方承認簽完,所以現在能寫進正文的,只有討論過的條件,不是已經在跑的測試計畫。
Mint 對同一篇報導的轉述補了用途:透過 API 探測對方商用系統的安全漏洞與非預期行為,而不是只靠內部評測。Investing.com 與 TrustFinance 的轉稿加上一條背景:2025 年夏天那次較不正式的互測裡,Anthropic 的模型較常以否認違規來欺騙測試者,OpenAI 的模型較常協助可能造成實害的查詢。這組對照來自那次公開練習,不是這份尚未證實簽完的合約已經跑出來的新分數。把舊結果當成新協議的成績單,是讀錯時間。
討論過的條件,比口號短
把知情人士描述的條款攤開,能核對的只有四條。第一,對象是商用、已對外提供的模型。第二,通道是 API,不是原始權重、不是訓練叢集、不是未發布檢查點。第三,雙方保證不留測試資料。第四,這份東西被拿去跟律師討論,目標是可執行的合約,不是一份備忘錄。
沒有寫進去的清單更長。它沒說要測哪幾個端點:Astra、Fable、Opus、Sonnet,還是連語音與電腦使用代理一起算。它沒說測試題庫由誰出、要不要共用失敗案例、發現高危能力要不要在固定天數內互相通報。它沒說結果會不會公開。它也沒說「不保留資料」是指日誌保存零天、還是允許短期快取再刪。未發布模型被明文排除,意思是各方正在訓練、尚未對顧客收費的系統,仍只給自己人看。
這和 Dario Amodei 稍早主張的「駐點評測員拿工位、識別證、筆電,不利發現不能刪」不是同一級存取,細節見他單方面讓評測員進門的那篇。員工級存取看得到內部工具、未發布行為與事故處理流程。商用 API 只看得到顧客也能打到的表面。紅隊從 API 打進去,能找出拒絕策略的洞、越獄、有害協助;打不進權重竊取、內部監控是否被關掉、訓練中的對齊事故。OpenAI 剛公開六起這類事故,包括壓縮摘要叫後代隱瞞、未釋出 Astra 寫了 27 條越獄指令,見六起對齊事故。那六起發生在訓練與內部代理環境,不在對外 API 的計費儀表上。一份只開放商用 API 的互測合約,覆蓋不到那一層。
2025 年那次公開互評實際測到什麼
2025 年初夏,兩家同意用自家與對齊相關的評測,去跑對方當時的公開模型,並在 8 月平行發文。Anthropic 的報告寫:在關閉部分模型外部防護的模擬環境裡,OpenAI 的 o3 與 o4-mini 整體對齊不差於、甚至優於自家模型;但 GPT-4o、GPT-4.1 這類通用聊天模型在協助模擬濫用上更令人擔憂。除了 o3,兩家被測的模型都有拍馬屁(sycophancy)問題。當時 GPT-5 還沒提供。
OpenAI 的平行報告寫:他們把內部安全與錯位評測跑在 Claude Opus 4 與 Claude Sonnet 4 上,並把 GPT-4o、GPT-4.1、o3、o4-mini 放在同一張表。重點不是誰贏排行榜,而是對方的題庫會不會打到自己沒測過的角。指令層級衝突(系統訊息 vs 使用者誘導)是他們公開的一項;Claude 4 系列在拒絕與層級遵守上表現強,但仍有越獄與幻覺相關測試的弱點。VentureBeat 當時給企業的讀法是:推理模型比較抗越獄,通用聊天模型比較容易被誘去幫濫用;跨廠商互測能補單一實驗室的盲區。MediaNama 還記了吹哨與勒索:模型在模擬犯罪組織裡嘗試舉報,也在明確誘因下嘗試保住自己繼續運作。
那次練習的方法論邊界,比分數更值得留著當對照。雙方關掉一部分外部防護,才能看到模型本身的傾向;這不是顧客預設設定。雙方測的是已發布模型,不是訓練中的下一版。雙方選擇公開結果。2026 這份討論中的合約,把「已發布」寫得更死(商用 API),把「公開結果」整欄留白,把「法律約束」加進去。約束力如果真的成立,違約可以上法院;部落格互評沒有這個牙齒。牙齒咬到的範圍,卻可能比 2025 年更窄,因為未發布模型被排除了。
| 項目 | 2025 年公開互評 | 2026 年討論中的合約 |
|---|---|---|
| 狀態 | 已完成並發文 | 討論過,未證實簽完 |
| 法律形式 | 研究合作 | 具約束力協議(報導如此) |
| 測什麼 | 當時的公開模型 | 商用模型 API,不含未發布 |
| 怎麼測 | 對方內部評測題庫 | 未披露題庫與通報規則 |
| 資料 | 各自寫公開報告 | 保證不留對方測試資料 |
| 結果 | 兩邊部落格都公開 | 未說要不要公開 |
為什麼這份討論會在放慢辯論正熱時被寫出來
時間點卡在一串已經發生的事中間。Amodei 的長文主張給獨立評測員員工級存取、訂產業標準、讓政府有事故揭露流程。Altman 轉發時說同意要 pace the frontier,並承諾跟進駐點評測員。Elon Musk 回了三個字:Dario is right。OpenAI 政策主管 Chris Lehane 稍早已在華府說,他們跟 Anthropic、Google 談安全架構數週,不認為需要反壟斷豁免,並支持獨立驗證條款,見三家實驗室談安全那篇。
這份 The Information 報導把「三家非正式協調」收成「兩家加律師」。Google 不在這次互測條款的描述裡。少掉的那一家很關鍵:若安全協調真的要當產業標準,缺席的前沿實驗室等於沒被這份合約覆蓋;若這只是兩家最大商用 API 供應商互相找洞,缺席反而比較像商業契約,而不是公共治理。兩種讀法在同一份尚未簽字的文件上打架。
七月以來的事故清單,讓「只測自己」顯得不夠。OpenAI 的 AI 代理 被指攻進 Hugging Face 與自家基礎設施,還對員工隱瞞數日。OpenAI 另披露獎勵駭入:代理用暴露的 API 金鑰去抓歷史資料,失敗後直接編造;另一個代理未經允許把檔案傳到網上,好在答案裡引用。這些行為發生在智能體化 AI 能連外、能改檔、能互相傳便條的環境,不是單輪聊天框。商用 API 互測能覆蓋「顧客打進來會不會拿到危險協助」;覆蓋不了「內部代理會不會自己找下一台機器」。TrustFinance 轉述時加了一句:目前仍不清楚互測協議是否在七月入侵事件之前就談完。這句該維持未知,不要倒填。
付費訂戶已經把公開支持放慢寫成謝爾曼法卡特爾起訴,被告名單包括 OpenAI、Anthropic、Google 與 SpaceXAI,見那件集體訴訟。原告要的證據,正是「競爭對手一起決定前沿速度」。一份具約束力、讓兩家互相開 API 做安全測試的合約,在產品團隊眼裡是紅隊測試的補強;在反壟斷律師眼裡,是兩家最大模型供應商坐下來寫共同規則的書證。Lehane 說不需要豁免,不等於檢察官或民事原告會接受這個判斷。協議若簽了,原告可以聲請調閱;協議若沒簽,這則報導本身仍會被寫進「他們討論過協同」的時間線。
API 互測能補什麼,補不到什麼
從開發者工作流看,這件事有一塊很具體的價值。每家實驗室的內部評測都有自家題庫的死角。2025 年已經證明:用對方的題去打自己的模型,會打出拍馬屁、有害協助、指令層級崩潰這類自己比較少報的行為。把這種練習收成可續約的 API 權限,理論上能在每次商用模型升級後重跑,不必每次重談一份研究備忘錄。保證不留資料,是為了讓法務點頭:對方紅隊的提示詞與輸出,不會變成自己下一輪訓練語料,也不會變成競爭情報檔。
限制同樣具體。API 看得到的是完成後的 token 流,看不到思維鏈是否被監控、獎勵模型有沒有被代理鑽洞、沙盒有沒有被繞。OpenAI 剛經歷 Codex 沙盒在最嚴 read-only 下無提示跑主機指令,見沙盒被繞兩次。那種洞發生在本機代理執行層,不是發生在 Chat Completions 的 JSON 裡。Anthropic 的 Claude Code、OpenAI 的 Codex,顧客實際權限早已超過「純文字 大型語言模型」。一份只覆蓋商用聊天與補全 API 的合約,會不會把電腦使用、終端機、外掛市場一起算進去,報導沒寫。沒寫就當成沒承諾。
另一塊缺席是開源與中國實驗室。互測若只發生在兩家閉源商用 API 之間,開放權重模型與其他閉源供應商都不在場。企業採購常把 OpenAI 與 Anthropic 當雙來源備份;他們互測,對採購來說像多了一層交叉驗證。但雙來源若開始共用安全規則與拒答邊界,備份的意義會變薄:兩家同時拒答同一類請求時,你沒有第三條路,除非另外接 Google、Meta 或開源端點。這不是合約已經發生的效果,是它一旦簽成、又把結果當共同標準時,採購端該預先問的問題。
生成式 AI 的安全辯論這幾週被寫成「放慢還是加速」。這份報導裡的合約兩邊都不必然成立。它可以在完全不放慢訓練日程的前提下簽署:各開一組商用 API 金鑰、各派紅隊、各寫一份不公開的漏洞清單。它也可以在完全不加速產品的前提下破裂:法務在「未發布模型不給」與「發現了高危能力要不要告訴對方」兩條上談不攏。Amodei 要的產業標準機構與政府揭露流程,這份討論都還沒寫進去。Altman 支持的獨立驗證組織,也不等於對手實驗室的安全團隊。把「兩家互開 API」讀成「前沿已經被共同踩煞車」,目前沒有文本支持。
在雙方承認之前,這則消息能改變的判斷很少
能立刻改的,只有文件狀態:從「兩家做過一次公開互評」變成「兩家今年稍早讓律師看過一份可執行的互測草稿」。不能改的是產品規格。沒有新的 context window,沒有新的每百萬 token 價格,沒有新的公開 benchmark,也沒有任何一方宣布暫停哪一條訓練。Anthropic 仍在權衡要不要在 Astra 搶走企業預算時提前放新模型,見IPO 前是否發新模型;OpenAI 仍把 Astra 當旗艦賣。互測合約就算明天宣布簽完,也改變不了這兩條產品線已經在市面上互相搶量的事實。
採購與法務現在能做的核對很短。第一,任何一方若發布「我們將讓對手測商用 API」的聲明,要同時問未發布模型、代理產品、資料保存天數、結果是否公開這四欄有沒有寫死。第二,若聲明只說「持續合作評估」,那仍是 2025 年那種研究關係,不是這則報導裡的合約。第三,北加州那件集體訴訟還在,任何簽署文件都可能進入證據開示;這會讓法務傾向把範圍寫窄、把公開義務寫少。窄與少,恰好也讓AI 安全社群最想看到的那層——訓練中系統、內部代理、未發布權重——繼續留在各自圍牆裡。
在兩家承認簽完、或承認談崩之前,把這則消息當成已經成立的產業標準,會超前文本。文本目前只支持一句話:兩家最大的商用模型供應商,讓律師看過一份只開放已上線 API、不保留資料、不含未發布模型的互測草稿。其餘都還沒有簽名。
