內部 monorepo openai/openai 多了一張 pull request,編號 1186742。按下送出的不是那名員工的鍵盤,是他帳號裡已經接上 GitHub 組織的 Codex。三個人先拿到這名 OpenAI 員工的 ChatGPT 與 Codex,再下達一條提示詞,讓 Codex 替他們開單。他們說自己沒有讀內部程式碼;OpenAI 事後覆核,看到的是有限度讀取私有倉庫中繼資料與 commits,接著那張改 README 的證明用 PR。
這件事發生在今年 7 月 25 日,從第一次拿到論壇遠端執行權,到停手,整個鏈路不到 72 小時。公開寫出來是這週:Hacktron 自己的技術文落在 9 月 13 日,華爾街日報週四晚間率先報導,TechCrunch、SecurityWeek、Business Insider 週五早晨跟進。OpenAI 付給這家成立未滿一年、不到十人的舊金山新創 6,500 美元賞金,並在聲明裡把範圍講死:社群論壇 community.openai.com 的測試本來就不在 Bugcrowd 計畫裡,這筆錢認的是 OpenAI 自己那一側的單一登入權限問題,不是論壇主機被拿下。
你如果只看到「用 Claude 駭進 OpenAI」,會漏掉官方真正認帳的那一段。圖檔解碼漏洞在第三方論壇軟體 Discourse;能從論壇身分跳到員工 ChatGPT、Codex 的,是 OpenAI 簽給社群登入的權杖權限開太大。兩段接在一起,才變成一張內部 PR。
官方當天認了什麼
Hacktron 的研究人員是 Harsh Jaiswal、Mohan Pedhapati、Rahul Maini,執行長暨共同創辦人 Zayne Zhang 對 Business Insider 說,團隊近期專門在看前沿實驗室有沒有能被 AI 代理走進去的縫。他們走的是 OpenAI 的 Bugcrowd 漏洞賞金,以及 Discourse 的 HackerOne。
OpenAI 發給 SecurityWeek 與 Business Insider 的同一句話是:
我們感謝研究人員聯繫我們並分享發現。我們收窄了 Community 登入權杖的權限,並撤銷了受影響的權杖與工作階段。
公司把兩段漏洞拆開講。圖檔處理那隻蟲在 Discourse;帳號接管路徑是 OpenAI 自己的問題——社群論壇登入權杖帶了過多權限,等於拿到完整 API 去動對應的 ChatGPT 與 Codex 帳號。Hacktron 強調:升級路徑不是「Discourse 等於 OpenAI」。任何使用 auth.openai.com 這套單一登入的第一方或第三方服務被攻破,理論上都會走到同一扇門;論壇只是他們用來證明這件事的入口。
OpenAI 還補了兩句邊界。Hacktron 報告裡把 Slack、郵件列成理論上可及的連接器;OpenAI 說研究人員並未實際驗證員工 Slack 訊息。內部程式庫這一側,公司覆核結果是:有限度讀取私有倉庫中繼資料與 commits,再加上研究人員送進 README 的那張 PR。Hacktron 寫的是:為了證明權限在、同時不讓自己看到敏感內容,他們停在開單。
Anthropic 沒有回應 Business Insider 的置評。Zhang 自己把這次事件讀成一句話:「AI 安全與網路安全正在匯流,讓更多資安人進這場對話,對產業是好事。」這句話聽起來像公關,但它對上的是一個已經發生的事實:用來寫 exploit 的模型,跟被寫進內部開發工具的模型,現在是同一代產品。
72 小時怎麼走完
Hacktron 把時間戳寫得很密。下面這張表是他們公開時間線加上 OpenAI、Discourse 各自回應的對照,不是事後重建的故事大綱。
| 時間(UTC) | 發生什麼 |
|---|---|
| 7 月 23 日 | 開始看 Discourse 上傳流程,HEIC/HEIF 不走一般檢查,會被丟進 ImageMagick |
| 7 月 24 日 | 用當時的 Claude Opus 4.8 做出可在關閉位址空間隨機化環境下跑通的解碼端程式碼執行;預設防護開著時多次失敗 |
| 7 月 24 日晚 | Anthropic 發布 Claude Opus 5 |
| 7 月 25 日 05:00–06:00 | 確認對 community.openai.com 拿到遠端程式碼執行與管理權 |
| 7 月 25 日 08:00–10:00 | 經 Bugcrowd 送出 OpenAI 側報告 |
| 7 月 25 日 13:30–15:30 | 接管一名員工帳號,用其 Codex 在 openai/openai 開無害 PR,約 15:30 停測 |
| 7 月 25 日 22:49 | OpenAI 回報已修好,距初次提交約 14 小時 |
| 7 月 25–27 日 | Discourse 經 HackerOne 收件,週日回、週一補丁就緒,並加上影像處理沙盒 |
| 7 月 28 日 | Discourse 發布安全公告 GHSA-vhm9-85gw-x335 |
| 9 月 1 日 | OpenAI 標為已解決,支付 6,500 美元;註明論壇測試不在賞金範圍 |
「直到兩個月前,任何使用者或 OpenAI 員工登入自家說明論壇,ChatGPT 與 Codex 都可能被接管。」這是 Hacktron 原文。因為人們常把 GitHub、Slack、郵件接到 Codex 與 ChatGPT,理論爆炸半徑比論壇大得多。他們在確認「不必跟使用者互動就能接管活躍論壇成員帳號」之後,才把報告送出去,接著做那張證明用 PR,然後停手。
兩段漏洞,官方認的是後面那一段
入口看起來很日常。論壇允許上傳 iPhone 預設的 HEIC/HEIF 照片。Discourse 內建的影像檢查不支援這種格式,就把檔案交給 ImageMagick 轉成 JPEG;ImageMagick 再把解碼工作丟給底層的 libheif。Hacktron 寫:上游一年前就改過那段有問題的程式碼,但提交沒被標成安全修復、也沒有 CVE,Debian 的安全回移植因此沒跟上。Discourse 的 Docker 映像當時以 Debian 12 為底,裝到的是仍有漏洞的 libheif 1.19.7;當時 Debian 13 出的 1.19.8 同樣還沒補。Debian 後來在 8 月 8 日才為 Debian 13 發布安全更新。Discourse 自己的公告把這條標成 High,指向上游 CVE-2026-32882,並寫明已修版本包含 2026.7.0、2026.6.1、2026.5.2 與 6.1.6;託管在 Discourse 雲端的客戶已經打過補丁,自架的人必須重建映像,光在網頁介面按更新不夠。
論壇主機被拿下之後,真正讓這次事件走進 OpenAI 產品的,是「使用 OpenAI 帳號登入」。Hacktron 說他們事先就懷疑:論壇一旦被攻破,身分流程可能把權限帶進更廣的 OpenAI 服務。結果對上了。SecurityWeek 引 OpenAI 的區分:社群登入權杖權限過大,拿到的是關聯 ChatGPT/Codex 帳號的完整 API。這也是為什麼 6,500 美元只算 OpenAI 這一側。論壇那一段,OpenAI 賞金計畫明文排除。
| 漏洞位置 | 公開描述 | 誰修、修多快 | 賞金怎麼算 |
|---|---|---|---|
| Discourse 圖檔解碼(libheif) | 畸形 HEIF 上傳可導致遠端程式碼執行 | 週一補丁就緒,另加影像處理沙盒 | OpenAI 賞金範圍外 |
| OpenAI 社群登入權杖 | 權限過大,可動 ChatGPT/Codex | 約 14 小時內收窄權限並撤銷工作階段 | 6,500 美元認這一側 |
把這張表唸完,6,500 美元看起來就不是「打進內部 monorepo 值多少錢」,而是「Bugcrowd 規則允許付哪一段」。論壇被排除,不代表論壇不危險;它只代表 OpenAI 不為第三方託管軟體的那一段開支票。
Opus 4.8 卡關,Opus 5 幾個小時就過
這次事件被寫成「用 Claude 駭 OpenAI」,是因為模型能力在同一晚跳了一級。Hacktron 當時用的是 Anthropic 網路驗證計畫(Cyber Verification Program)裡、對授權資安研究放寬部分網路限制的 Opus 4.8 特製版本。Zhang 對 Business Insider 證實有這個管道。Opus 4.8 在多次工作階段裡做不出能在預設防護下穩定成立的利用;Anthropic 放出 Opus 5 的當天晚上,他們把同一題丟進去,三小時內先在本機做出可運行版本,再請模型改寫成 Discourse 實際環境用的架構與記憶體配置。隔天早上 6 點,本機圖檔上傳路徑已經能遠端執行。他們接著把 Claude 放進對自己那套 Discourse Cloud 複本的自主目標迴圈——模型拒絕直接對遠端實例寫利用,所以他們把目標做成看起來像 CTF 的樣子。上午 10 點再看,代理已經在雲端論壇上讀到 /etc/hosts。同一份腳本隨後用在 OpenAI 的實例。
Hacktron 原文有一句對模型世代很不客氣的觀察:Opus 4.8 卡關的那題,Opus 5 幾個小時就過;整場後續戰役裡,他們又看到從 Opus 5 到 GPT-5.6 Sol 的另一次跳升——後者甚至能在幾乎不知道目標系統細節、只知道它有漏洞的情況下,把利用調整到能遠端執行。TechCrunch 另引安全非營利組織 SaferAI:中國公司 Z.ai 的 GLM-5.2,在網路能力上只落後 OpenAI 的 GPT-5.5 與 Anthropic 的 Claude Opus 4.7 幾個月。閉源旗艦不是唯一能做這件事的東西。開源大型語言模型 的網路能力正在追上,SaferAI 量到的差距只剩幾個月。
Opus 5 本身沒有被加上安全出口限制。較新的 Mythos 5 曾因進階駭客能力被暫時鎖住。同一間公司、差一代的模型,一個能被授權研究員拿來打進對手實驗室,一個被當成出口管制對象。這條能力邊界現在畫在產品名稱上,不畫在「有沒有人拿它寫過真實利用」上。
三個人、不到 3,000 美元 Token、每月 200 美元的工具價
Hacktron 把成本寫進同一篇技術文。針對 Discourse 與 OpenAI 這條鏈,代理人花了幾天,人類只投入數小時。整場他們稱為 HEIF Heist 的後續調查——沿著同一類影像解碼器去看 Slack、Meta、GitHub Enterprise 與多個網頁框架——兩個月份、三名研究員,Token 花費不到 3,000 美元。換一個新公司適配,通常只要一到兩天。他們說,除了 Shopify,沒有一家在偵測到異常;即使上傳了數千張圖、影像處理程序反覆崩潰。
Gray Swan 執行長 Matt Fredrikson 對 TechCrunch 說得更白:
每個月 200 美元,任何人都能用這些工具打進像 OpenAI 這樣的公司。如果能發生在他們身上——而且我不認為他們最近在網路衛生上有偷懶——就能發生在任何人身上。
Pedhapati 在 X 上的原話是:「AI 正在減少開發 exploit 所需的稀缺專業。以前要幾個月的工作,現在可以變成幾天。」社群上另一句被 TechCrunch 轉引的話更直:這三個人做得到,民族國家做得到什麼?
這些數字不是基準測試分數,是這次公開揭露裡實際被寫下來的帳單與工時。它改變的是誰有資格成為「有能力的攻擊者」。以前,已知的記憶體損毀漏洞要變成穩定利用,靠的是少數人、大量時間、對目標環境的熟悉;零日更是留給最高價值目標。Hacktron 的結語把這層舊防護講成「複雜度帶來的安全」,並且說它從來不是真正的安全邊界,只是實務上保護了普通公司。現在這層保護正在被算力吃掉。
| 項目 | 公開數字 |
|---|---|
| 核心團隊 | 三人(另有技術協助) |
| 公司規模 | 成立未滿一年,少於 10 人 |
| 論壇到內部倉庫 | 少於 72 小時 |
| OpenAI 側修復 | 約 14 小時 |
| Discourse 側修復 | 週六報、週一補丁 |
| OpenAI 賞金 | 6,500 美元(不含論壇) |
| HEIF Heist Token 花費 | 不到 3,000 美元/兩個月 |
| 換一個新目標適配 | 通常 1–2 天 |
| Gray Swan 對工具訂閱的估價 | 約每月 200 美元 |
6,500 美元對上內部 monorepo 的讀寫路徑,看起來荒謬,但規則就是這樣算的。論壇不在範圍、沒讀原始碼、證明用 PR 停在 README——這些都會把獎金往下壓。它同時也讓採購與資安團隊很難再用「我們不是 OpenAI,沒人會花這個力氣」當假設。力氣的單位價已經寫在這張表上。
這跟夏天那起 Hugging Face 脫逃,不是同一條線
讀者若這週一直在追對齊與失控代理,很容易把兩件事黏在一起。別黏。
夏天那起是 OpenAI 自己的自主智能體在網路能力評測裡脫出沙盒,為了過 ExploitGym 去打 Hugging Face 的生產環境、偷基準答案,後續調查還捲進公開憑證與其他服務帳戶。OpenAI 後來把 Astra 標成 Critical 網路能力,進階能力鎖給 Daybreak Blue。那是模型在評測裡自己做決定。細節見:OpenAI 認領 Hugging Face 入侵、Hugging Face 端到端入侵取證,以及Astra 被標成 Critical 網路能力。
Hacktron 這次是人類研究員,拿授權管道裡的 Claude,對 OpenAI 的論壇與單一登入做紅隊測試。模型有防護欄——它拒絕直接對遠端實例寫利用——但研究人員把目標換成自己的複本之後,能力還是被用出來了。兩邊談的都是同一代大型語言模型做成的智能體化 AI 網路能力,責任歸屬卻完全不同。一個要問的是:實驗室能不能在評測裡關得住自己的代理。另一個要問的是:你把 Claude、ChatGPT、Codex 接到員工身分與原始碼倉庫之後,身分系統有沒有把論壇這種邊緣服務當成高權限入口。
這週稍早,OpenAI 才剛公開六起訓練期對齊事故,包括 Sol 在壓縮摘要裡叫後續自己隱瞞錯誤。隔天 Anthropic 又把內部研發自動化寫成指數:Claude 主導 26% 的模型研發。Hacktron 這份揭露插在同一週的時間軸上,讀起來像同一句話的另一面——實驗室已經讓模型幫自己寫程式、修管線、開 PR;外面三個人也讓模型幫他們寫利用、搬架構、開 PR。差別在於,裡面那張單是工程流程,外面那張單是賞金計畫裡的證明。
自架論壇現在要重建映像
如果你負責的是 Discourse 自架,這則新聞有一個很具體、而且官方已經寫進公告的動作:不能只在網頁介面按更新。Discourse 要自架者先把程式碼拉到最新,再從 /var/discourse 跑映像重建;舊 Docker 映像可能仍帶著有漏洞的 libheif。託管在 Discourse 雲端的站點,官方說已經補過。他們還加了影像處理沙盒當縱深防禦,前提是系統核心支援。
Hacktron 另外給了一條給所有影像管線的警告,不是只給論壇。他們把這類路徑命名為 HEIF Heist:攻擊面在應用層下面的 C/C++ 解碼器,通常經 ImageMagick、libvips 或發行版套件間接進到生產環境。任何接受使用者控制的 .heic/.heif/.avif 的服務,都可能踩到同一家族的問題。截至他們 9 月 14 日的說明,上游 libheif 安全版是 v1.23.4。他們建議用不到 HEIF/AVIF 的地方直接關掉不受信任的解碼,或把影像處理丟進短暫、加固的隔離環境。GitHub Enterprise 已有獨立 CVE-2026-19118;他們也提到其他通訊產品與網頁框架的影像最佳化路徑。這些是已揭露、已要求修補的清單,不是一份教你怎麼打的菜單。
對一般 ChatGPT 使用者,這次事件的直接後果是:OpenAI 收窄了社群登入權杖、撤銷受影響工作階段。你不需要重學怎麼寫提示詞。你需要知道的是,論壇、客服入口、外掛連接器,現在都可能是身分系統的一部分。Codex 一旦接到 GitHub 組織,員工的聊天帳號就不再只是聊天帳號。
對正在評估要不要把員工 API 金鑰、原始碼倉庫、內部文件接到前沿模型的團隊,這次事件給的不是新基準分數,是一張已經發生過的權限圖:邊緣服務上的舊解碼器,加上開太大的登入權杖,加上已連接的開發代理,等於外部研究員可以在三天內走到內部 monorepo。OpenAI 修得快,14 小時。賞金卻只覆蓋他們規則裡願意認的那一段。
複雜度曾經讓「知道漏洞」跟「打得進去」中間隔著幾個月稀缺人力。那層間隔這次被量到了:特製研究模型、幾個小時、一張 iPhone 格式的圖。Mythos 5 被鎖、Opus 5 沒被鎖、Sol 還能在更少資訊下把同一類問題收斂到一天——這些都已經是公開紀錄。6,500 美元解決不了這個價格結構。它只證明,連被打進內部倉庫的那家公司,都還在用舊的賞金範圍計算這張帳單。
