OpenAI 的部落格標題寫「已打斷一場協同的模型蒸餾行動」。同一天,獨立研究團隊把更新標題寫成「我們又偷到推理了」。兩份文件講的是同一類漏洞:供應商把模型的隱藏推理包成加密區塊交給客戶,客戶下次請求再原封送回去;攻擊者把這包東西換到另一段對話、另一個較弱的同門模型,就能叫它把明文推理逐字打出來。官方說 7 月底已經把帳號端清掉。研究團隊說,到 9 月 13 日,同一招在 Microsoft Azure 上對他們測過的每一個 OpenAI 模型仍然有效,包括旗艦 GPT 模型 GPT-6 Astra。
官方數字先攤開。活動最早出現在 7 月第一週,7 月 1 日起流量還低。7 月 24、25 日出現高峰:約 1.6 萬次符合提取模式的請求,來自超過 4,000 個使用者。繼續往下查,相關提示詞模式覆蓋超過 1.5 萬個帳號。公司寫 7 月 28 日前完成全面處置。註腳寫得很清楚:這些數字是「嘗試提取」,不代表每一次都成功,也沒公布成功率、也沒點名被打的是哪幾個模型。手法被寫成「新穎」:把一段對話裡的加密推理複製出來,開另一段對話,要求模型解密並轉寫。加密本身沒被破解,資料庫沒被入侵,使用者對話紀錄也沒被直接讀走。違的是服務條款,不是伺服器牆。
歸責那一段更短。官方寫「無法確定觀察到的所有操作者是否來自單一主體」,但把「核心群組」歸到與月之暗面(Moonshot AI,Kimi 開發商)相關的人員。部落格沒附技術證據、沒附流量路徑圖、沒附帳號重疊分析。對 CyberScoop,公司說基於安全理由不再補充。CNBC 當時向月之暗面要回應,沒有即時回覆。The Hacker News 直接寫:沒有公開技術證據支撐這項歸責,多半是安全考量。讀官方稿,能確定的是「公司把核心群組寫成與月之暗面相關的人」;不能確定的是「月之暗面公司下令、Kimi 訓練資料裡已經裝進這批推理」。
加密推理為什麼能被換對話、換模型
前沿 AI 供應商這兩年把完整思維鏈從使用者可見的回覆裡拿掉,改成摘要,並把原始推理做成加密區塊交回客戶端。下一輪請求必須把這塊東西再送回去,對話才接得上。這樣做是為了少在伺服器存狀態,也為了不讓競爭對手直接拿明文推理去餵學生模型。MATS、ELLIS Institute Tübingen、Snyk 與 Max Planck 的研究團隊在 8 月那篇 Stealing Reasoning Traces from Proprietary LLM APIs 裡指出:這些加密區塊在同一家供應商的生態裡,跨會話、跨使用者、跨模型是相容的,Anthropic、OpenAI 與 Google 都測過。較強的模型被訓練成拒絕吐出自己的推理;較便宜、較弱的同門模型防護較薄。攻擊者不去硬闖旗艦,只把旗艦吐出的加密包丟給弱模型,弱模型就變成解密神諭,把明文打出來。
OpenAI 在部落格裡點名感謝這批研究,並確認他們回報的攻擊路徑是真的,也說這份研究幫公司把緩解推得比較快。換句話說,7 月那波被歸到對抗式知識蒸餾的行動,用的就是同一類「加密包可攜」的結構,不是另外一種還沒被寫進論文的魔法。
論文還寫了另外三條,跟這次官方點名的蒸餾行動不是同一件事,但解釋了為什麼「只加密、仍把密文交給客戶」會變成系統問題。研究團隊從公開倉庫刮了 315,320 個推理區塊來解碼,找回 367 件個資與 182 組憑證;在真實使用者會話裡,這包括 62 把 API 金鑰、33 組密碼、30 個私人信箱。有些個資根本沒出現在使用者輸入裡,是模型記憶灌進去的;使用者看不懂加密區塊,分享日誌時也就沒先清。加密區塊裡還能塞看不見的提示詞注入。模型對外已經拒絕的危險問題,推理過程裡仍可能寫過不該寫的中間步驟。官方這次只談蒸餾,沒在同一篇稿裡處理個資與注入;但官方自己也寫:工具輸出攻擊需要檢查的不只是普通可見文字,夥伴託管部署需要和自家服務同一套防護,這份工作還沒做完。
時間線對得上的,和對不上的
| 時間 | 誰說的 | 發生什麼 | 能當事實的部分 |
|---|---|---|---|
| 7 月 1 日起 | OpenAI | 低流量提取模式出現 | 官方觀測起點 |
| 7 月 24–25 日 | OpenAI | 約 1.6 萬次請求、逾 4,000 使用者 | 嘗試次數,非成功次數 |
| 7 月 28 日前 | OpenAI | 逾 1.5 萬帳號相關模式,稱全面處置 | 帳號與註冊端;未宣稱所有雲端端點同時修好 |
| 8 月 | 研究團隊 | 負責任披露跨模型、對話壓縮類漏洞 | OpenAI 確認路徑為真 |
| 9 月 13 日 | 研究團隊 | 自家 API 已擋;Azure 上 OpenAI 全測過模型含 Astra、Anthropic 至 Sonnet 5,單次抽出明文 | 獨立複測,不是官方數字 |
| 9 月 27 日 | 研究團隊時間線 | OpenAI 才把防護加到 Azure 端點 | 研究方紀錄;官方未另發 Azure 專稿 |
| 9 月 28 日起 | 研究團隊時間線 | Anthropic 模型在 Azure 上再也重現不了這次提取 | 同上 |
| 9 月 30 日 | 雙方同日 | 官方部落格上線;Schaeffer 發「我們又偷到推理了」 | 官方宣稱與獨立複測公開對上 |
讀這張表時有一個容易混的地方。官方「7 月 28 日前全面處置」指的是他們看見的那批帳號與提取模式,加上後來補上的註冊控管、流量監測、以及關掉「拿別人的加密推理去另一段對話重放」那條路徑。研究團隊 9 月 13 日測的是:同一個模型,打自家 API 已經被擋,打 Azure 上的同一個模型卻還沒被擋。兩件事可以同時成立。OpenAI 部落格最後一節自己也寫了這句:夥伴託管的部署需要和第一方服務同一套防護,工作還沒完成。
第二招比解密神諭更笨,也一樣有用
研究更新裡還有一條更短的路徑。開發者 Can Bölük 公開示範:給模型一個虛擬記事本當工具,叫它把推理寫進記事本,使用者再把記事本打開。研究團隊說,這招對他們測過的每一個 OpenAI 模型都有效,對 Opus 4.8 與 Sonnet 5 也有效;只有 Opus 5、Fable 5、Fable 5.1 沒把推理交出來。產出的文字和加密包解密後的推理很像,他們認為拿去蒸餾的價值也差不多。
這就是官方為什麼要在「下一步」裡單獨寫工具輸出。帳號封了、加密包重放堵了,不等於模型不能被要求把思考寫進另一個它自己以為「這不是對使用者可見的回覆」的地方。研究團隊把目前的修補形容成零碎、表面,很多是對特定請求模式做脆弱比對;有些修補送到雲端平台要再隔好幾天。GPT-6 Astra 在第三方平台上線時,他們寫,防護還沒跟著上去。旗艦模型先賣到雲上,補丁後到。
Schaeffer 的主張更硬:修補必須覆蓋每一種攻擊、每一朵託管這批模型的雲。否則攻擊者選防護最薄的那條路就好。論文再往前一步:不執行同等防護的雲端商,根本不該被允許提供推理模型;否則等於在 API 層開後門,讓人繞過出口管制。這句不是監管機關的命令,是研究團隊的政策建議。OpenAI 沒有在部落格裡附和「不該被允許提供」,但承認同一句事實:模型被夥伴託管時,防護必須和自家服務對齊。
月之暗面這次被點名,不是第一次
把「核心群組」寫成與月之暗面相關的人,落在一條已經很密的指控鏈上。站內 9 月寫過 Anthropic 那份威脅情報:阿里相關流量五月到七月超過 1.51 億次交換,用來餵 Qwen;Moonshot 與 DeepSeek 被指把使用者請求默默轉給 Claude,再抽思維鏈當訓練資料。7 月白宮那側也公開指控過 Moonshot 大規模蒸餾 Anthropic Fable 來訓練 Kimi K3。再往前,前沿模型論壇成員據報就在跟蹤未經授權蒸餾。OpenAI 這次說,情資已透過前沿模型論壇和政府管道分享,因為問題不限於自己的模型。
論文附錄裡有一段容易被拿去當「坐實蒸餾」的材料,作者自己先把因果切掉了。他們把 Opus 的推理前幾個Token預填進 Kimi-K3 與 GLM-5.2,輸出風格會往 Opus 靠;把 Sol 的推理預填進 Kimi-K3,風格會往 Sol 靠。DeepSeek V3.1 與 Inkling 沒有可比的偏移。作者寫明:這不能因果證明近期開源模型是用原始推理蒸餾出來的。拿這段去補 OpenAI 的歸責,會把「風格偏移實驗」寫成「訓練資料從哪裡來」,論文自己不這樣寫。
月之暗面到發稿時沒有公開逐條反駁。OpenAI 國家安全政策負責人 Caroline Zier 對科技新報的口徑是:打擊的是違反服務條款的惡意行為,不是反對開放權重,也不是反對合乎學術規範的合法蒸餾。合法蒸餾在產業裡一直存在:教師模型產出,學生模型跟著學,用來做更便宜的產品線。官方這次用的詞是對抗式蒸餾——系統性、未經授權,用一個模型的輸出或推理去訓練、複製或改進另一個模型。差別在授權與規模,不在「蒸餾」兩個字本身。
對買 API、接雲端的人,差別在哪一條端點
同一個 GPT-6 Astra,打 OpenAI 自家端點和打 Azure,9 月中旬的防護不是同一套。研究團隊用一句話收:同一批模型,防護取決於誰在提供服務。企業採購如果只看模型名稱、不看託管方的修補節奏,等於在合約裡買了一個會落後數週的攻擊面。官方沒公布 Azure 和其他雲端在 7 月 28 日到 9 月 27 日之間,有多少提取請求打中、有沒有成功。能寫進稿的只有研究團隊的複測:9 月 13 日,Azure 上他們試過的 OpenAI 模型,包括 Astra,一次就夠。
價格層這次官方沒給新數字。被抽走的是受保護推理,不是可見回覆裡的最終答案。推理過程往往比最終答案更密:中間假設、工具輸出、使用者資料、內部拒答機制都會寫進去。拿去餵學生模型,省的是訓練旗艦級大型語言模型的那筆帳,也把原模型對外加上的安全護欄留在原廠。官方把這點寫成安全與國安風險:蒸餾出來的學生模型,不必付同等的安全投資,就能把雙用途能力帶走。這句是政策語言。技術上能核對的,仍是「加密包可攜」與「雲端端點落後」。
開發者這邊有一個很具體、跟蒸餾無關的動作:不要把含加密推理區塊的原始日誌送到公開倉庫。論文已經用三十多萬個區塊證明,密文裡可能有金鑰和密碼,分享的人自己看不見。推理模型可以繼續用。公開出去之前,把看不懂的那一截當成憑證處理,不要當成無害的除錯附件。
官方承認還沒做完的洞
部落格把後續收成三條:更強的提取防護、更好的協同行動偵測與執法、更深的跨產業與政府情資共享。同一段又點了兩個還沒做完的洞。一是夥伴託管。二是工具輸出——記事本那招走的就是這條。分類器覆蓋、模型拒答、把控管推到雲端夥伴,都還在進行。沒有時程表,沒有「Azure 已與第一方對齊」的獨立驗證聲明,也沒有前沿模型論壇的聯合公告可核對分享了什麼。
獨立研究把修補評成脆弱比對,意思是:換一個請求形狀,舊規則可能失效。官方則強調這是需要分層、持續調整的共用安全問題,不是自家獨有漏洞。兩邊可以同時對。需要下一筆可核對材料的人,與其等下一次歸責聲明,不如等三件比較乾的事:月之暗面是否公開回應;9 月 27 日之後,有沒有第三方在 Azure 上對 Astra 再跑一次同樣的提取;前沿模型論壇或雲端商有沒有寫出「推理模型上線前,防護必須與第一方同步」的可檢查條款。這三件有一件落地,這則新聞才從「官方說已打斷、研究說雲上還開著」往前移一格。
