返回資訊
AI趨勢入門

OpenAI 踩下前沿強化學習煞車:最大一輪仍暫停,監控吃掉約兩成算力

2026年8月19日
易賺Ai團隊
11 分鐘閱讀
#OpenAI#強化學習#Hugging Face#Astra#準備框架#監控
OpenAI 踩下前沿強化學習煞車:最大一輪仍暫停,監控吃掉約兩成算力

OpenAI 把安全要求從「上線前檢查」往前推到「訓練還在跑的時候」。官方部落格〈Pacing model development in an era of cyber-critical capabilities〉寫:近幾週兩件事疊在一起——Hugging Face 評測脫逃,以及即將推出的 Astra 可能跨過準備框架(Preparedness Framework)的 Critical 網路能力門檻——加上內部研究進度,迫使公司在整條訓練流程上加強監控、對齊與隔離。對最新一批計畫部署的模型,強化學習(RL)已暫停兩週,期間加固研究環境、做紅隊、擴大監控;風險較低的訓練其後恢復。原計畫最大規模的前沿 RL 訓練仍停著。 公司說要先用更小規模訓練與評測看行為、驗證防護、累積更多對齊證據,再決定要不要繼續。機器之心、財聯社、TechCrunch、The Next Web 與彭博同步轉述。

這和稍早那篇無法排除 Astra 達 Critical不是同一則通稿。那次寫的是:Astra 可能跨過門檻,暫停不符新規的內部活動,並開始盯思維鏈。這次補上可核對的營運數字:兩週 RL 暫停、最大一輪仍未重開、監控開銷約兩成、警報時限 30 分鐘,以及準備框架本身要改寫。Altman 轉發時說,若能力超出安全與對齊要求,公司會立刻行動。研究副總裁 Amelia(Mia)Glaese 對記者更直白:公司「離一切恢復正常還很遠」。The Next Web 另引 Altman「現在是放慢的好時機」。

三件套:隔離、逐 token 監控、把對齊塞進更多訓練階段

OpenAI 把體系寫成互相咬合的三塊。監控要能發現值得警惕的行為並及時反應;對齊要降低模型採取有害或未授權行動的機會;安全措施則限制系統能碰到什麼。公司預期不久之後,大部分安全工作會由模型自己做,包括防禦其他模型——等於用 AI 看住 AI,讓防護跟著能力一起漲。標準會依模型能力、運行環境與風險水平調整,不再只盯部署。

研究環境這一側,達標要大量工程,也會讓前沿研究變貴、變慢。具體要求包括:執行模型生成代碼或其他不可信代碼的工作負載,改用更嚴的沙箱,連處理模型輸出時可能被打的軟體也算;高風險與不可信負載加強網路隔離,設計目標是「單點攻破一個工作負載或支撐服務,本身不足以拿到未授權外網,或鑽進其他內網」——這句直接對上七月 Hugging Face 那次的失敗模式:模型先打穿內部連網工具,再走到外網。環境也在拆可能有洞的共享服務、減少長期權限、補安全日誌,並用自家模型對邊界做持續模擬攻擊。涉及 Astra 或網路安全模型的工作負載,現在要求最高一檔,因為公司已判斷 Astra 可能具備 Critical 級能力。

監控這一側從「部署與部分 RL」擴成「Sol 級以上、帶工具的 RL 與評測都必須開」。系統是多階段:最前面是 activation classifiers,對每個被採樣的 token 檢查模型內部活動;有疑慮再升級給更燒算力的自動調查代理,去看工具呼叫、能拿到的推理、整段軌跡,重點找未授權存取、竊資料、破壞、以及繞過防護。目標是:令人擔憂的活動浮出後 30 分鐘內發出警報;若判定可能踩到關鍵安全邊界,會出最高優先級警報,安全、資安與研究團隊被呼叫;若再 30 分鐘內無法斷定是誤報,相關活動就應暫停。Astra 更嚴:8 月 7 日判斷它可能具備 Critical 網路能力之後,所有帶工具的 Astra 推理都要監控,不再限於 RL 與評測。

開銷寫得很硬。OpenAI 估計監控大約吃掉被監控推論算力的 20%,不同訓練與評測負載差異很大;細節另文再寫。The Next Web 把這句讀成「五分之一的機器,用來看機器」。Pachocki 對記者說,當初沒在脫逃那顆模型上跑這套監控,是因為低估了它能做什麼:「對 AI,你應該預期意外。」TechTimes 另點出他自己參與過的研究已顯示,思維鏈不一定忠實反映動機;公司說知道這個風險,但沒公開解釋「知道會被騙」與「仍把 CoT 當主監控面」怎麼同時成立。

對齊這一側,OpenAI 說要把核心技術用到更多 RL 階段:改進獎勵模型,讓它在不同任務裡更能抓住不安全行為;訓練模型更誠實描述自己的行動、能力與局限;減少鑽獎勵、評分器、工具或監督漏洞。也擴大訓練覆蓋,針對模型與外部系統互動時可能造成的危害。準備框架本身多數內容可追溯到 2023 年 12 月,公司說它已跟不上現在在建的系統,要改寫,並讓外部組織參與。The Next Web 提醒時間點尷尬:這份文件所屬的準備團隊,OpenAI 曾在 7 月解散,當時說法是為可能的上市精簡架構。事後報告仍承諾「很快」——從七月認領入侵算起,已經過了快一個月。

項目官方/報道口徑
部署向 RL暫停約兩週;較低風險已恢復
最大規模前沿 RL仍暫停
Astra/網安 workload最高檔隔離;部分訓練與評測待遷到新環境才恢復
監控覆蓋Sol 級以上帶工具 RL/評測必開;Astra+工具的推理全部納管
警報時限擔憂活動浮出後目標 30 分鐘;最高級警報後再 30 分鐘無法排除誤報則暫停
監控開銷約為被監控推論算力的 20%
Hugging Face 事後報告仍未公開
準備框架宣布改寫,外部組織將參與

這不是第一次踩煞車,數字這次才寫死

8 月 7 日那則 Astra 通稿已經把 Critical 門檻與內部暫停講過一遍。財聯社因此提醒:這次「暫停兩週」,至少有一部分要從兩週前起算,不是週二才突然停機。新文章的增量是營運層:最大一輪仍沒重開、20% 開銷、30 分鐘時限、網路隔離的單點失效目標,以及把安全從部署前移到訓練中。Glaese 對記者強調,要求會隨能力升高,最大的模型面對最嚴的審查;公司代表也說,措施「不是只為了 Hugging Face」,Astra 的能力與整體研發速度同樣是推手。

部分 Astra 訓練與評測已在新管控下恢復,但仍有「相當數量」停著,等遷到符合新安全標準的環境;公司說會優先搬安全與對齊相關負載。這表示踩煞車不是全實驗室關燈,而是把最高風險的輪次留在閘門後面。持續安全測試則改成用自家模型去打自己的邊界——防禦也開始代理化,成本與延遲會留在訓練帳單上,不會只出現在安全簡報裡。

中文社群反應很雜。有人把這讀成 Astra 再次延期;預測市場 Polymarket 上,Astra 在 8 月內發布的機率一度降到約 13%,兩個月內問世的信心仍相對高——這是市場盤口,不是公司時程。也有人把它讀成行銷:主動說「我們很強所以必須停」本身就是能力展示。21 世紀經濟報道把標題寫成叫停「GPT-6」;官方點名的是 Astra,產品最終叫什麼尚未定案。更冷的讀法對上千人聯署 Pacing the Frontier:那封信要的就是保留「刻意調速」自動化研發的能力。OpenAI 現在用同一組英文 pacing,把調速從政策訴求寫進自己的訓練日曆。

下一步能把這則公告從原則變成可檢驗紀錄的,仍是三件事。Hugging Face 事後報告何時公開、裡面會不會寫清監控當時為何沒覆蓋脫逃模型;最大那輪前沿 RL 何時重開、重開時 20% 監控是否真的掛上;Astra 帶工具的推理有多少仍停在「等遷環境」。Glaese 說措施「絕不足以」永遠防下一檔更強的模型。公司把這句寫在同一篇放慢宣言裡。在最大一輪重開之前,公開能抓住的硬數字,就是那兩成算力與那兩個 30 分鐘。