同一週裡,OpenAI 把兩件看起來不相干的事放到同一張桌上:一邊是技術部落格細數 GPT-5.6 Sol 如何改寫自家生產環境的 GPU 內核與調度;另一邊是官方對 TechCrunch 確認——剛以健康理由離開 Thinking Machines Lab 的共同創辦人翁荔(Lilian Weng),將重返 OpenAI,領導加速內部研究、支援跨團隊「遞迴自我改進」(recursive self-improvement)工作。
一句話:自我改進不再只是治理辯論裡的抽象詞,而開始有公開履歷——誰在做、模型已經在優化什麼、成本數字是多少。
人事主線:從 Thinky 共同創辦人,回到安全研究出身的大實驗室
翁荔並非陌生名字。她 2018 年起在 OpenAI 任職近七年,橫跨應用研究與安全系統,離職前曾任 AI 安全研究副總裁;2024 年末離開後,與前 OpenAI CTO Mira Murati 等人共同創辦 Thinking Machines Lab。本週稍早她在內部 Slack(並同步發到 X)寫道:無法繼續維持新創所需節奏,數月思考後承認持續壓力與工作量已超出身體可承受範圍,並以「值得建造的未來是人的」作結。
Murati 公開回覆祝福她把健康放第一。幾乎同時,OpenAI 發言人告訴 TechCrunch:翁荔將回歸,領導高層級團隊加速內部研究,並支援遞迴自我改進方向——讓 AI 系統能迭代自身、變得更強。Business Insider、The Information 等後續報導把任務說得更直白:用 AI 幫助設計、訓練與評估下一代模型。RuntimeWire 還指出,2026 年內這已是第三位 Thinking Machines 共同創辦人回流 OpenAI(稍早有 Barret Zoph、Luke Metz 等人)。
外界最尖銳的讀法只有一句:她才說新創節奏傷身,為何立刻回前沿實驗室扛更敏感的研究方向?較溫和的解讀是:共同創辦人的全時壓力與大實驗室裡「領導研究組」的壓力結構不同;也有人把回流讀成人才磁鐵與股權/算力現實——Thinky 再強,仍難匹敵 OpenAI 的研究基礎設施。無論哪種讀法,訊號都很清楚:OpenAI 把「用模型改進模型」提到需要具名高管背書的層級。
技術主線:Sol 不是只會解數學題,它在改 OpenAI 自己的水管
OpenAI 官方長文〈How GPT-5.6 fuses frontier intelligence with frontier efficiency〉把效率故事寫得很具體。旗艦 GPT-5.6 Sol 在 Artificial Analysis 程式設計智能體榜單上勝過 Claude Fable 5,且 API 成本不到對方一半;均衡款 Terra 對標前代能力但價格腰斬;高性價比 Luna 定價再比 Sol 低約八成。這些數字若只停在定價表,讀者會以為是訓練更強;OpenAI 要強調的是——同樣硬體上榨出更多有效輸出。
他們把優化拆成整條服務鏈:路由(請求去哪)、調度(何時執行)、GPU 內核(顯卡上真正跑的程式)、快取(重用已算結果)、模型實作(GPU 指令怎麼排)。文中關鍵句幾乎像產品廣告,卻是技術事實:GPT-5.6 Sol 在 Codex 裡,對上述層次都起了「工具人」作用。
第一塊是負載均衡。全球層依地理位置、剩餘容量、晶片類型分流;叢集內依負載、上下文長度、快取狀態把任務派到模型實例;實例內再拆到加速器與計算核心。Sol 被用來分析真實線上流量、找出過去被忽略的算力失衡、試新路由策略再迭代規則。
第二塊更刺眼:前向傳播與生產內核。OpenAI 寫道,Sol 能找出可預計算、可省略或可平行化的工作;並與 Codex 搭配,自主重寫並優化生產環境內核——也就是執行 大型語言模型 數學運算的那段核心程式。這之所以可行,是因為 GPT-5.6 被訓練成擅長用 Triton 與 Gluon(OpenAI 維護的開源 GPU 編程語言)撰寫與改進內核;再用開源浮點淨化器 FpSan 等工具驗證正確性。官方結論:這些努力加上更廣的內核改進,端到端推理服務成本下降 20%。
第三塊是推測解碼(speculative decoding):小草稿模型先預產一串 token,主模型平行驗證,通過則一次前向輸出多個 token。Sol 對草稿模型做了規模、結構、模組的數百組對照實驗,還能自主啟動並值守訓練、處理硬體故障與訓練震盪。官方稱整體 token 生成效率提升逾 15%。
第四塊是 KV 快取與服務超參。未命中快取的輸入要先花高算力建 KV,再在生成階段反覆讀寫。過往批量、分片、快取策略多靠經驗規則;Sol 被用來解析真實負載、生成並比較備選配置,針對場景微調。整個迴路被描述成持續運轉:採集線上數據 → 找瓶頸 → 落地優化 → 驗證系統表現。
智能體基座:省錢不只靠模型變便宜
OpenAI 同時拆解 ChatGPT Work 與 Codex 的智能體調度。一次複雜任務可能包含查看原始碼、翻部署紀錄、跑測試等數十次模型呼叫;每次多一秒延遲就會累加。他們的主張是:不能只加速模型,還要砍掉全系統重複計算。
三個手段被點名。一是延遲載入:整合元件、MCP 工具、外掛只在真正呼叫時才進上下文;工具回傳預設上限約 1 萬 token,避免單一工具霸佔窗口。二是為提示快取保留「精確前綴」:歷史改為僅追加寫入,不在中段插入修改,讓相同指令與工具定義能穩定命中快取。三是用 Responses API 的推理留存與上下文壓縮,取代粗暴的滾動截斷。
後者在 ARC-AGI-3 上變成公開案例。極簡評測框架下 Sol 公開測集約 7.8%(上一代 GPT-5.5 約 0.4%);換成產品內常用設定後,分數可大幅拉升——官方示例提到開啟推理記憶與壓縮後,公開測集可到約 13.3%,若保留原有推理與壓縮機制可到約 38.3%,輸出 token 消耗可縮至約六分之一。重點不在「Sol 突然變神」,而在:同樣權重,調度框架會把分數差出數倍。OpenAI 因此建議開發者用與產品相同的 API 設定來評估,或至少讀懂評測有沒有關掉推理留存。
為什麼這兩則消息要並讀
把翁荔回歸與 Sol 寫內核放在一起,會出現一條比任一篇快訊都硬的主線。Sol 已經在做的,是「模型改進服務自身」的弱形式——改路由、改內核、改草稿模型、改超參,回報是百分比級的成本與吞吐。翁荔被賦予的,是更強形式的研究協調:如何把訓練管線、評測、工具與部署軟體也閉環自動化。她自己七月初技術部落格曾寫過:遞迴自我改進不必等於模型直接改自己的權重,也可以是改進產出後繼模型的整條流水線。
這與同週逾千人 Pacing the Frontier 聯署形成刺耳對照。聯署要求保留「刻意調速」自動化研發的國際工具;OpenAI 同週卻公開展示自動化已在自家機房裡砍成本。兩者並非邏輯矛盾——公司可以一邊說世界需要調速選項,一邊用自我優化拉開單位成本優勢——但政治讀法會很難聽:口號喊踩煞,產品線卻把油門焊在推理帳單上。
也要對照ExploitGym/Hugging Face 脫逃事件。同一系列模型能力,在評測裡能串零日找答案;在生產裡能重寫 GPU 內核。能力本身不分善惡,邊界與監測才是。OpenAI 強調內核有驗證工具、Sol 是 Codex 輔助的工程流程;外界仍會問:自主改生產內核的審核、回滾與責任鏈是否跟得上能力曲線。
硬體與規模:同週被中媒捆成「四連發」的其餘兩則
智東西/36氪等中媒把同週消息捆成四條:除效率長文與翁荔回歸外,還有 OpenAI 總裁 Greg Brockman 接受訪問確認公司在打造「一組裝置」(a family of devices),預期使用者很快見到,並認為絕大多數情境人們會改與電腦對話而非打字;以及用戶與企業規模敘事被再次強調。The Verge 核對 Brockman 訪談:他未確認是否為傳聞中的智慧音箱或穿戴裝置,也未給明確上市日,只說「很快」;並在 Apple 訴訟背景下重申 OpenAI 聚焦自有技術、對他司商業機密沒興趣。
規模數字在不同出處並不完全一致。較早公開報導多以 ChatGPT 約十億級月活用戶、企業客戶與付費席次成長為主;部分中文彙整寫到「服務兩百萬家企業」等更激進口徑。對讀者較穩妥的讀法是:OpenAI 正同時堆疊三件事——單位推理更便宜、研究人才回流做自我改進、硬體介面要從螢幕鍵盤走向語音裝置——而不是死盯單一未對帳的企業家數。
Thinking Machines 一側也不平靜。該實驗室稍早才以Inkling 開源權重搶美系開放模型敘事;共同創辦人連番回流 OpenAI,會被解讀成「開源新創仍難留住最前線研究節奏」,或解讀成「大實驗室與新創本來就是旋轉門」。對採購來說,供應商穩定度問題因此多了一個觀察點:你的關鍵研究人員下季還會不會在同一間公司。
對開發者與採購:可立刻驗證的三件事
若你跑 Codex/ChatGPT Work 類長任務:檢查 Responses API 是否開啟推理留存與上下文壓縮;ARC-AGI-3 案例證明,關錯設定等於先把分數砍一半。若你在比 Sol 與 Fable 5 的「每美元智能」:把官方宣稱的成本結構(Sol 低於半價卻勝過榜單、Terra 半價對標前代、Luna 再砍八成)當起點,再用自家流量重測——推測解碼與快取命中率會讓真實帳單與標價表脫鉤。若你在追治理:把「Sol 已在改生產內核」寫進風險登錄,問供應商自主改基礎設施的審核門檻,而不是只問模型卡上有沒有安全章。
下一步觀察清單也很短。翁荔團隊的組織邊界與第一批公開研究成果何時出現;OpenAI 是否把 Sol 改內核的流程產品化給外部客戶;以及白宮前沿框架與調速聯署,會不會被拿來質問「自我改進已上線、調速工具卻仍在簡報」。
這週 OpenAI 真正丟出的,不是又一次模型更強的口號,而是一張更難反駁的成本曲線:當模型開始穩定改寫服務自己的那層軟體,競爭對手要比的就不只是 benchmark,還有誰敢、誰能、誰被允許讓模型碰生產內核。
