OpenAI 沒有用聊天產品發表會推出下一代模型名號,而是直接丟出十份可機器檢查的數學與理論計算機科學結果。官方部落格〈Ten advances in mathematics and theoretical computer science〉寫明:這些問題的主結果至少十年沒有進展(多數更久);解答由內部版 Astra(下一代主力模型代號)在開發期評估中產出;找齊十個解所需 token,若按 GPT-5.6 Sol API 價格估算約 2000 美元;人類再與同一模型把論證整理成稿,模型隨後把每份論證形式化成 Lean 4 證書,並釋出推理敘事 PDF 與完整論文包。
一句話:這次要比的不是「會不會解難題」,而是「能不能把證明交到編譯器手上」。
十個結果橫跨八個領域
Developers Digest 等整理的清單與官方 PDF 對得上,涵蓋高維幾何、編碼、群論、算子代數、算術電路複雜度、量子複雜度、格密碼與極值組合:
- 高維球堆積:釐清 Cohn–Elkies 線性規劃的漸近強度,改進高維一般堆積上界。
- 二元/球面碼:在任一給定最小距離下,對最大碼大小給出指數級改進上界。
- 非 sofic 群:構造證明此類群存在,回應「是否每個可數群都有有限置換逼近」的核心問題。
- Connes 剛性猜想:反例——構造無限多兩兩不同構、卻有相同群 von Neumann 代數的 property-(T) 群。
- 算術電路複雜度:永久式的新下界,含公式需 Ω(n⁴/log n) 等結果。
- 量子平行重複:一般兩人量子博弈的指數平行重複定理。
- 最近向量問題(CVP):多項式因子近似硬度,牽動後量子密碼與格問題。
- Ehrhart 體積猜想:每個維度下,質心為唯一內部格點的凸體最大體積尖銳界。
- 多色 Ramsey:多色三角形 Ramsey 數超指數下界,對應 Erdős 問題 183。
- 極值圖論: compactness/degeneracy 相關構造,對應 Erdős 問題 146、180。
這不是五月單位距離猜想「單一王牌結果」的放大版。廣度本身就是訊號:八個領域、十個彼此不相干的開放題,比較難用「碰巧撞上一個好提示」解釋。
對密碼與複雜度社群,第 7 項 CVP 近似硬度尤其敏感:格問題直接連到後量子假設與解碼。對組合學,Erdős 編號題目被一次清多道,會吸引最多 mainstream 目光。對算子代數與群論,Connes/sofic 這類結果則更可能在小圈子裡引發長時間審查——也正是 Lean 證書最有價值之處:至少先把「論證有沒有形式漏洞」與「結果在文獻中的意義」拆成兩段工作。
OfficeChai 等報導補充:Astra 本身仍未對外釋出;Altman 本週在華府用它向參議員與行政官員示範長任務協作,數學是 headline。產品命名未定,十證卻先定調——OpenAI 想在監管對話裡拿出「可驗證進步」而不是只談聊天市占。
Lean 倉庫為什麼比新聞稿重要
官方把形式化證書當一等產物。GitHub 倉庫為標準 Lean 4.32/mathlib/Lake 專案:lake exe cache get && lake build All 可編譯全部十份;模組名如 NonSoficGroup.lean、ConnesRigidity.lean、Permanent.lean、GapCVP.lean 等可直接對題。授權 Apache-2.0,並附 ComparatorChallenges 供獨立檢查說明。
這改變驗證經濟學。人讀四十頁證明要數月,仍可能漏縫;Lean 證書編譯過或不過,檢查器幾分鐘給答案。七月 GPT-5.6 Sol Ultra 圖論證明已示範過單一難題路線;這次差異是規模——不是一旗艦,是十連發,且預設附機器可檢查證書。
OpenAI 同時釋放「How the Ideas Came Together」推理敘事:由模型閱讀原始思維鏈與成稿後,重構每題的思路轉折、死路與關鍵視角。對研究者,這比只丟最終定理更接近可學習的方法論文獻;對懷疑者,它仍無法替代「搜尋過程是否可獨立複現」——Astra 本身未公開,外界拿不到同等搜尋軌跡。
署名政治:對 Leiden 宣言的直接回應
官方寫得很硬:歸因應誠實反映產出方式;若證明完全由 AI 系統生成,卻宣稱人類作者,會同時扭曲系統貢獻與真正人類智識工作。他們協助成稿與 Lean 形式化,並對正確性負責,但數學論證本身由系統生成。這是對 Leiden「AI 與數學」宣言披露要求的對位動作。
數學界接下來要審的不只是「編譯過沒有」,還有概念選擇、結果在文獻地圖上的位置、與既有定理的關係。Lean 過關是必要條件,不是充分條件——社群仍可能因定義邊界或既有結果關係要求修訂。可觀察節點很具體:第三方能否順利 build;領域專家是否接受表述與歸屬;十證中有無被撤回或大幅改寫。
時機:同一天華府框架大限,Astra 卻先交「可驗證知識」
Astra 本週已在華府向議員與行政官員演示,定位偏多智能體長任務協作,數學當 headline 證明場。模型是否叫 GPT-6、GPT-5.x 升級或獨立檔位尚未公開定案。選擇在白宮 60 天框架大限同一天公開十證,政治讀法很難避開:一邊是自願預審規則仍可能空窗,一邊是實驗室用可編譯證明搶「誰能產出可驗證知識」的聲譽。
兩千美元這個數字同樣刺耳。它定價的是研究方法,不是結果本身。有經費的實驗室理論上可把定理發現當批次作業跑;瓶頸轉到提示設計、結果篩選與領域把關,而不是算力帳單。這也把競爭從「誰的聊天更聰明」拉到「誰的形式化管線更穩」。
邊界與下一步
明確限制:Astra 是內部模型;搜尋過程不可外部複現;OpenAI 對正確性負責,但學術接受度仍待審;GitHub 能編譯不等於每個非形式敘述都已完成社群確認。與產品 API 定價、ChatGPT 功能亦無直接對照表——這是研究產物發布,不是消費功能上線。
對開發者與研究採購:把 Lean/形式化工具鏈當觀察指標,而不是只追 benchmark 排行;追蹤倉庫 issue 與數學論壇對十證的修訂;留意後續是否把 Astra 級能力產品化進可呼叫 API。對政策觀察者:同一週末歐盟透明度義務生效、美國框架公開交付物缺席,對照 OpenAI 選擇用數學證書說話——治理真空與實驗室展示,正在同一時間軸上互相加劇。
也要注意成本敘事的雙面。兩千美元聽起來便宜,指的是「找到解」的推理 token,不包含訓練 Astra、人類審稿工時、形式化迭代與後續學術溝通。實驗室若複製方法,仍需領域專家判斷「哪個開放題值得燒、哪個結果值得投期刊」。方法變便宜,不代表數學研究變成自動販賣機——它變成「搜尋+篩選+驗證」的流水線,卡點從算力挪到品味與責任。
與翁荔回歸推動遞迴自我改進並讀更有張力:一邊用模型改進生產內核砍成本,一邊用模型批量產出可編譯證明。自我改進不再只是治理恐懼詞,而是兩條已公開的工程/研究管線。Astra 十證等於告訴外界——下一階段競賽包含「誰能穩定產出可驗證知識工件」。
OpenAI 這次沒有說「Astra 已全面公開」。它說的是:下一代模型在開發期就已經能批量產出跨領域、可機器檢查的開放題結果,且願意用署名規則承認「論證是系統寫的」。數學界會慢慢給分;編譯器會先給第一輪。
