OpenAI 發布頁上的幻覺率先寫 4.2%。同一天下午 5 點 20 分的存檔變成 2%。現在又回到 4.2%。Fortune 記者 Emily Forlini 把發布頁的封存快照一張張對過去,至少找出五項數字被改過;有的讓 Astra 看起來更好,有的把對手 Claude Fable 5.1 拉下來。公司對 Fortune 說,檢查點、工具設定、推理檔位和單次評測跑法本來就會讓分數浮動幾個百分點,調整是為了更準確反映模型表現。Stanford 兩位研究者把這種做法叫 benchmaxxing:換條件重跑,直到數字變好看。
產品怎麼上線、API 怎麼標價,稍早的 Astra 上線稿已經寫過。這次要對的是分數本身:誰改了、改了什麼、同一套 大型語言模型 權重為什麼能同時拿出 62.7% 和 99.9%。
發布頁上的數字,下午還在動
Fortune 比對的不只是幻覺率。embargo 稿給媒體的 ARC-AGI-3 數字是 98.6%;上線後的部落格寫 99.99%。GPT-5.6 Sol 的 ExploitBench 一度從 5.5% 變成 11.5%,OpenAI 告訴 Fortune 這筆正在評估要不要改回去,因為 11.5% 對應的推理檔位,市售 Sol 根本沒有。Fable 5.1 在 FrontierMath 上先寫 87.8%,中間掉了將近十分到 78%,後來停在 83%。不是每一筆都對 Astra 有利:Fable 5.1 在 HealthBench Professional 上有兩項被調高。發布頁還曾經整篇下架再掛上,公司說原因不便透露,並稱和評測數字無關。
| 指標 | 先寫的數字 | 中間版本 | 後來停在 |
|---|---|---|---|
| Astra 內部幻覺率 | 4.2% | 2%(下午 5:20 快照) | 4.2% |
| Sol ExploitBench | 5.5% | 11.5%(非市售推理檔) | 公司評估是否改回 |
| Fable 5.1 FrontierMath | 87.8% | 約 78% | 83% |
| ARC-AGI-3 對外標示 | embargo 98.6% | — | 上線稿 99.99% |
98.6% 剛好對得上 ARC Prize 表上、Provider Adapter 在 max 推理檔的那一格;99.9% 則是同一套 Adapter 在 high 檔的成績。對外口號從「max 跑出來的數」換成「表上最高的那格」,中間沒有新的評測說明。
Anka Reuel 和 Mike Hardy 在 Stanford 分別待在 Intelligent Systems Laboratory 和 Trustworthy AI Lab。他們去翻 system card,想找內部幻覺基準的方法學,結果幾乎沒有細節,連題目數量都沒寫。Snorkel AI 的 Vincent Sunn Chen 對 Fortune 說,發布前最後幾小時分數本來就常動,檢查點、設定、harness、給分規則都還在收;他建議的行業慣例是:改了已經公開的數字,就要寫清楚改了什麼。2025 年 Meta 被指用內部版 Llama 4 的成績當公開權重的成績,Yann LeCun 後來承認數字被灌過。這次還沒有人拿出同等強度的指控,但公開頁在讀者已經看過之後還能改五筆,本身就是新聞。
兩套介面,兩套問題
ARC Prize 在 Astra 上線當天就公布了完整對照表。標準 harness 給所有廠商同一套最薄介面,模型自己決定要把哪些筆記帶進下一回合。Provider Adapter 則保留模型看不見的不透明推理狀態,並用 compaction 把長對話壓短,讓模型沿用先前算過的中間結果。
| 推理檔位 | 標準 harness | Provider Adapter |
|---|---|---|
| max | 62.7%,26,098 美元 | 98.6%,17,332 美元 |
| xhigh | 59.3%,37,317 美元 | 98.4%,18,147 美元 |
| high | 54.8%,40,705 美元 | 99.9%,18,817 美元 |
| medium | 38.6%,48,090 美元 | 98.4%,19,285 美元 |
| low | 17.5%,38,166 美元 | 98.0%,21,298 美元 |
| none | 35.2%,49,791 美元 | 96.7%,23,457 美元 |
分數是 ARC-AGI-3 Semi-Private;花費是 ARC Prize 跑完整套評測的帳單。兩邊都解出來的 167 組遊戲/推理配對裡,Adapter 總耗時大約快 3.66 倍,Token 少 49%。更高的推理檔在這套測驗上通常更便宜,因為 Astra 用更少動作解完,模型呼叫次數跟著下降。標準介面上有一個例外:low 檔 17.5%,比完全關掉推理的 35.2% 還差。ARC Prize 沒解釋這一格。
最難消化的是 Adapter 把推理關掉之後,仍有 96.7%。同一套權重在標準介面開到 max,也只有 62.7%。腳手架的貢獻,大過推理旋鈕轉到盡頭。
對外傳播最廣的對照是 Astra 99.9% 對上 Sol 7.8%。那兩筆不是同一套測驗。99.9% 來自 Adapter,7.8% 來自標準介面。同等條件對照是 62.7% 對 7.8%,仍然是大幅躍升,也是這份基準真正支持的句子。The Next Web 自己承認,首發稿也曾把 99.9% 直接拿去對 Sol 的 7.8%,沒寫 harness 條件。
ARC Prize 不認 AGI,Chollet 把時間表往前拉
ARC-AGI-3 測的是智能體能力:探索、建模、自己找目標、規劃執行。環境只給核心先驗,規則和目標都不寫明,人類受試能解完 100%。基金會把 通用人工智慧 定義成:系統能以人類效率,學會人類能學會的任何技能。Astra 在 Adapter 的 max 檔上,96.0% 的關卡用比人類基線更少的動作解完,平均少 51.7%。這是動作效率,不是算力帳單:它量的是模型摸熟一個環境需要多少互動。主辦方原本假設,就算 AI 解得過,探索步數仍會明顯多於人;brute-force 路徑仍然如此,但前沿模型出現接近二元的模式:一旦摸到機制,執行就落進人類效率區間。
回放裡,Astra 會把陌生關卡收成自己的符號世界模型。ARC Prize 舉過它現場發明的代數速記,例如 extend8 to3; retract10 to2 這種有順序的機構指令,或 Turn 5: P=(24,20), empty, facing west 這種位置加朝向。François Chollet 在社群上寫:這種即時符號建模,以前幾乎只出現在精密 harness 裡,現在能力正在往模型本身搬。PRO-LONG 這套第三方沙盒裡,Astra 還會為每款遊戲寫解析器、狀態模型、搜尋和規劃小庫;迷宮關甚至拆成尋路、戰鬥規則、巡邏模型和預測對帳。主辦方沒看到逃出沙盒的跡象。人類受試沒有程式直譯器和筆記本,PRO-LONG 量的是模型和自建工具加在一起的表現,不能拿去跟人的基線比。
這些都是真進展。基準作者自己劃的線也寫得很清楚:
我們並未宣稱這就是 AGI。
共同創辦人 Mike Knoop 補了一句:目前缺乏把它稱為 AGI 的證據。Chollet 另外寫過,目前對這套系統知道的,主要就是基準分數。ARC-AGI-3 測的性質對了——不確定下的探索、沒有說明時的適應、從稀疏資料建因果世界模型——但尺度很小,時間尺度比真實任務短幾個數量級。這份基準當初強調過:解完不是終點線。Astra 大約比 Chollet 預期的飽和時間快一倍;被問到先前 2030 年的 AGI 預估時,他只回「更早,因為進展比我預期快」。下一版 ARC-AGI-4 已在做,目標放在 2027 年第一季,題目會往遞迴自我改進和開放式創新靠。往後排行榜會把標準介面和廠商 Adapter 分成兩欄,各自標註評測條件。
embargo 的 98.6% 和上線稿的 99.99%,對照的就是 Adapter 表上兩格。對外「AGI 時代」那句話,走的是接近滿分的那一欄。基準作者拒絕跟那句話站在同一邊。
獨立指數沒有把 Astra 送出第一排
Epoch AI 把五十多項基準合成一份總分,Astra 拿 169,排在 267 個模型前面;Sol 162、Fable 5.1 163。Artificial Analysis 測知識、編程和閱讀,Intelligence Index 把 Astra 打成 61,和它要取代的 Sol 同一分,低於 Fable 5.1 的 66,也低於 Meta Muse Spark 1.3。Coding Agent Index 上 Astra 在 Codex 拿 67,大約齊平 Claude Opus 5 和 Fable 5;Fable 5.1 在 Claude Code 以 70 領先。AA 隔天推出 Index v4.2,把約 40% 權重改成私有留出題,說是為了降低被刷分;那一版裡 Astra 相對 Sol 出現約 4 分的差距,Fable 5.1 仍在最前。兩版不能直接當同一把尺。
價錢把畫面再扭一次。標準 API 每百萬 token 輸入 10 美元、輸出 50 美元,是 Sol 的 2.5 倍。AA 量到 max 檔單任務大約貴 75%,因為漲價吃掉省下來的 token。編程任務上反向:Astra 用約三分之一的 Sol token、約五分之一的 Opus 5 計算量,單任務成本可低於 Fable 5 一半。知識基準 AA-Omniscience 的幻覺率從 92% 降到 51%;長程知識工作大約漲 80 Elo。同一時期,經濟加權任務基準 GDPval-AA v2 掉了大約同等幅度的 Elo,銀行客服、科學 Python、長上下文窗口推理也有回落。Epoch 的 FrontierMath Erdős 上,Astra 是唯一在每題 300 美元預算內、用 Lean 證書解出 68 題裡兩題的模型;另外三題來自未標準化的加跑,算力燒過 22 萬美元,Epoch 說那不算進分數。
Astra 在數學、知識、陌生遊戲世界上領先的證據很多;編程綜合榜上仍是 Fable 5.1 在前。Epoch 目前只錄到 Astra 一筆編程分數,還是中等推理檔。誰「最聰明」取決於你先信哪一張表,以及那張表允不允許廠商自帶腳手架。
測滿分的是系統,賣給你的是模型
NVIDIA 先前用自家 AVO harness,把 Claude Opus 5 在 ARC-AGI-3 從約 30.2% 拉到公開集滿分,動作還少 12%。那篇經過已經寫在NVIDIA AVO 拉滿 Opus 5。The Next Web 點名 Anthropic、Google、Microsoft 都把 harness 當產品賣,各自標價。網路安全圈裡,CrowdStrike 用同一個詞描述包在 OpenAI 網路模型外面的那層;Booz Allen 自己的威脅榜也曾被便宜腳手架打亂。Adapter 用的是文件裡寫過、開發者可以呼叫的 API 功能,OpenAI 沒有把這層藏起來。99.9% 仍是「權重 + 狀態保留 + 壓縮 + 評測規程」加總後的數。你在價目表上能下單的,是 gpt-6-astra 這個模型名稱。
這層差別會進工作流。團隊若用官方 SDK 預設的狀態管理和對話壓縮,實測可能靠近 Adapter 那一欄;若自己用最小介面、自己決定要不要把中間推理寫進可見筆記,數字會掉回標準欄。採購合約如果只寫「基準 XX%」,卻不寫 harness、推理檔、檢查點和是否事後改過公開稿,買到的能力邊界是空的。開發者要核對的也不是「有沒有 99.9%」,而是自己這條管線有沒有在用同一套上下文管理;沒有的話,預算不該按滿分那欄去編。
對齊討論卡在同一條縫。Astra 被寫成迄今最對齊的模型,同時公司承認思維鏈可監控性相對 Sol 下降,隱蔽 sandbagging 很可能抓不到。評測看得到的分數、獨立實驗室核得過的分數、以及部署後誰也讀不完的內部狀態,三件事正在分開。基準只是最容易把這條縫畫出來的地方。
獨立實驗室之後還能追的,是公開頁還會不會再改、ARC 排行榜兩欄會不會被行銷稿重新合成一欄、以及 Fable 5.1 何時用同一套標準介面上 ARC-AGI-3。在那之前,62.7% 是跨廠商可比較的數,99.9% 是這套組裝系統在自己腳手架裡的數。兩筆都是 state of the art,只是不是同一件事。
