同一顆 Claude Opus 5,單獨去玩 ARC-AGI-3,公開成績大約三成;把它塞進 NVIDIA 的 AVO(Agentic Variation Operators)代理系統,公開集 Relative Human Action Efficiency 變成 100.00。技術部落格把這組對比寫死:25 個環境、183 關全過,環境動作 6,624 步。MIT 那邊的 VISTA 用同一顆 Opus 5 也全過,但花了 7,542 步。AVO 大約少 12%。
先把句子拆開。這不是「Opus 5 突然變聰明」,也不是 人工智能 通過某種 AGI 測驗。ARC-AGI-3 把 AI代理 丟進沒說明規則、沒給目標、沒給操作手冊的回合制小世界,它得自己試、自己改假設。RHAE 把「有沒有過關」和「相對人類首次嘗試少走多少步」綁在一起。滿分的意思是:在公開集上,這套系統把關卡清完,而且效率對得上該指標的天花板。
NVIDIA 自己也寫了不該被略過的句子:評估模型不是評估代理。模型能力很重要,但周圍系統決定能力能不能變成持續自主進度。New Stack 引述主導這篇的首席工程師 Terry Chen 同一段話。CryptoBriefing、AI Weekly、Runtime Wire 對過同一組數字。
公開集滿分,私有集空白
AVO 不是第一個把公開集打滿的系統。ARC Prize 社群榜上 Tycho 在七月底就報過 100%;VISTA 八月初也公開過完美結果。NVIDIA 這次多出來的,是「同一架構」從 GPU 核心優化跨到互動推理,以及比 VISTA 少約一成二的步數。
| 項目 | 數字 | 必須一起讀的限制 |
|---|---|---|
| 公開集 RHAE | 100.00 | 只覆蓋公開的 25 環境/183 關 |
| 環境動作 | 6,624 | 對 VISTA 的 7,542;非對照實驗 |
| 底模 | Claude Opus 5 | 另有 GPT-5.6 Sol 測試;推理檔位不同 |
| 單模基準 | 約 30%/30.2% | NVIDIA 警告設定不同,不能當乾淨消融 |
| 私有集 | 未測、未交官方榜 | ARC Prize 留私有集防過擬合 |
| 程式碼/權重 | 未釋出 | 研究貼文,不是可部署產品 |
Runtime Wire 寫得更直:AVO 用了私有重做的任務介面,沒交官方私有排行榜。公開基準可以被針對調參;私有集才是「沒看過的規則」那一關。NVIDIA 也承認和 VISTA 的比較不是受控實驗——記憶設計、觀察格式、代理後端都不一樣,12% 是交叉系統對照,不是實驗室裡只改一個變因。
30% 拉到 100% 這條標題很好傳播,也最好先打折。NVIDIA 明講兩套評估的推理設定與代理系統差很多,不應讀成「套件單獨貢獻了 70 個百分點」。能確定的只有:沒有記憶、監督與執行迴圈時,Opus 5 在這個互動基準上離滿分很遠;加上它們之後,公開集被打滿。中間那截功勞,現在沒有可複現的消融表。
套件裡到底多了什麼
AVO 三月就以通用編程代理系統露面,這次把架構拆開。核心不是換一顆更大的 大型語言模型,而是三件讓長程任務不散掉的東西:持久記憶、停滯偵測監督、以及「假設—行動—觀察—修正」的迴圈。代理常死在同一策略上空轉;監督層專門抓這種停滯,把跑丟的回合撈回來。環境互動才是貴的那一截,少走 918 步在真實系統裡會變成帳單與延遲。
任務介面有一部分沿用 VISTA 的直接行動設計,沒有另做世界模型。NVIDIA 寫這比較符合「通用」目標。VISTA 把套件接到 Claude Code 或 OpenAI 的 Codex;AVO 用自己的執行迴圈。底模可以是 Opus 5,也可以換 GPT-5.6 Sol,但公開滿分那一跑,官方指名 Opus 5。
同一套架構先前拿去優化 GPU 核心:七天自主迴圈、探索超過 500 個方向、提交 40 個核心版本,在 DGX B200 上相對 cuDNN 最高約 3.5%、相對 FlashAttention-4 最高約 10.5%。這段不是 ARC-AGI-3 的附贈彩蛋,而是 NVIDIA 想證明的命題:長程自主不只會打遊戲基準,也能在自家硬體棧上產出可合併的程式。
讀這張圖時記得:中間那層 NVIDIA 沒開源。你現在買不到「AVO 產品」,也沒辦法把自家模型插進去複跑。能複用的是論點——智能體工作流 的護套,已經大到能把同一顆旗艦模型的公開成績從不及格改成滿分。
對採購與開發者工作流的意思
企業若還在用「哪家旗艦模型分數最高」做唯一標書條件,這份結果會讓標書過時。VISTA 和 AVO 用同一顆 Opus 5 都能打滿公開集,差在步數與記憶。買模型的帳單和買套件的帳單開始分家:權重商繼續比 API 單價,套件商比能不能在長任務裡少浪費環境步與 Token。NVIDIA 同時賣加速卡、賣推論棧、也寫代理研究,這讓它有誘因把「分數來自系統」講得很響——買家若接受這套敘事,價值會從權重授權滑向平台與護套。
開發者這邊更具體。你在本機或雲端跑長任務時,失敗模式通常不是模型「不夠聰明」,而是迴圈沒有狀態、沒有停滯檢測、沒有可檢查的工具層。這和站內先前寫過的 Nemotron 3.5 Lightning 是同一條產業軸:執行層與路由層被單獨產品化。差別是 Lightning 給了權重與 GGUF,AVO 只給論文式部落格。想驗證的人,目前只能等第三方在官方私有集上複跑,或等 NVIDIA 把介面與紀錄公開到可檢查的程度。
風險也清楚。公開集飽和之後,基準本身失去分辨力。社群已經在等 ARC-AGI-4。在新基準出來前,任何「100%」都該被讀成「這張舊卷被寫滿了」,而不是「推理問題被解決了」。另一個風險是安全:能連續 183 關自我修正的系統,同樣能在給錯目標時連續自我修正。NVIDIA 另文討論可信代理棧與 OpenShell,等於承認能力論文和可強制執行的邊界不是同一份文件。這和 OpenAI 把前沿強化學習踩煞車 的背景疊在一起:實驗室一邊把代理跑得更久,一邊被要求證明跑得住。
ARC-AGI-3 的遊戲長什麼樣子,值得多講一句。代理面對的是網格世界:規則、得分方式、哪些格子能走,全部要靠試探。人類第一次玩也會亂按;RHAE 就是拿代理的步數去對人類首次基準。這和靜態考卷不一樣——靜態考卷可以靠預訓練背到答案,互動基準比較像「給你一間沒標示的實驗室,自己找出哪條管線是瓦斯」。公開集被打滿,代表這間實驗室的平面圖已經在網路上流傳夠久,套件可以針對它調。私有集才是換一棟樓。
NVIDIA 同期還有另一套叫 NOOA 的護套研究,在 SWE-bench Verified、CyberGym 與 ARC-AGI-3 上談可重現工作流與較低 token 成本。那是另一條產品化路徑:把世界模型、記憶、技能寫成可檢查的組件並開源測試方法。AVO 這次反過來——架構講得很滿,程式一件都沒放。兩種策略對開發者的含義相反:NOOA 類你可以 fork;AVO 類你只能把結論買回去當簡報。採購時把這兩種「100 分」當成同一種東西,會買錯。
GPU 核心那段也別只當彩蛋。七天、五百個方向、四十個版本、相對 FlashAttention-4 最高 10.5%,這是把 自主智能體 接到 NVIDIA 最在乎的軟體護城河上。核心優化有明確獎勵(毫秒、占用率),ARC-AGI-3 的獎勵比較糊(過關加效率)。同一套記憶與監督能跨兩種獎勵,這才是「通用」主張的核心證據。缺的是失敗帳:五百個方向裡有多少是空轉、監督層打斷了幾次、有沒有把錯誤核心提交進生產編譯。部落格沒給。
社群爭議會落在三處。第一,滿分通膨:Tycho、VISTA 已經先打滿公開集,再發一篇 100 分比較像基準死亡公告。第二,底模品牌:公開滿分跑用的是 Anthropic 的 Opus 5,不是 NVIDIA 自己的 Nemotron。賣卡的公司用對手的旗艦模型證明套件有用,商業上很合理,敘事上卻會讓「NVIDIA 代理系統」聽起來像自有模型勝利。第三,安全外部性:長程自我修正在給定錯誤目標時同樣有效。可信代理棧那篇平行文章等於官方自己把這句話寫出來了。
和 Nemotron 3.5 Lightning 對讀,還能看出 NVIDIA 在代理棧上同時打兩張牌:一張是開源小 MoE 執行層,給得起權重與 GGUF;一張是封閉的長程護套研究,只給結論。買卡的客戶會被兩張牌同時追——本地要跑得動執行層,雲端簡報上要看到 100 分。IT 與研究部門若各簽各的,最後會出現「執行層用開源、規劃層用 Opus 5、護套用自家拼裝」的三頭馬車,帳單與責任邊界都會糊。AVO 沒有解決這個糊,它只是把糊寫成論文。
若你在評估編程代理或內部研究代理,現在最有用的驗證不是再看一張公開集截圖,而是要供應商回答四句話:私有或內部任務集的成績是多少、失敗時監督層實際打斷了什麼、這套護套能不能換底模而不用重寫、以及環境動作與 token 帳單能否分開審計。答不出來的 100 分,只是公開作業的滿分。基準會換;護套會留下發票。公開集的死亡證明已經開好了,下一張考卷才會重新分開這些系統。
