返回趨勢情報
趨勢情報

NVIDIA 開源 SoL-Pi:152 個想法只活 4 個,token 少近半,Terminal-Bench 4 卻少解 3 題

2026年9月12日
易賺Ai團隊
18 分鐘閱讀
#NVIDIA#開源#ai代理#token#harness
NVIDIA 開源 SoL-Pi:152 個想法只活 4 個,token 少近半,Terminal-Bench 4 卻少解 3 題

NVIDIA 研究部門把一套叫 SoL-Pi 的編碼代理外殼放到 GitHub 上,安裝指令只有一行:把外掛接到現有的 Pi。官方頁面寫得很白:先別急著讓 AI 變聰明,先讓它少燒 token。專案頁、倉庫與中文技術媒體轉述的數字對得上:152 個候選方向送進自動研究迴圈,最後留下 4 個機制;對比原版 Pi,token 用量少 45% 到 49%,帳單大約便宜三分之一,平均分數大約留 94%。對比 Codex、Claude Code 原配外殼,token 少 35% 到 64%,按官方 API 標價算,成本低 50% 到 54%。專業研究場景下,對比原生 Codex 與 Claude Code 外殼,每小時可省 8.75 到 13.50 美元;對比 Pi,每小時省 4.36 到 5.71 美元。

這不是新模型發表會。權重沒換,計價表沒改,旗艦分數也沒被重寫。被改的是外殼:模型什麼時候該再問一次自己、什麼時候該把大檔案收進本地、什麼時候該把編輯和測試併成一次呼叫。韓松領軍的 Efficient AI 團隊把這套流程寫成可複製的自動研究迴圈,人類先丟先驗、篩掉沒探索價值的方向,迴圈自己跑完實作與驗證,活下來的機制再由人整理成可維護的程式。倉庫在 NVlabs/SoL-Pi,專案頁在 nvlabs.github.io/SoL-Pi

Spend less without getting less done.

官方標語這樣寫。同一份結果表也寫了另一句比較難聽的話:能力門檻允許小幅損失累積,組裝後的外殼大約只留 Pi 平均分數的 94%。省錢成立,少做一點也被寫進去了。

152 進、4 出,其餘全部被驗證殺掉

SoL-Pi 的底盤是 Pi,一份輕量、可擴充的編碼代理外殼,NVIDIA 拿它當研究基板。評測用的長程套件叫 EdgeBench,51 題、可執行、軌跡往往跑數小時;任務、驗證器與回饋都留到最後才打開,不當搜尋材料。訓練環境另外建了 535 個:495 個從 GitHub 的 issue 與 pull request 對挖出來,還原到修復前的 commit,把維護者的回歸測試藏起來,只留下「修前失敗、修後通過」的環境;另外 40 個是驗證器驅動的合成題,風格接近 Terminal-Bench,但不用 EdgeBench 的題目或驗證器當模板。

搜尋方式不是讓一個 AI 代理反覆改同一段外殼。外層把 152 個方向拆成獨立譜系。上線前有一道 Oracle Analysis:用既有軌跡估機會,沒潛力的先淘汰,免得把 rollout 預算燒在空方向上。每個被選中的方向要講清楚「外殼裡哪一段是可避免的工」,講不清楚就整條譜系出局,其他譜系繼續跑。

譜系內部跟 Andrej Karpathy 常講的自動實驗迴圈很像:提案、實作、跑實驗、讀結果、留下或丟掉,再重複。NVIDIA 做了三處改動。實作跑成 Ralph Loop,直到明確的退出條件通過;另派一個審查代理核對行為契約,審不過就退回改。多條探索軌跡用 map-reduce 處理,各看各的,再由 reducer 合併證據。驗證切兩段:訓練集只負責篩選,機制與接受規則一凍結,就拿到完全隔離的 held-out 集合打分;held-out 軌跡不准回流分析,迴圈裡也沒有代理看得到 held-out 結果。held-out 不及格,凍結候選直接淘汰,不會拿來當下一輪修理材料。

轉換率很低。官方自己算,大約每 40 個起始想法才活 1 個。152 進、4 出,剛好落在這個區間。團隊寫過一個觀察:就算把 GPT-5.6 Sol 開到 xhigh,單條譜系跑五到十輪之後,模型容易卡在局部盆地,只會對同一個設計做小幅調整。改成廣度優先之後,多數想法一樣死,但偶爾會冒出一個方向怪異、後來能被實作並硬化的候選。那些跳躍,構成這次最有用的外殼改動。

編排方式也換過三次。一開始是 YAML 編成固定工作流,交接清楚,但邊角案例一多就要人進去修,幾百條並行嘗試的上下文還組不起來。後來改成主代理寫協調程式,執行時組工作流,固定圖沒了,協調器自己變成無底洞,開一輪新實驗可能要改十小時以上的分支與測試。最後留下的是一次性技能迴圈:只維護一份最小模板,每次實驗複製、設參數、跑完、丟掉改過的協調程式。擴展變成反覆實例化模板,而不是讓一份協調器無限變肥。代價也很清楚:模板錯,所有實驗一起錯。團隊認為這一項共享依賴,仍比固定圖或無限膨脹的協調器好維護。

活下來的不是更聰明的模型,是四個專治重複勞動的機關

四個機制對應工具、上下文、觀測壓縮,以及多代理委派。它們不改模型權重,只改外殼在長軌跡裡怎麼省重複工。

Action Fusion 處理一個反覆出現的序列:代理改完檔案,下一輪幾乎一定再發一條指令去測、編或跑。Oracle Analysis 量過,這種「編輯/寫入之後立刻接指令」的跨輪候選,佔交叉輪轉換的 12.3%,其中 85.1% 的下一步是 bash。融合之後,外殼在本地套用編輯並執行指令,一次回傳合併後的觀測,中間不再請模型做一次決策。提示與 schema 搜了十個批次,觸發率從 28.3% 拉到第 10 輪的 100%,任務分數 87.0。若當時觀測到的 149 個跨輪候選全部觸發,模型輪次會從 1,386 降到 1,237,少 10.8%;總 token 從 3,238 萬降到 2,864 萬,少 11.5%。這是軌跡反事實,不是重跑實測。

Online Context Compact 改的是壓縮時鐘。常見做法是把壓縮盡量往後推,好保住 KV 快取 前綴。這套機制把任務拆成子任務,子任務一結束就重新評估要不要壓;只有預期未來省下的量能回本這次改寫,才真的壓。它不是「越早摘要越好」,而是「語義邊界出現時,先算帳再決定」。

ObservationPack 處理大檔與長輸出被反覆貼進後續請求的問題。原版 Pi 會讓同一份大觀測在之後每一輪都佔上下文與快取。新機制把本體存本地,上下文只留一個穩定句柄和短摘錄,真要看某一頁再召回。EdgeBench 上成對 A/B:回應次數只差 0.20%,供應商帳單少 23.58%,每次回應成本少 23.73%,正規化分數反而高 22.92%。省的是重複傳送,不是少回幾次。

Evidence-Preserving Reducer 把長日誌的第一輪閱讀交給較便宜的代理,但收據必須能對回封存日誌:被引用的每一行都要核對,通過才准送到前沿代理眼前。委派不再等於相信一段流暢摘要。官方強調,這是在「讀」這個邊界上省錢,不是讓小模型代替大模型做最終判斷。

能力門檻寫進搜尋目標裡。每個迴圈要過兩道閘:所有能力指標都得落在預先宣布的容差內,且至少一項效率指標變好。過關的候選裡再留非支配解。閘是逐個機制算的,小損失組裝後會累積,這就是 94% 從哪來。被排除的是靠提早收工、跳過必要驗證、或刪掉收尾所需證據換來的便宜。

數字對得上的地方,與對不上的地方

所有對照都把模型後端開到 xhigh,也就是這次評測裡最高的推理力度。EdgeBench 上,SoL-Pi 在兩個後端都大約留住 Pi 平均分數的 94%;接 GPT-5.6 Sol 時,分數還高過該模型原配的 Codex 外殼。效率差距更大:對 Pi,token 少 45% 到 49%,成本大約少三分之一;對模型原配外殼,token 少 35% 到 64%,標價 API 成本低 50% 到 54%。

Terminal-Bench 4 是另一張表。NVIDIA 在內部基礎建設跑得動的範圍內,評了 63 道只走 CPU 的題;需要 GPU、又要長時間執行的題被排除,因為當時用得到的內部叢集撐不住那種執行。

外殼解出總成本(美元)每題已解成本(美元)
Codex18/63272.3515.13
Pi18/63286.4515.91
SoL-Pi15/63211.1214.07

解題數少 3 題,總帳單也低。每道已解題的成本,SoL-Pi 仍略低於另外兩套。這張表不能讀成「更便宜且一樣強」。它讀成:在這 63 題、這套計價假設下,外殼用較少 token 換到較少成功,單題已解成本沒有惡化。GPU 題沒跑,樣本不是完整的 Terminal-Bench 4。

獨立第三方也不是這週才開始量外殼價差。比利時 imec 的 aistack 團隊先前用同一組開源模型換 Codex、Claude Code、Pi,已經量過:外殼一換,輸入 token 可以差到一倍,Token 計費 帳單跟著走,解題數幾乎不動。SoL-Pi 把這條線從「換外殼會改成本」推進到「外殼自己能被 AI 搜出可複用的省 token 機關」。它沒有推翻「外殼會左右帳單」這件事,它給了一個可下載、可複現的搜尋程序。

二十個工人不一定比較強,便宜的工人才比較強

官方另外做了一場集體搜尋。題目是 Anthropic 原版的 performance take-home:最佳化一段核心,用模擬機器週期計分。配置是一個 GPT-5.6 Sol 協調器跑在 Codex 裡,指揮 20 個 GPT-5.6 Luna 工人,全部 xhigh。工人分成五組、每組四個,各有獨立工作區與本地證據板,走的是 多智能體 搜尋而不是單線對話。SoL-Pi 裝在 Pi 工人裡,協調器維持 Codex 代理。同組可要求同伴複現或合併有希望的發現;跨組洞見由協調器傳遞;共享最佳結果只有在協調器請求接受、且獨立檢查確認嚴格改進之後才推進。

三次獨立兩小時試驗,同一份凍結起點:單代理 Sol、Sol 加 20 個原版 Pi 工人、Sol 加 20 個 SoL-Pi 工人。兩個對照依序跑,單代理在前。每次都是新 session,不帶前次解答或筆記。

配置週期(愈低愈好)模型成本(美元)速度門檻
Sol + 20 個 SoL-Pi1,12760.118/8
單代理 Sol1,33339.208/8
Sol + 20 個原版 Pi1,36682.127/8

SoL-Pi 集群相對原版 Pi 集群,週期少 17.5%,成本低 26.8%。單代理仍然最便宜,39.20 美元,但停在 1,333 週期。人多本身沒有比較強:原版 Pi 集群比單代理更貴,成績還比較差,最後一檔速度門檻也沒過。正式分數史上,SoL-Pi 接受 35 次改進,單代理 29 次,原版 Pi 44 次;送審候選分別是 494、29、460。候選不是工人做過的全部本地實驗。成本按各模型 Standard API 價重算,含快取輸入、原生壓縮與 SoL-Pi reducer 呼叫。Sol 與 Luna 單價不同,推理 token 已計入輸出。

限制被寫在同一節。每種條件只跑一次,不是隨機化試驗。SoL-Pi 那次因網路與授權停過三次,停機修理時間不計入兩小時預算,降級執行區間仍計入。對照組從已修好的配置開始,並明確關掉原生 Codex 記憶、外掛與額外子代理。這些差異加上沒有重複試驗,官方自己說無法對 SoL-Pi 的效果做因果估計。

對開發者來說,能核對的安裝路徑仍是官方那一行:在已有的 Pi 上執行 pi install git:github.com/NVlabs/SoL-Pi。它不是把 Codex 或 Claude Code 一鍵換成 NVIDIA 外殼,而是給 Pi 加一層效率外掛。要不要把生產工作流整份遷過去,官方沒給遷移指南,也沒公布對企業合約價的折算。

這週的自我改進辯論,實驗室已經有人拿外殼在跑

同一週,業界把「遞迴自我改進」講得很響。OpenAI 研究部門先前公布,人均已有 3.1 個代理工作日;首席科學家寫過,還沒有實驗室把對齊與監控做到足以再以最高速度負責任地擴展。Anthropic 研究員離職公開信把兩家實驗室寫成直奔自我改進超級智能。NVIDIA 這份專案沒有加入那一場表態戰。它做的是比較窄的工程:一旦編碼代理能改複雜軟體,它也能改「生產 AI 的系統」;但每次嘗試都要付 token,失敗也要付。SoL-Pi 的提問是:在把自我改進的預算拿去改模型之前,要不要先讓 AI 把外殼變便宜。

人類角色被寫成混合迴圈,不是全自動。人提供外殼原則與機制的先驗,擴張想法池之前先濾掉對本專案探索價值有限的方向,例如對底座外殼超參數的搜尋。想法一旦進迴圈,研究與驗證不再插入人工。候選活下來之後,人再回來理解機制,把代理寫出的程式重構成可維護實作。團隊把「完全自主的遞迴自我改進是不是終態」留成開放問題,理由也很具體:開放迴圈裡,目標、證據或實作一飄,可以在人發現之前疊加,後果不一定可逆。

下一階段有兩個名字。一個叫 pretraining the harness:部署前讓外殼搜尋看見不斷擴大的自產任務與環境,只留能在那份分布上活下來的機制。另一個叫 efficiency for efficiency:更省的外殼可以降低下一輪自動研究的單次成本,固定預算就能覆蓋更多環境、軌跡與想法。官方把它寫成長期研究願景,不是這次已經量到的複利。Astra 發表後,外殼對基準分數的影響已經被單獨拿出來改過一次公開數字;SoL-Pi 把同一條線索從「外殼能灌分數」轉成「外殼能被搜成可複用的成本機關」。兩者都還不是新的 大型語言模型

開發者現在能做的核對很短。第一,在自己的長任務上重跑 Pi 與 SoL-Pi,看 token、帳單與成功率是不是往同一方向走,不要只信 EdgeBench 的 94%。第二,Terminal-Bench 4 這類硬終端題,先假設可能少解幾題,再決定能不能接受。第三,集群試驗只有一次、條件不對稱,不能拿 1,127 週期當採購依據。第四,GitHub 上的是外殼外掛,不是模型權重,授權與依賴以倉庫為準。省 token 已經有公開數字;少做一點,也被寫在同一頁。