返回資訊
AI趨勢入門

DeepMind 校友實驗室 Inherent 的 Faraday:27B 代理在論文復現上自稱勝過 Opus 4.8 與 GPT-5.5

2026年8月23日
易賺Ai團隊
11 分鐘閱讀
#OpenAI#Anthropic#科學研究#強化學習#AI代理
DeepMind 校友實驗室 Inherent 的 Faraday:27B 代理在論文復現上自稱勝過 Opus 4.8 與 GPT-5.5

倫敦實驗室 Inherent 剛從隱身狀態走出來不久,種子輪 5000 萬美元,核心是 Google DeepMind 校友。它把一顆 270 億參數的科學代理命名為 Faraday,官方研究頁與 arXiv 稿寫:在論文圖表復現任務上,勝過 Claude Opus 4.8 以及 OpenAI 的 GPT-5.5(他們把後者稱為 Codex 基線)。TechCrunch 把這則對比寫成「用小得多的模型打敗更大、更有名的系統」。句子要立刻加上括號:對照組、評分裁判、任務集,都是 Inherent 自己做的。

Replica 是他們為 強化學習 建的任務空間。初版 310 個任務,來自 100 篇機器學習與 AI-for-science 論文,領域從自然語言、材料到天氣預報。arXiv 把切分寫成 242 個訓練任務、68 個測試任務。每個任務要代理在時間與算力預算內,復現論文裡一張被塗掉的結果圖,而且看不到原圖。訓練任務偏 1990 到 2026 的 ML 論文;測試任務偏 2012 到 2026 的 AI-for-science,用來主張不是背題。時間上限 60 分鐘,硬體是 H200 的七分之一 MIG 切片,環境在 containerd 容器裡,預裝研究函式庫、能上網、有 Codex 二進位。

數字是這樣報的。分布內 ML 任務,Faraday 在 73% 的任務上勝過 Claude 與 Codex 基線;留出的科學任務是 60%。測試切分平均比 Claude 高約 6 個百分點、比 Codex 高約 8 個。裁判是依任務自動生成的評分表,再用多次取樣聚合;他們做了與人類專家排序的一致性檢查,用來主張這套 LLM 裁判比「直接讓模型打分數」噪音低。官方還寫:人類專家在裁判判定 Faraday 占優的 rollout 上,也傾向認為它比較強。行為差異被寫成比較像人:實作主張背後的機制,而不是把輸出寫死;在資源不夠時按論文範圍縮小實驗,而不是走讓自己分數好看的捷徑。

底模是 Qwen3.6-27B,用帶 turn-level credit 的 GRPO 變體後訓練。這和站內 Qwen3.8-27B 本地多模態 不是同一顆權重,但同一量級:消費級可討論的稠密模型,被拿去當「科學判斷層」。Faraday 的關鍵設計不叫更大,叫 coding agent as a tool(CAT):它像人類研究員呼叫寫程式助手一樣,把 GPT-5.5 Codex 當工具。論文估計被指揮的那顆模型約 5 兆參數量級,而指揮的是 27B。他們還寫測試時可換更強的編碼代理、不必重訓底模;訓練時用過較小的 Codex 變體,測試能適配 GPT-5.5 Codex。

這段「小指揮大」是整則消息最容易被誤讀的地方。Faraday 沒有在公平的同工具條件下,單靠 27B 打敗 Opus 4.8。基線是把 Opus 4.8 放進 Claude Code、把 GPT-5.5 放進 Codex,思考力開到 extra high;Faraday 自己的套件更瘦,但手裡握著 Codex 工具。AI Chat Daily 把這點寫成對參數對參數比較的污染。Inherent 的回應會是:重點本來就不是參數,是後訓練讓小模型學會「研究品味」,再去調度已有的編碼勞動。若你接受這套框架,27B 贏的是科學判斷;若你不接受,27B 只是比較會下單的專案經理,真正寫程式的還是那顆大模型。

宣稱官方數字還沒被獨立複跑的部分
分布內勝率73% 的任務贏過 Claude/CodexReplica 與評分表未見第三方重跑
留出勝率60%留出集仍是自家抽的論文與圖
平均分差+6% vs Claude、+8% vs Codex量尺是評分表裁判,不是可執行單元測試
底模Qwen3.6-27B與被調度的 Codex 不是同一計算預算
種子輪5000 萬美元實驗室約十餘人,年底目標 20–25 人

聯合創始人兼首席科學家 Edward Hughes 把北極星說成打造 AI 科學家代理。共同創始人 Tantum Collins 做過拜登政府 AI 政策。研究頁用 1821 年 Michael Faraday 為了寫綜述親手重做電磁實驗、意外做出電動機的故事當引子:復現不是抄圖,是補論文沒寫的 99% 汗水。方法論上,他們反對把科學做成可爬山的固定獎勵基準,認為那種創新難以遷移;改用評分表裁判做長程、不可嚴格驗證的任務。這讓訓練能跑,也讓外界很難在沒有同一套評分表時複現「贏了 8 個百分點」。

安全段落很短:他們說在研究如何把方法用到可擴展監督、減輕獎勵駭入,並強調人仍在迴圈裡。Faraday 的容器能上網、有編碼代理、有 GPU 切片,這和近期評測環境外洩是同一類權限組合,只是目標從「找漏洞」換成「復現圖」。實驗室沒有把這層對上 Guidelight 式的遏制劇本,也沒有公開失敗案例。

任務是怎麼自動長出來的,決定這套基準能不能被外人信任。論文寫三個視覺語言階段,由 Gemini 2.5 Pro 驅動:掃描正文結果圖與圖說、在驗證迴圈裡框出位置、再把圖從 PDF 不可逆塗掉。人工再過濾塗得不夠、根本不是結果圖、或圖說對錯的題。每篇論文貢獻 1 到 13 題,中位數 2。獎勵不是「像素級複製原圖」——他們強調完美重畫不等於成功復現,還要實驗設計、科學規範、對原論文主張的忠實、以及資源使用。這讓評分表變得必要,也讓「贏 8 個百分點」變成一種品味分數,而不是單元測試綠燈。

領域切面上,官方寫 Faraday 在元學習、結構生物學與材料科學的優勢特別明顯,對近期論文的掙扎比基線小,並主張這表示科學技能遷移到了預訓練沒見過的工作。這句話的力度取決於留出集有多「沒見過」。知名論文容易被人類評分,也容易進過底模語料。他們在附錄討論汙染,外界還沒獨立複核。另一個方法論選擇是:時間與 GPU 不夠時,提示改要求「最忠實的縮小版實驗」。這測的是理解,不是硬把原論文的大型訓練跑完。優點是任務可擴;缺點是縮小版可以很巧妙地避開原論文真正貴的那一步,裁判若沒抓住,分數會偏高。

人員與機構規模要放回句子裡。King's Cross 約十餘人,年底目標 20 到 25,還要挖 DeepMind 人。5000 萬美元種子輪對這個規模算厚,對「訓練會調度前沿編碼代理的科學層」這種算力胃口又不見得厚。Faraday 每次復現都在燒 Codex 工具時間加 H200 切片,推論成本不是 27B 單獨能代表的數字。把 27B 拿來對 Opus 4.8 的電費,會漏掉工具那一截。這和 NVIDIA AVO 其實是同一類主張換了實驗室:分數來自系統(這裡是後訓練的科學層加編碼工具),不來自單顆權重的參數表。

把 Codex 當工具,還帶來一層可擴展監督的想像:小模型負責「這實驗該不該做」,大模型負責「程式怎麼寫」。Inherent 說這可能減輕獎勵駭入,因為科學層被單獨訓練去在乎忠實,而不是去把圖湊得像。這是研究方向,不是已證明的安全性質。裁判本身也是模型,評分表是模型產的,訓練信號經過兩層模型。循環很漂亮,也很容易變成模型互相打分數。他們用人類排序做校準,這是最低限度的錨;錨的樣本數與領域覆蓋,論文外的人還沒被邀請複核。

若你在研究機構或量化團隊評估「AI 科學家」,現在不該把 73% 寫進預算附件當已驗證事實。該要的是:任務 PDF 與評分表能否外流、Claude/Codex 基線的原始 rollout 能否下載、把 Codex 工具拿掉之後 27B 還剩多少、以及縮小版實驗有沒有被裁判當成完整復現。答得出來,這才是 27B 科學層的證據;答不出來,就只是一則深具敘事魅力的種子輪研究稿。它和 Claude 代理自己裝工具做蛋白質結合體 可以並讀——一邊是前沿實驗室把代理送進濕實驗,一邊是小實驗室主張科學品味可以後訓練進小模型——但兩則都還沒被對手用同一套題複跑。創新仍被他們自己寫成下一步,不是這次已經交付的東西。這次交付的是復現,以及一套聲稱可擴的評分表。沒有獨立複跑之前,27B 打敗旗艦的標題,只該當假設。