108 道題,一題大約要熟練的人做一個小時。榜首 GPT-6 Astra 過了 72.6%。也就是大約每四題,有一題在 500 步預算內走不到完全正確的終點。
這不是哪家實驗室自己出的「電腦操作大升級」示範片。OSWorld 2.0 由香港大學 XLANG Lab 做,原版 OSWorld 2024 年進 NeurIPS,2.0 拿 Snorkel AI Open Benchmarks Grants 支援,環境釘在 osworld-v2-2026.08.08。Miraflow 把目前公開榜單攤開來寫的那天,前三名擠在 6 分以內:Astra 72.6%、Claude Opus 5 70.6%、Meta Muse Spark 1.3 66.9%。黃仁勳與 Brockman 用 AGI 這個詞 講世代。這張榜講的是滑鼠、分頁、試算表,以及一小時後代理還記不記得自己三步前勾過哪一格。
短任務測得出點擊,測不出一小時後的狀態
原版 OSWorld 把代理放進真實作業系統,用滑鼠鍵盤做事,而不是走專用 API。它撐了大約兩年。任務平均不到 30 步,短到只要短程規劃和點擊夠穩,分數就能看起來能看。2026 年中,模型開始把它灌飽,1.0 分不出「還不錯的代理」和「真能託付一小時工作」的差別。
2.0 把短任務設計整份換掉。108 道長工作流,來自真實專業工作,不是合成玩具。七個領域、21 個子類:研究、創意製作、工程、個人服務、商務與財務、行政與合規、醫療流程。題目作者用真實文件和資料夾結構,故意留下格式不一致。評分因此變難:只核對某一個儲存格的精確值,一碰到真實發票版面差異就會崩。
兩項工程選擇把這份基準和「把短任務串長」分開。環境改成自架、版本釘死的容器。1.0 有一部分對著線上網站跑,版面一改、cookie 橫幅一出、網站掛了,三月能過的題七月會無聲失敗。2.0 把任務定義和閘控資產拆成兩份版本化發行物,從 xlangai/osworld_v2_tasks 與 xlangai/osworld_v2_assets_gated 分開拉。單機用 Docker,公開榜那種二十個模型並行則走 AWS,一題一個容器。
第二項是評分。短任務可以問檔案在不在對的資料夾。一小時任務有幾十個合法中間態,只留一個通過/失敗會丟掉幾乎所有資訊。2.0 並排報兩個數:
- 二元完成率:500 步預算內,終點必須完全正確才算成功。
- 部分分數:每題平均 27.25 個驗證檢查點,約 11.53% 用模型輔助核對而不是精確比對,做對的段落仍給分。
獨立追蹤把差距寫得很刺。Claude Opus 5 的二元完成率 31.43%,部分分數 68.31%,嚴格尺和寬鬆尺差超過一倍。中位數題目上,它做對大約三分之二的實作,但走到完全可核對終點的題不到三分之一。研究助理流程裡,人會把 80% 完成的草稿收尾,這時部分分數比較有用。無人值守去接付款或送監管表單,68% 正確但終點不對,對那個用途就是錯。
榜單:前三名擠在一起,第九到第十是斷崖
公開板目前追蹤約 20 個模型。數字來自 BenchLM 與 Miraflow 彙整的獨立榜,和 OpenAI 自己報的 OSWorld 2.0 離線分數並不完全同一套對照組。Astra 的 72.6% 兩種來源對得上。Sol 與 Opus 5 對 Astra 的相對位置,官方表和獨立板有出入,下面分開寫。
| 名次 | 模型 | 公司 | OSWorld 2.0 |
|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 72.6% |
| 2 | Claude Opus 5 | Anthropic | 70.6% |
| 3 | Muse Spark 1.3 | Meta | 66.9% |
| 4 | GPT-5.6 Sol | OpenAI | 62.6% |
| 5 | Gemini 3.8 Flash | 59.0% | |
| 6 | GPT-5.6 Terra | OpenAI | 50.2% |
| 7 | Gemini 3.7 Flash | 47.9% | |
| 8 | GPT-5.6 Luna | OpenAI | 45.6% |
| 9 | Claude Fable 5.1 | Anthropic | 41.7% |
| 10 | Claude Opus 4.8 | Anthropic | 20.6% |
前三名差不到 6 分。第三名到第十名差約 46 分。獨立基準上,沒有一家實驗室把電腦操作跑成獨走;這和任何單家自己報的基準套件讀起來都不一樣。Fable 5.1 在編程與快取價上很兇,這張長任務電腦操作榜上只到 41.7%。Gemini 3.8 Flash 導入價仍是每百萬 Token 0.75/3.75,OSWorld 到 59.0%,夾在 Sol 與 Terra 之間。Muse Spark 1.3 的 Artificial Analysis 指數追平過 Sol,這裡以 66.9% 進前三。
第九到第十是斷崖。Fable 5.1 的 41.7% 到 Opus 4.8 的 20.6%,幾乎腰斬。榜單解讀把它對上世代邊界:斷崖以上的模型在 2026 年上線,後訓練明確對準長程代理工作;Opus 4.8 以下還沒把「一小時、多應用、狀態會變」當設計目標。這不是說舊旗艦聊天或寫短代碼沒用,而是這項能力看起來比較像一次跳升,不是平滑爬坡。
再往下,阿里 Qwen3.8 Max 與 Qwen3.8-Flash-Next 幾乎並列 19.4%。推理和編程基準上能打的開源旗艦,在跨應用長任務電腦操作上仍落後一個世代。Kimi K2.6 與 MiniMax M3 並列 4.6%,兩者的產品敘事本來就偏便宜聊天與編程,低分比較像確認沒針對這項能力訓練,不像意外翻車。
官方表把時間也寫進去了,獨立板把對手寫進去了
OpenAI 自己的對照表給了另一組、對採購更有用的數字。DataCamp 引官方:Astra 在 OSWorld 2.0 離線集 72.6%、單題約 40 分鐘;GPT-5.6 Sol 65.7%、約 75 分鐘,時間少約 47%。同一張官方表把 Claude Opus 5 寫成 70.2%,和獨立板的 70.6% 接近,Sol 的 65.7% 卻高過獨立板的 62.6%。誰的 harness、是不是同一份 osworld-v2-2026.08.08、步數預算有沒有對齊,公開材料沒有逐列對帳。
能確定的是方向。電腦操作的瓶頸,官方敘事已從「會不會做」轉成「能不能又快又穩做完」。Astra 產品稿把它寫成原生 Computer Use:填表、改 CRM、整理行事曆、瀏覽蒐集、把研究寫進郵件或文件。OSWorld 把同一能力放進 108 道會互相踩狀態的題。領先模型平均每題約 318 次工具呼叫。分數往上走的模型,往往不是比較會規劃,而是用更多呼叫、重試、探索步把可靠度堆出來。從 60% 升到 70% 不是免費的,邊際正確率帶著非線性的推理成本。
Astra 上線稿 的 API 價是每百萬 Token 輸入 10 美元、輸出 50 美元,和 Fable 5.1 同一檔;Fast 模式再加倍。OSWorld 不報美元,但 318 次呼叫乘上長上下文窗口 的輸入,單題帳單會先打在工具呼叫次數上,再打在 Token 單價上。第二、第三名在原始正確率上只差幾個百分點,若你的約束是延遲或單題成本,榜首不一定是該上線的那個。
三種失敗方式,所有模型都中,不只榜尾
XLANG 團隊自己的失敗分析列出三個跨模型都出現的模式。
第一,二元完成率掉得比任務變長更快。直覺會以為步數加倍、出錯機會大約加倍。實際更差:早期一個本來可恢復的小錯,在 250 步任務裡有遠多於 30 步任務的下游步驟可以滾成不可恢復的分叉。這是 1.0 短任務系統性高估職場可靠度的主因。
第二,長會話裡的隱狀態會跟丟。分析寫出三種具體行為:把已經做完的步驟重做一遍、錯過先前步驟之後才改過的資訊、按已經過期的計畫執行後面的動作。名義上很大的上下文窗口,不會自動變成「此刻什麼是真的」的持續更新模型。多個應用程式、真實狀態在變的時候尤其明顯。
第三,正確率提升帶著不成比例的成本。較高二元分數與部分分數的模型,常常是用更多工具呼叫堆可靠度,不是規劃方式發生了類別差異。只按正確率排的榜,會把這個交換藏起來。
把三個模式疊進同一道商務財務題,路徑很短。對帳:打開試算表、交叉比對多張版面各異的發票 PDF、記住哪些列已經核過、發現後面一張發票讓前面記錄的數字必須重看、最後寫一封數字全對的摘要信。代理若在中途忘記核過哪些發票,要嘛重做、燒呼叫次數,要嘛以為核過而跳過,交出一份自信的錯誤摘要。二元評分會判失敗;部分分數仍可能顯示多數單筆對帳是對的。人在迴路裡,這叫「差最後一哩」。無人值守,這叫「帳平了但其實沒平」。
這張榜不能拿去證明 AGI,但夠拿去改驗收
72.6% 的意思很具體。就算接受獨立板的榜首數字,仍有超過四分之一的長任務,在 500 步內走不到完全正確終點。任何錯誤動作有真實成本的流程——付款、合規申報、改生產設定——都不能把「會操作電腦」讀成「可以放手」。
驗收若只用短任務,會重演 OSWorld 1.0 的高估。生產流程是十步以上、跨兩個以上工具,內部評測卻是單步點擊題,上線後的可靠度會系統性低於評測。監控若只記最終成功/失敗,會丟掉 Opus 5 那組 31% 對 68% 的診斷:失敗的代理究竟接近做完(值得加檢查點、重試),還是從頭就偏(該換方法)。狀態漂移既然是跨模型主因,週期性重新讀當前檔案或頁面,通常比在提示詞裡加「請更小心」有效。
分數來源也要拆開看。OpenAI 自報 72.6%、40 分鐘,對自己的前代有時間對照。獨立板把 Opus 5、Spark 1.3、Fable 5.1、Gemini 3.8 Flash 放上同一環境。採購合約若寫「電腦操作達到 Astra 水準」,至少要寫清:二元還是部分、哪個 release tag、步數預算多少、對手模型是否同 harness。否則 72.6%、70.6%、66.9% 可以同時為真,你買到的仍可能是那沒過的 27%。
對齊與監控那條線 講的是實驗室裡 Agent 已經在寫研究代碼。OSWorld 講的是同一類系統被放進真實桌面之後,仍會在一小時任務的中段把狀態跟丟。兩件事不互相取消。實習生可以在內部工具鏈裡達標,公開電腦操作榜仍顯示四分之一的長任務過不了終點。要驗證的下一個數字不是下一場發布會的形容詞,而是:二元完成率有沒有離開 70% 這段平台、部分分數與二元分數的缺口有沒有收斂、平均 318 次呼叫有沒有在正確率上升時降下來。缺口還在,榜首就還只是比較會做完一小時工作的模型,不是可以無人值守的同事。
