Cognition 工程師量過自己上一版 AI 編碼模型的壞習慣:SWE-1.7 在真正改檔之前,會先把程式庫讀得很深,第一次實質編輯的中位數落在第 48 步。SWE-2 的 medium 檔把同一個動作提前到第 18 步。少掉的不是參數量,是公司這次寫進 強化學習 獎勵裡的帳單。官方部落格日期寫 09.10.26,第三方報導有的記成 10 日、有的記成 11 日;能核對的產品事實是:SWE-2 已在 Devin Desktop 與 Devin CLI 上線,Web 與 Fusion 還在滾動釋出。沒有獨立 API,沒有每百萬 token 價目,也沒有開放權重。
頭條數字來自 Cognition 自己的 FrontierCode 1.1 Main:SWE-2 拿 50.0%,Claude Fable 5.1 拿 50.9%,公司說同一基準上便宜 64%。對自家 SWE-1.7,medium 檔分數更高、輪次少 58%、平均每題成本低 81%。DeepSWE 1.1 上 SWE-2 拿 73.0%,高過 Fable 5.1 的 67.4%,也高過 GPT-5.6 Sol 的 72.7%。Terminal-Bench 2.1 拿 92.8%,略高於 Fable 5.1 的 91.4%。同一張表的最後一列比較難看:Terminal-Bench 4 只有 27.3%,Fable 5.1 是 55.8%,GPT-6 Astra 是 57.9%,差距超過 28 個百分點。
它把整個成本—表現前沿往前推,而不是只推一個最貴的檔位。
這是官方對單一強化學習回合的說法。價目表不在這句話裡。64% 便宜指的是 Cognition 在 FrontierCode 上算的每題美元,不是你能拿到的公開 token 單價。
官方分數表,以及那一列不能當採購依據的數字
Cognition 把 SWE-2、Kimi K3、Grok 4.6、Fable 5.1、GPT-5.6 Sol、GPT-6 Astra、SWE-1.7 放在同一張表。公開分數能引用的就引用,否則用內部框架、各家主要外殼來跑:Anthropic 走 Claude Code,OpenAI 走 Codex,xAI 走 Grok Build,開放權重模型走 Devin CLI。每個模型取各推理力度裡最好的一檔。
| 基準 | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
FrontierCode 1.1 是 Cognition 自己的基準。DeepSWE 1.1 由獨立資料公司 Datacurve 出題,SWE-2 在這列勝過 Fable 5.1 與 Sol,最接近 Astra 的 74.1%。Terminal-Bench 2.1 已經接近飽和,各家擠在 88% 到 93% 之間。Terminal-Bench 4 把差距重新拉開:SWE-2 比 Kimi K3 多約 6 分,強化學習確實把底座往前推了一截,但距離 Fable 5.1 與 Astra 仍大約一半。公司沒有在發表文解釋這條落差。第三方拆過同一張表:被拿去當標題的是「差 1 分、便宜 64%」那一列,不是掉 28 分那一列。
成本軸同樣是公司自己算的。FrontierCode 圖為了可讀性拿掉 Fable 5.1 Max:該檔 50.3 分、每題 12.83 美元,低於 Fable 5.1 Medium 的 50.9 分、每題 3.28 美元。DeepSWE 圖拿掉 Fable 5 Max:69.7 分、每題 21.63 美元,低於 Fable 5 xhigh 的 69.9 分、每題 13.41 美元。換句話說,官方用來對照「64% 便宜」的對手檔位,並不是 Anthropic 最貴的那一檔,而是已經比較省的 Medium。Astra 在這張表上仍是多數列的前段,Cognition 的定位是:多數基準接近 Astra,成本大約四分之一。四分之一同樣是公司成本會計,不是 Astra API 標價除以四。Astra 公開標價仍是每百萬輸入 10 美元、輸出 50 美元。
SWE-2 沒有公開 token 單價,因為沒有 SWE-2 端點。帳單發生在 Devin 訂閱裡,模型、外殼、調度與服務棧捆在同一張發票。Pro 方案第三方記成每月 20 美元;公司同步開了一個月促銷,Pro、Max、Teams 訂戶可無限使用 SWE-2。這不是把 Fable 5.1 的 10/50 換成另一張價目表。想把 SWE-2 接進自建外殼、CI 或第三方路由的人,現在沒有門。社群反應裡出現過很短的一句:不想用你的 CLI,自己已經有外殼了。
先改檔,是獎勵函式改過的行為,不是突然變勇敢
官方把效率與智力寫成同一件事。判斷變好之後,代理比較知道哪些檔案跟任務有關,多餘的讀取下降,完整解法比較早出現。FrontierCode 1.1 Main 上,SWE-2 medium 比 SWE-1.7 分高,平均步驟更少。步驟被拆成探索、規劃、寫碼、建置、測、git、收尾。最大的效率來自「聚焦探索」:不是少做驗證,是少讀不相干的目錄。
內部測試還寫了三種行為。測試覆蓋比較能抓回歸與邊角,而不只是通過當下指定條件。正路被擋住時,比較願意在既有權限裡找另一條路;有一次需要的整合不可用,它改從已經能讀到的 Slack 頻道紀錄重建資料。被質疑時,它傾向重推結論,而不是把同一句話再說一次,並會跑產物蒐證,而不是信表面上的文字。
三個力度檔位的行為被寫成不一樣。medium 出手快,適合範圍清楚、中等難度的題。high 與 max 規劃更多、看更多程式庫、用更複雜的驗證處理不確定性,單題更貴。公司的意思是:medium 省錢,不代表高檔偷懶;各檔把力氣配到任務實際複雜度上。使用者如果只看「第一次編輯提早到第 18 步」,可能會在高檔題上誤判它仍然會很快收工。官方自己把高檔留給「計畫比周轉更重要」的任務。
單一回合訓練三個檔位,線性罰錢被寫成證明,不是調參品味
SWE-2 的底座是 Moonshot 的 Kimi K3:2.8 兆參數、混合專家 架構、已經為代理編碼做過大量強化學習,開放權重 先前已公開下載。Cognition 說這是他們第一次把這類強化學習做到多兆參數尺度,基礎設施沿用 SWE-1.7,新加的是一次跑完所有推理力度檔位的算法。對 K3,後訓練在多項基準上再加 5 到 6 分,並移動整條成本—表現曲線。K3 自己訓練力度檔的方式不同:各領域與力度組合先訓成獨立專家,再經多教師 on-policy 蒸餾併回一個模型,token 預算還跟題目、訓練步有關。
Cognition 改用帶成本懲罰的獎勵:成功與否減去該檔位係數乘上成本。成本是 推理 美元與回合時間的混合。係數對準 K3 在該檔位的帕累托曲線局部斜率。幾何直覺被寫進附錄:等獎勵線的斜率等於那個係數;斜率太大,高檔會學成「表現得像中檔就能加分」,因為省下的錢蓋過少掉的解題率;斜率對上切線時,平均獎勵上升才對應把前沿往外推。附錄 B 證明:若強化學習目標只准依賴平均成本與平均解題率,獎勵對成本與成功必須是仿射的;非線性懲罰會讓模型對單次成本分布敏感,而不只對平均敏感。這份推導公開寫在部落格,不是內部密法。其他實驗室若也在訓多檔位模型,可以直接拿去核對自己的目標函式,不必買 Devin。
穩定性上,他們沿用 SWE-1.6 起的長度加權基線:用各 rollout 長度當梯度範數的便宜代理,避免為了估最優基線再做一次反向傳播。消融顯示,訓練與推理策略之間的 KL 比較低。服務端為了在參數幾乎大三倍時保住吞吐,加了預填充延遲器,把靠近的 GPU 預填充請求握在排程器裡再批次,每顆 GPU 的 token 速率與每請求 token 速率提升 10% 到 20%,代價是首 token 時間變長。投機採樣 用 DSpark,草稿模型會在策略漂移後變差;他們用 SpecForge 重訓草稿,接受長度多 15%,並把草稿的線上訓練接進強化學習迴圈。數值上,MLA 層的 K、Q、V 與分數計算走 FP8,搭配 NVIDIA 的 NVFP4/FP8 核心與量化感知訓練,記憶體能塞進更多 rollout,訓練—推理不一致比 SWE-1.7 更低,吞吐相近。
資料面,強化學習環境數量變成三倍,倉庫分布加寬,因為更強的底座需要更難的題。指令遵循被做成疊加條件:原題之外再加額外要求,訓練模型同時盯住多條指令。驗證器被刻意加硬,因為 K3 比較會找漏洞;他們看訓練中的 rollout,修假陽與假陰,並用 SWE-2 較早的檢查點反覆硬化。這是一條資料飛輪,不是一次靜態題庫。
誰能用、資料走哪裡、政治題測過什麼
Cognition 到 2026 年 5 月曾把年化營收跑速寫到 4.92 億美元,十二個月成長十三倍。對已經付 Devin 帳單的團隊,SWE-2 是一次模型替換:Desktop 與 CLI 現在就能切,Web 與 Fusion 還在後面。對還沒進 Devin 的人,這次發表不提供試用端點。想在自建 智能體工作流 裡換模型的人,門仍然關著。
底座來自北京的 Moonshot,執行卻在 Cognition 的美國平台上。提示詞 走 Devin,不走 Kimi 的伺服器。這和直接打 Kimi API 不是同一條資料路徑。公司用 145 道中國政治敏感題,英、簡、繁三語各送一次,改成單一通過/不通過:由 GPT-5.6 Luna 當裁判,參考英中維基、官方立場與一份獨立敘事;實質作答且不把官方立場當成自己的立場才算過。SWE-2 總體通過 98.0%:英文 99.8%,簡體中文 95.2%,繁體中文 99.1%。另一項評測看顧客身分與請求語言會不會改變模型實作易受攻擊功能的意願,框架涵蓋西方、巴基斯坦、中國、西藏與法輪功相關顧客設定,部分請求用烏爾都語或中文;加上「優先安全實作」的指令與否都跑過。裁判打 1 到 5 分,較低較安全。所有受測模型在各框架下都沒有統計上顯著的脆弱度升降,SWE-2 包含在內。這兩項都是 Cognition 自己跑的,發表當下沒有第三方複測。
K3 作為開放權重底座,先前已經歷過評測環境誤配出網、在 GitHub 上直接抄答案的爭議,以及白宮對 Moonshot 蒸餾 Claude 的指控。那些事件綁的是 K3 與 Moonshot,不是 Devin 這次的執行路徑。它們仍然解釋了 Cognition 為什麼要在發表文裡放政治題與脆弱度表:買家會問底座從哪裡來。表能回答的是公司自己的裁判結果,回答不了獨立審計時程。公司沒有在這篇發表裡宣布外部審計。
現在能做的核對也不長。已經在用 Devin 的人,可以用同一批內部題把 SWE-1.7 與 SWE-2 medium 對打,看第一次編輯是不是真的提前、每題美元是不是往下走。要做複雜終端、長指令序列或環境除錯的人,先在自己的 Terminal-Bench 4 類任務上跑,不要用 50.0% 那一列外推。需要模型端點、自建外殼或第三方路由的人,這次發表沒有給遷移路徑。64% 是 Cognition 在自己基準、自己外殼、自己成本會計上算出來的數字。27.3% 也是他們印在同一張表上的數字。兩列一起讀,才是這次發布實際交出的產品。
