返回資訊
AI趨勢入門

DeepSeek V4-Flash-0731 正式公測:架構不變只重訓後訓練,Terminal-Bench 82.7 反超自家 Pro 預覽

2026年8月2日
易賺Ai團隊
8 分鐘閱讀
#DeepSeek#開源權重#V4-Flash#代理基準#Terminal-Bench#MIT#API定價
DeepSeek V4-Flash-0731 正式公測:架構不變只重訓後訓練,Terminal-Bench 82.7 反超自家 Pro 預覽

DeepSeek 把 V4-Flash 拉出預覽、送進正式 API 公測時,changelog 幾乎用一句話定調:架構與規模不變,只做了重新後訓練(re-post-training)。檢查點名 DeepSeek-V4-Flash-0731,呼叫 ID 仍是 deepseek-v4-flash;權重以 MIT 授權上架 Hugging Face;價目未動——快取未命中輸入 $0.14/百萬 token、命中約 $0.0028、輸出 $0.28

真正炸裂的是對照表:在官方公布的代理/編程基準上,這個「較小、較便宜」的 Flash,全面壓過自家更大的 V4-Pro-Preview

數字:小模型打贏大預覽

Hugging Face 模型卡與多家複述的對照(廠商自報,非獨立重跑):

基準Flash-0731Flash PreviewV4-Pro PreviewOpus 4.8(對照)
Terminal-Bench 2.182.761.872.185.0
NL2Repo54.239.438.569.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.858.0
Toolathlon-Verified70.349.755.976.2
Agents' Last Exam25.215.816.525.7
AutomationBench Public25.110.812.827.2
DSBench-FullStack†68.737.041.871.6
DSBench-Hard†59.625.831.171.7

† 標為內部全端開發類測試。Terminal-Bench 從預覽 61.8 拉到 82.7(+20.9),並高過 Pro 預覽 72.1;Agents' Last Exam 與 Opus 4.8 的 25.7 只差 0.5。DeepSWE 從 7.3 跳到 54.4,幾乎是另一個產品。

MarkTechPost 另提醒:倉庫含推測解碼模組時 HF 參數顯示可到約 304B 量級;自架完整精度常對應多卡 GB300 級,3-bit 量化約需 ~110GB 記憶體量級——「MIT 可下載」與「筆電可跑」仍是兩件事。TechTimes 則把敘事推到下一問:若 Pro 正式版也做同等後訓練,1.6T 容量被「點燃」後,代理分數會不會再次換位?0731 的真正產業含義,可能是後訓練排程成為比參數軍備更稀缺的競爭力。

架構側維持熟悉規格:約 284B 總參數 MoE、每 token 約 13B 活躍、1M 上下文;倉庫另附推測解碼模組(與 DSpark 結構相關)。原生 Responses API、Codex 相容路徑被寫進發布敘事——明確瞄準代理工作流,而不只是聊天補全。

為什麼「只重訓」比「更大」更刺耳

若能力躍進主要來自後訓練資料與目標函數,而不是堆參數,採購邏輯要改寫。V4-Pro 預覽仍是 1.6T 總參、約 49B 活躍的旗艦候補;官方還說 Pro 正式版會「盡快」跟進。一旦 Pro 也吃同一套代理後訓練,差距可能再次拉開——也可能證明 Flash 已經吃到多數代理任務的甜區,Pro 變成長上下文/知識向溢價。

價格戰讀法同樣直接。Times Tabloid 等指出時點緊貼 OpenAI 調降 Luna 等價位敘事:Flash 維持 $0.14/$0.28,輸出端遠低於多數閉源快檔。Artificial Analysis 等第三方快照曾對預覽端點給出與官方一致的 Terminal-Bench 基線,增加「預覽分數可信」的旁證;0731 的跳升仍待獨立複測。Ofox 等比較還提醒:標價便宜不等於帳單一定最低——若模型為達分吐出更多 token,總帳可能被用量吃回去;多模態管線上 Gemini 等仍可能因原生影像/視訊更省整合成本。

自架門檻現實:完整精度仍要資料中心級節點;社群量化(如約 4-bit/約 155GB 級)讓工作站或 Mac Studio 級硬體開始可玩,但與「API 一鍵」不是同一產品。MIT 無門檻權重則明確打開商用自架與二次開發——這與Kimi K3 權重開放同屬開源壓力波,但 DeepSeek 這次打的是代理基準+價格,不是參數量軍備賽。

開發者遷移與舊別名倒數

API 公測意味著生產流量可以開始切 deepseek-v4-flash。既有舊 chat/reasoner 別名下線倒數仍在——多家複述指向後續硬截止日,應以官方 docs 為準儘早遷移。評測注意:官方部分代理分數跑在未完全公開的 DeepSeek Harness/minimal mode;換你的工具鏈、提示與允許的網路權限,分數可能掉一截。Cybergym 76.7 很亮眼,但在評測代理誤連公網的氣氛裡,企業更應問隔離與監測,而不是只追榜。

對代理編排層(Codex 相容、Responses API)來說,0731 的意義是「便宜備援腦」突然變強。路由策略可以改成:簡單工具循環走 Flash,難題再升到閉源旗艦;但別假設官方 Terminal-Bench 會在你的 repo 權限模型下原樣成立。先用十個真實內部任務做 A/B,再決定流量切多少。

怎麼讀、怎麼買

把 0731 當「後訓練能釋放多少代理潛力」的案例,而不是「284B 永遠打贏 1.6T」。上線前用自家 Terminal/SWE/工具呼叫集重跑;盯 token 用量與快取命中,不只盯標價;自架則先算顯存與量化品質,再談 MIT 授權紅利。若你的工作負載是純文字代理,Flash 值得進短名單;若重度多模態,別被文字榜單帶走。

下一步看三件事:獨立評測機構能否複現 82.7 帶;V4-Pro 正式版是否複製同一後訓練跳躍;峰時加倍計費(官方曾暗示每日兩個北京時間窗口帳單翻倍)何時生效。DeepSeek 這次沒有用新架構震驚世界——它用同一具引擎、換一罐燃料,就讓自家旗艦預覽在代理賽道上顯得過時。對閉源實驗室,這比又一個萬億參數預告更難回應。

歐盟透明度義務同日生效放在一起讀,會看到分裂的 8 月開局:一邊是監管要求產品說清楚「你在跟 AI 說話」,一邊是開源權重把代理能力的單位成本再往下壓。便宜且可自架的代理模型,會讓更多中小團隊跑起會呼叫工具的流程——也讓「誰該標示、誰該負責」的問題更快從大廠擴散到整條中小軟體供應鏈。

最後提醒評測衛生。Flash-0731 在 Cybergym 很高,不代表你可以把它丟進未隔離 runner 做「真實攻擊演練」。把代理評測當生產級隔離來設計,已是本季血淚教訓;便宜模型只會讓更多人跑得起這種評測,不會自動讓評測變安全。