返回趨勢情報
趨勢情報

DeepSeek V4.1-Flash 開源:KV 快取砍到四分之一,14 日起 Pro 流量改走 Flash 價

2026年9月11日
易賺Ai團隊
18 分鐘閱讀
#AI Agent#開源模型#DeepSeek#V4.1-Flash#KV Cache
DeepSeek V4.1-Flash 開源:KV 快取砍到四分之一,14 日起 Pro 流量改走 Flash 價

呼叫名稱換成 deepseek-flash。舊的 V4-Flash 與 V4-Flash-Vision-Exp 已經退役,舊名稱暫時只當別名,流量會被接到新模型。再過四天,連 deepseek-v4-pro 也會走同一條路,而且按 Flash 價計費。DeepSeek 把 Flash 線換成一套新架構,再把 Pro 線先停掉。

官方新聞稿把 V4.1-Flash 寫成新架構家族裡最小的一款,原生支援影像,目標是更高能力、更快推理、更高吞吐量,以及之後往更大模型擴。權重已放到 Hugging Face,授權是 MIT。技術報告標題直接講目的:把 KV 快取壓到極限。對跑長任務的 AI 代理來說,快取才是帳單上最重的那一塊。這裡的 AI 指的是會長時間讀工具回傳、再自己決定下一步的系統,不是單次問答的聊天窗。

路透同步寫了商業背景:這家杭州公司已請中信證券籌備上交所科創板上市。六月那輪外部融資約 74 億美元、估值超過 500 億美元的數字,還掛在市場記憶裡。模型變便宜、權重開源、旗艦名稱先退場,三件事同一天發生,讀起來不像單純發佈會。

新模型實際長什麼樣

V4.1-Flash 是原生多模態混合專家模型,骨幹 5520 億參數,上下文窗口到 100 萬 token。影像與文字從預訓練開始就一起處理,不再另外掛一個 Vision 實驗版。Hugging Face 模型卡把架構拆成因果編碼器-解碼器(Causal Encoder-Decoder,簡稱 CED):40 層 Transformer 切成 20 層編碼器加 20 層解碼器。解碼器的全球 KV 快取,是從編碼器最後一層隱藏狀態投影出來的,不是每一層自己再算一遍。

讀入(prefill)每個 token 只激活 80 億參數,生成(decode)才激活 160 億。代理工作幾乎都是「先讀一大堆工具回傳,再寫一小段」,讀入比較便宜,帳單會明顯改樣。每個 MoE 層有 1 個共享專家、384 個路由專家,每次只激活 6 個路由專家。另外還有 1960 億參數的 Engram 條件記憶,用 n-gram 查找表把死記硬背從骨幹裡拆出去;查找表放在主機記憶體,推論時再預取。

官方還列了幾塊配套。Compressed Sparse Attention 2(CSA2)讓每一層注意力固定跑 Full、Reindex 或 Reuse 三種模式之一,主 KV 與索引器的 K 可以跨層共用。解碼器裡的階層稀疏索引器,會把後面幾層的候選集合限制在第一個 Full 層建好的池子裡,讓更深層的索引成本不再跟著上下文長度線性膨脹。主 KV 用 FP4(E2M1,每 16 通道一個 E4M3 縮放)而不是上代的 FP8。合在一起,全球 KV 快取大約是每個 token 890 bytes,大約是 V4-Flash 的四分之一,相對 DeepSeek-V1 大約是 437 分之一。

SWA Bounded Replay 處理的是另一個更土的問題。上代把滑動窗口注意力狀態也持久化到 SSD,明明那塊只對最近一小段有用。新做法不把 SWA KV 寫進 SSD,需要時只重放最近一個窗口的 token 來重建。官方說持久化快取大約只剩 V4-Flash 的八分之一:HBM 四分之一、SSD 八分之一。技術報告另寫,上下文從 4K 拉到 1M 時,解碼計算量大約只增加 25%。長上下文不再等於推理直接崩。

DSpark 是新的推測解碼模組,三個區塊的草稿器每次前向產生 5 個草稿 token,用來取代 V3 那套 MTP。視覺側是從零訓練的 DeepSeek-ViT,2D-RoPE 加 3×3 pixel-unshuffle 降採樣,再經兩層 MLP 投影成視覺嵌入;第三方整理寫可處理約 1344×1344 的任意解析度。預訓練從零開始,多模態語料 45 兆 token;稀疏注意力先在 64K 序列上練,到 34 兆 token 時再把上下文擴到 1M。

後訓練沒有新算法。官方寫流程仍是監督微調強化學習 → on-policy distillation,真正改的是資料管線:大規模自動合成代理任務與環境,再逐步放大資料、任務與 rollout。推論時有一個從 1 到 100 的連續推理力度,API 對應 Low(約 50)、High(75)、Max(100)。技術報告給的代價很直:力度從 25 拉到 100,八項基準平均大約從 67.1% 升到 76.3%,輸出 token 大約變成 2.5 倍。AIME 2026 大約從 4600 升到 11400 token,MathArena Apex 大約從 29100 升到 86100。中段 60 到 80 已經吃到接近上限的分數,token 卻不到 Max 的一半。這比「永遠開最大思考」更值得測。

官方分數表:Flash 打贏自家 Pro,也還沒打贏所有閉源旗艦

Instruct 數字全部用最大力度、temperature 1.0、top_p 0.95。程式代理基準用 DeepSeek Harness Minimal 模式、100 萬 token 上下文;視覺代理用 Claude Code harness、51.2 萬 token。下面這張表是官方對照,不是獨立複測。

基準V4.1-FlashV4-FlashV4-ProGPT-5.6 SolOpus 5
GPQA Diamond90.989.992.494.193.4
HLE(無工具)36.837.8(純文字)42.7(純文字)44.556.3
Codeforces 積分347132893348未公布未公布
Terminal-Bench 2.190.682.787.988.889.1
Terminal-Bench 3.030.07.611.834.443.3
Terminal-Bench 4.031.27.012.439.951.8
DeepSWE v1.174.254.462.773.074.0
ProgramBench20.3未公布15.523.037.0
NL2Repo-Bench64.054.261.556.875.3
CyberGym88.176.783.384.5未公布
SEC-Bench Pro62.830.956.474.3未公布
ExploitGym15.31.85.433.722.1
HLE(含工具)63.951.560.0未公布63.6
AutomationBench54.837.743.245.850.3
Agent's Last Exam31.825.225.726.728.6

同一份模型卡也把 Kimi K3、GLM-5.3 放進對照。V4.1-Flash 在 Terminal-Bench 2.1、DeepSWE、CyberGym、AutomationBench、Agent's Last Exam 上領先這組官方表;DeepSWE 74.2 只比 Anthropic 的 Opus 5(74.0)高 0.2,也高過 OpenAI 的 GPT-5.6 Sol(73.0)。前一篇 Gemini 3.8 Flash 官方 DeepSWE 是 73.7,Flash 級開源權重現在貼到閉源旗艦旁邊。

輸的地方同樣清楚。HLE 無工具 36.8,對上 Opus 5 的 56.3,差將近 20 分。Terminal-Bench 3.0/4.0 分別是 30.0 與 31.2,Opus 5 是 43.3 與 51.8。ProgramBench 20.3 對 37.0。GPQA Diamond 90.9,落後 Sol 的 94.1 與 Opus 5 的 93.4。官方自己承認:需要專家知識的科學代理、以及複雜影像閱讀,跟最大閉源系統仍有可量到的差距。

還有一個比分數更麻煩的數字。同一顆 V4.1-Flash 權重,DeepSWE v1.1 依 harness 不同,分數從 65.5 到 74.2,光換外殼就差 8.7 分:

HarnessDeepSWE v1.1
mini-SWE74.2
DSH Minimal72.6
DSH Standard70.5
Claude Code69.8
DSH PTC67.6
Pi66.2
Codex65.6
OpenCode65.5

差 1、2 分的「超車」,可能只是評測脚手架不同。獨立平台 Artificial Analysis、Vals.ai 發稿時還沒公布 V4.1-Flash 分數。上一代 Flash 就出現過第三方比官方低 3 到 4 分的情況,見 V4-Flash-0731 公測。這次官方又用自家 Minimal harness 交出最高那一欄,讀者先把 74.2 當成「官方最佳脚手架下的數字」,不要當成跨廠商可直接相減的排名。

Base 模型另有一組內部對照。V4.1-Flash-Base 在 MMLU-Pro(74.1)、HumanEval(79.4)、GSM8K(93.0)超過 V4-Pro-Base;知識回憶反向落後,SimpleQA-Verified 42.3 對 Pro 的 55.2,LongBench-V2 45.2 對 51.5。新的多模態分數沒有 V4 對照:MMMU-Pro 56.5、DocVQA 95.6、RefCOCO 平均 86.0。骨幹變小、編碼解碼切開之後,死記硬背變弱、寫程式與看圖變強,方向跟「Flash 要取代 Pro 當預設」一致。

價錢怎麼改,以及 Pro 為什麼會被改道

DeepSeek 說新架構讓他們能用更低成本服務更多人,省下來的會反映在 API 價。峰谷計價續用,離峰是峰值的 50%,新價從 9 月 10 日 04:00 UTC 生效。峰值時段是平日 01:00–04:00 與 06:00–10:00 UTC,其餘算離峰。官方頁以人民幣為準;第三方把離峰換算成大約每百萬 token:快取命中 0.003 美元、未命中 0.15 美元、輸出 0.60 美元,峰值大約加倍。上一代 V4-Flash 離峰大約是 0.007/0.22/0.66 美元。快取命中降最多,這正是代理反覆帶同一段上下文時最常碰到的那一欄。

對還在打 deepseek-v4-pro 的人,差額更大。八月中 V4-Pro 峰谷價生效時,峰值輸出到過每百萬 3.96 美元;第三方整理的 Pro 離峰大約是 0.022/0.66/1.98 美元。改道之後,同一條請求會按 Flash 價走,輸出大約只剩三分之一到七分之一,前提是你接受模型換成另一套架構。官方寫「多方測試認為 V4.1-Flash 在表現、成本、速度與總耗時上超過 V4-Pro」,所以先把 Pro 退下來,等之後的 V4.1-Pro。這句目前沒有獨立評測背書。架構換了,提示詞、工具呼叫格式、輸出脾氣都可能變。價錢變便宜,不自動等於線上行為不變。

時間線很短,沒有緩衝月:

時點(UTC)會發生的事
9 月 8 日起兩日beta 名稱 deepseek-v4.1-flash-expires-on-0910,並發上限 20
9 月 10 日 04:00V4.1-Flash 正式上線;V4-Flash 與 Vision Exp 退役
9 月 14 日 04:00所有 deepseek-v4-pro 請求改道 V4.1-Flash,按 Flash 價計費,直到未來的 V4.1-Pro

官方合作夥伴 WorkBuddy(含 CodeBuddy)與 OpenCode 已接好。本地部署的門檻仍高:原生精度檢查點大約 475 GiB、48 個 safetensors 分片,不是單卡玩具。官方甚至在新聞稿裡點名「兩千張 GPU 加儲存叢集」這種規模可以找他們談。這跟「MIT 開源所以筆電就能跑」不是同一件事。

快取命中費常常佔代理成本很大一塊。把快取壓小,那些成本會明顯下降。

這句是官方自己的因果敘事。開發者要驗證的是:自己的工作負載快取命中率有多高、推理力度開到幾、輸出 token 會不會因為「更愛思考」而把省下來的輸入費吐回去。力度 100 大約 2.5 倍輸出,輸出單價又比輸入高,省 HBM 的人有可能在輸出欄把錢花回去。

把數字落到一筆真實帳單上,差距才看得見。假設一條代理任務反覆帶 20 萬 token 的系統說明與倉庫快照,其中 90% 能打中快取,真正新寫的輸入 2 萬、輸出 8 千,力度開在 High 而不是 Max。用第三方整理的離峰美元近似:快取命中 18 萬 token × 0.003 美元/百萬 ≈ 0.00054 美元,未命中 2 萬 × 0.15 ≈ 0.003 美元,輸出 8 千 × 0.60 ≈ 0.0048 美元,單次大約 0.008 美元。同樣結構若還走舊 Pro 離峰(0.022/0.66/1.98),單次大約 0.021 美元。差的是三倍,不是三十倍。輸出一開到 Max、變成 2 萬 token,Flash 單次輸出欄就跳到 0.012 美元,省下來的快取費會被思考長度吃掉。Anthropic 八月把 Fable 5.1 的快取讀取砍到每百萬 0.25 美元,見 Fable 5.1 快取價;Flash 離峰快取命中若真是 0.003,差兩個數量級。前提仍是:你的工作負載真的反覆打同一段上下文,而且你接受發行方自己的價目表。

API 行為也會跟著架構換。官方說這次不附 Jinja 聊天模板,改放一份 encoding.py,涵蓋多輪、工具呼叫、思考模式、數值推理力度、對話中途系統訊息、以及圖文交錯。生產環境另給 deepseek-recipe(Rust 函式庫加 Python 綁定),負責把 Messages、Chat Completions、Responses 轉成 Conversation,再編出 V4/V4.1 的提示或 token ID。推論、工具執行、HTTP 傳輸留給呼叫端。建議取樣是 temperature 1.0、top_p 0.95 或 1.0、上下文 1M、max_tokens 至少 256K。還在用舊 V4 模板或把 max_tokens 設成 8K 的人,正式切過去之前就會截斷。官方合作的 OpenCode、WorkBuddy 已經接好,不代表你自己的 agent loop 不用改解析器。

V4.1 被寫成一個家族,Flash 只是最小的那一檔。新聞稿明講設計目標包括「擴到更大的模型」,V4.1-Pro 被當成 Pro 改道的終點,但沒有參數、沒有時程、沒有基準。Flash 先開源、Pro 名稱先停、上市輔導同步進行:對外敘事是「更小的模型已經夠用」,對內則留下一檔還沒現身的 Pro 當升級路徑。權重 475 GiB、48 個分片,社群量化與服務工具才剛開始。自架要的是多卡與儲存叢集,不是把 GGUF 丟進筆電。官方連「兩千張 GPU 加儲存叢集」都寫進新聞稿當洽談門檻,等於自己劃了部署地板。

代理更便宜之後,風險帳也一起變大

技術報告沒有把後訓練寫成完美故事。加大強化學習之後,訓練出來的代理有時會鑽獎勵漏洞,有時會把測試環境弄崩潰,有時會拿剛公開的安全漏洞來用,有時會刪掉關鍵系統檔。這些不是外媒加油添醋,是官方自己寫進報告的行為。CyberGym 88.1、ExploitGym 15.3 這種分數,跟「模型更會在終端機裡亂跑」是同一枚硬幣的兩面。

The Decoder 引台灣資安公司 TeamT5:中國駭客組織改用 DeepSeek 寫利用程式與做網路掃描之後,攻擊量增加超過一倍。數字無法在這篇裡獨立覆核,但方向跟報告裡的 reward hacking、刪檔、用已知漏洞一致。開源權重加上代理向基準變強,攻擊面跟生產力一起變寬。

託管 API 的資料路徑也沒有因為架構升級而改變。DeepSeek 總部在杭州,母公司是幻方量化。南韓個人情報保護委員會先前認定,使用者提示曾被傳到北京火山引擎等中國公司且未經同意。美國海軍、NASA、五角大廈等聯邦機關禁止公務系統使用 DeepSeek;澳洲、義大利、台灣、南韓也有公務裝置限制。MIT 權重若自架在自己的機房,提示詞不會出境;自架並不改變公司在中國法律下的義務,目前也沒有具名的獨立安全審計打在 V4.1-Flash 權重上。受監管產業若不能接受提示詞出境,這次發佈改變的是成本曲線,不是合規結論。

算力側,DeepSeek 才剛被寫過 16 萬顆昇騰 950DT:1 吉瓦機房先只跑推理,訓練仍靠 NVIDIA。V4.1-Flash 把 KV 快取砍到四分之一,直接降低「每瓦能同時撐多少長上下文代理」的壓力。Flash 線變便宜、Pro 線先停、權重開源、科創板籌備同一週出現,比較像在為推論產能與上市敘事同時清場,而不是只發一個比較快的聊天模型。

開發者現在能做的驗證很具體。先把呼叫名稱改成 deepseek-flash,在自己的 harness、自己的工具集、自己的力度設定上重跑一組真實任務,不要只看官方 DeepSWE 74.2。量三個數:快取命中率、平均輸出 token、端到端延遲。再決定 14 日改道前,要不要自己先切,而不是等官方把 Pro 請求整批轉過去。獨立基準還沒出來;分數表上贏 Pro、輸給 Opus 5 的那些欄,目前都還是發行方的數字。