7 月 19 日我們寫過:deepseek-chat 與 deepseek-reasoner 只剩五天。今天就是截止日——7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59)之後,任何仍指向這兩個舊名稱的請求將直接失敗,無優雅降級、無額外延長窗口。官方 API 文件用紅字標註:「Jul 24th, 2026, 15:59 (UTC) 後將完全退役且不可存取。」
這不是小版本升級,而是 DeepSeek 把 V4 從預覽推進正式 GA 的同時,強迫全球開發者做兩件一直被別名掩蓋的決定:用 Flash 還是 Pro,以及要不要開 thinking 模式——再加上第三件新變數:你的 cron job 會不會踩到北京尖峰加價。
今天到底斷什麼?
自 4 月 24 日預覽以來,舊名稱其實已在幕後轉發:
| 舊名稱(今日下線) | 過渡期實際路由 | 今日起應改為 |
|---|---|---|
deepseek-chat | V4-Flash 非 thinking | deepseek-v4-flash + thinking 關閉 |
deepseek-reasoner | V4-Flash thinking 開啟 | deepseek-v4-flash 或 deepseek-v4-pro + thinking 參數 |
關鍵陷阱(7 月 19 日已提示,今天變成生產事故):deepseek-reasoner 從未對應 V4-Pro。若你以為「reasoner = 最強推理檔」,過去三個月其實一直在付 Flash 價格跑 Flash 能力。遷移時若只做字串替換而不升級到 deepseek-v4-pro,品質預期可能錯位。
官方定價頁列出的 GA 型號:
- deepseek-v4-flash:1M context、預設支援 thinking/非 thinking 切換、並發上限 2500
- deepseek-v4-pro:同樣 1M context、最強指令遵循與長文,並發上限 500
Base URL 不變:https://api.deepseek.com(另提供 Anthropic Messages 格式端點)。OpenAI Chat Completions 相容形狀保留,但 thinking 改由請求參數控制,不再靠模型名稱分流。
峰谷計價:API 業界第一個「結構化尖峰加價」
V4 GA 第二記重拳是時段計價。DeepSeek 過去曾做過離峰折扣,但 V4 GA 把峰谷寫進正式價目——媒體稱這是前沿級 API 首次把尖峰/離峰作為永久費率卡,而 OpenAI、Anthropic 仍多為 flat rate。
已確認規則(北京時間 UTC+8):
- 尖峰:每日 09:00–12:00、14:00–18:00 → 費率約為離峰 2 倍
- 離峰:夜間與週末 → 維持基準價
以 V4-Pro 為例,離峰基準約 $0.435 / 百萬 input(cache miss)、$0.87 / 百萬 output;尖峰時段翻倍。Flash 更便宜:cache miss input $0.14、output $0.28(離峰);cache hit input 可低至 $0.0028。
對排程任務的含義很實際:把批次摘要、embedding 前處理、eval 重跑挪到離峰,可能直接砍半帳單;反之,在北京工作時段跑高頻 AI 代理 迴圈,帳單會比離峰批次高出整整一倍——峰谷定價把「何時呼叫 API」變成與「呼叫哪個模型」同等重要的變數。
遷移檢查清單(截止前最後幾小時)
- 全域搜尋
deepseek-chat、deepseek-reasoner:程式碼、.env、K8s ConfigMap、LangChain 預設、CI eval、排程腳本 - reasoner 路徑:評估是否應升級
deepseek-v4-pro+extra_bodythinking enabled,而非僅 Flash - 多輪工具調用:thinking 模式下
reasoning_content與 tool call 歷史是否完整回傳 - 採樣參數:thinking 開啟時
temperature/top_p可能無效——需重測 - 帳單告警:按 timestamp + model + 峰谷標記記 log,避免月底才發現尖峰爆量
- 降級策略:15:59 UTC 後舊名稱 404/400,fallback 必須指向新 ID,不能仍寫舊 alias
V4-Pro 與開源權重:GA 不只是改名
第三方評測(AIToolsReview 等)指出 V4-Pro 約 1.6T 激活 MoE、1M context,GA 定於 7 月 19 日前後落地,與今日別名下線配套。Hugging Face 上亦有 DSpark 等蒸餾變體供自架;但多數團隊仍走 API——尤其在中國以外想避開地緣摩擦時。
這與本週 Moonshot 遭白宮指控蒸餾 Fable 形成對照:DeepSeek 走「極低價 + 開放權重 + 強制顯式型號」路線,把成本戰推進到計費時段維度;美系對手則在閉源與監管框架下維持 flat pricing。
官方價格卡(離峰基準,每百萬 token)
| 項目 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Input(cache hit) | $0.0028 | $0.003625 |
| Input(cache miss) | $0.14 | $0.435 |
| Output | $0.28 | $0.87 |
| Context | 1M | 1M |
| 最大輸出 | 384K | 384K |
| 並發上限 | 2500 | 500 |
尖峰時段(北京 09:00–12:00、14:00–18:00)上述費率約 ×2。Flash 的 cache hit 價格極低,適合重複 system prompt、長上下文 RAG 前綴;Pro 則適合複雜指令遵循與長鏈 推理,但並發僅 Flash 的五分之一,高 QPS 場景需提前壓測排隊。
thinking 模式怎麼寫?(reasoner 遷移範本)
舊寫法在今日失效:
model: "deepseek-reasoner" // 今日 15:59 UTC 後報錯
新寫法需顯式指定型號 + thinking 參數(OpenAI SDK 相容):
model: "deepseek-v4-flash" // 或 deepseek-v4-pro
extra_body: { "thinking": { "type": "enabled" } }
若從 deepseek-chat 遷移,則用同一型號但關閉 thinking。別忘了:開啟 thinking 時部分採樣參數可能無效,agent 迴圈要重新量測延遲與 token 消耗——reasoner 時代累積的「每請求成本」基線,在 Pro + thinking 下可能完全不同。
DeepSeek 亦提供 Anthropic Messages 格式端點(https://api.deepseek.com/anthropic),多協議並存意味著 gateway 層要同步更新路由規則,不能只改一條 Python 客戶端。
與 Gemini 3.6 發布的價格戰
Google 7 月 21 日發布 Gemini 3.6 Flash($1.50/$7.50 per M token)與 3.5 Flash-Lite($0.30/$2.50),主打「每個 agent 任務更省 token」。DeepSeek 則用絕對低價 + 峰谷調峰搶佔 batch 與亞洲時區工作負載。兩邊都在說「agent 經濟學」,算帳維度不同:Google 壓單次輸出 token 數,DeepSeek 壓每百萬單價與時段。
若你什麼都沒做會怎樣?
15:59 UTC 一過,所有仍送 model: "deepseek-chat" 或 "deepseek-reasoner" 的請求應預期 HTTP 400 或 404——監控面板會在離峰時段突然歸零,錯誤訊息卻可能被包成「模型不可用」。這是典型「一行字串未改」的生產事故,偏偏發生在週四晚間亞洲時區。
結語
7 月 19 日 的警告今天變成現實:別名不是永久兼容層,而是 90 天倒數。V4 GA 的真正含義是——你必須在程式裡明確選擇 Flash/Pro 與 thinking,並把時區寫進 FinOps。
還沒遷移的團隊,現在只剩幾小時。已遷移的團隊,下一關是尖峰定價與 Pro 重測。DeepSeek 用截止日教會整個行業一件事:便宜 API 的代價,是再也不能對模型能力裝作不知道。
