模型發佈會比標價;採購最後比做完一件事要花多少錢。研究機構 Artificial Analysis 的測算經 Reuters 體系稿件(Cyprus Mail 等轉載)推上版面:DeepSeek V4-Flash 在知名模型裡,跑基準任務的平均成本約 3 美分——對照 Moonshot Kimi K3 約 86 美分、OpenAI GPT-5.6 Sol 約 1.86 美元、Anthropic Claude Fable 5 約 3.15 美元。相對 Fable 5,通稿直接寫成「超過 100 倍便宜」量級。
這不是重複上週 V4-Flash 公測/換 checkpoint的產品稿,而是第三方把「標價 × 實際 token 消耗」合成任務成本後的排行衝擊。
數字怎麼讀:標價只是分子
AA 引用的官方費率卡大致是:每百萬 token 輸入 0.14 美元、輸出 0.28 美元(另有極低的 cache hit 價,業界對照常寫約 0.0028)。但 Reuters 稿強調:只看標價會誤導——步數多、廢話多的模型,便宜單價仍可能很貴。任務均價把「這題實際吐了多少 token」算進去,才接近真實帳單。
| 模型 | AA 任務均價(通稿) | Intelligence Index |
|---|---|---|
| DeepSeek V4-Flash | ~$0.03 | 50 |
| Kimi K3 | ~$0.86 | 57 |
| GPT-5.6 Sol | ~$1.86 | 明顯更高(稿稱領先 Flash 9+ 分) |
| Claude Fable 5 | ~$3.15 | 同上檔領先 |
V4-Flash 的 50 分與 Google Gemini 3.6 Flash 同級,略低於 Meta Muse Spark 1.1 與 Z.AI GLM-5.2(各高 1 分)。智慧不是榜首;單位智能的美元成本才是它重新搶敘事的武器——尤其在 DeepSeek 被 Moonshot、MiniMax、阿里、字節分走風頭之後。
稿件並提:DeepSeek 據傳籌備潛在 IPO;更強的 V4-Pro 尚未給正式發布日。對財務敘事,Flash 檔的極致低價是獲客與市占工具;Pro 檔才決定能不能回到「旗艦智能」談判桌。
對企業採購意味著什麼
若你的負載是高頻分類、草稿、工具呼叫、內部搜尋綜述:把 V4-Flash 放進 A/B 帳單實驗,用同一任務集對照 Sol/Fable,不要只對標價。若你的負載是難題推理、長代理、合規寫作:50 分 Intelligence Index 提醒你——便宜可能來自「少想幾步」或「題目對它剛好簡單」,換題集後均價比可能收斂。
和同週 Ling-3.0-flash 開源/促銷 對照:一條走開源權重+單機私有化,一條走 API 極致單價。資料主權敏感選前者;純雲端吞吐選後者。兩者都在打「Agent 工人」市場,不是 Arena 金牌市場。
也別忽略運營細節:DeepSeek 曾預告峰谷價(北京時間特定時段加倍)但生效日多次「待宣布」;舊 deepseek-chat/reasoner 名稱硬切期已過。合約與 FinOps 儀表板要把「名義單價/cache/峰谷/任務均價」四欄分開,否則財務月底會對不上工程體感。
競爭讀法:便宜是戰略,不是意外
2025 年初 R1 那一波教過市場:中國實驗室可以用成本曲線重寫預期。2026 年中,對手已經用 Kimi、Qwen、GLM 把智能分追上來;DeepSeek 再用 Flash 檔把成本分拉穿地板。對美系實驗室,這迫使產品分層更乾脆——旗艦維持溢價,Flash/mini 必須真的便宜,不能只便宜一點點。
對路由層(gateway/router)團隊:把 V4-Flash 設成預設工人、把 Sol/Fable 設成升級路徑,用任務難度或自信度觸發。AA 的均價表正好提供校準起點——但要每月重跑,因為模型會換 checkpoint、提示詞會膨脹、cache 命中率會變。財務側可用「每千次成功任務成本」代替「每百萬 token」,才跟業務 KPI 對得上。
對開發者:把 AA 任務均價當篩選器,把自家 golden set 當判決器。3 美分很動人;你的生產追問若平均要 10 倍 token,帳單故事會變。也留意開源權重陣營(Ling-3.0-flash、Qwen 系)會不會用自架把「最便宜 API」變成「最便宜自有電力」——那時 AA 的雲端任務均價只是故事的一半。
下一步看 V4-Pro 何時正式定價與上線、AA 是否把 Pro 拉進同一成本表,以及峰谷價會否把「最便宜」變成「只有半夜最便宜」。
