返回趨勢情報
趨勢情報

DeepSeek 下單 16 萬顆昇騰 950DT:1 吉瓦機房只跑推理,訓練仍靠 NVIDIA

DeepSeek Plans 160,000 Huawei Ascend 950DT Chips for an Inference-Only Cluster

2026年9月6日
易賺Ai團隊
18 分鐘閱讀
#NVIDIA#DeepSeek#華為#趨勢情報
DeepSeek 下單 16 萬顆昇騰 950DT:1 吉瓦機房只跑推理,訓練仍靠 NVIDIA

至少十六萬顆。知情人士告訴 Bloomberg:DeepSeek 計劃在內蒙古烏蘭察布一座大約一吉瓦的資料中心,部署 華為 下一代昇騰 950DT。這批加速器要用來跑已經訓練好的 大型語言模型,也就是線上服務真正產生營收的那一層:推理。同一批知情人士說,公司目前不打算拿 950DT 去做 訓練。DeepSeek 與華為都還沒有公開確認這筆採購。

這句「只跑推理」比顆數更硬。華為把 950DT 定位成也能扛訓練的旗艦卡,DeepSeek 卻把它鎖在營收端。訓練——真正決定下一版模型長什麼樣子的工作——知情人士說仍主要靠 NVIDIAGPU。Financial Times 先前寫過,DeepSeek 曾嘗試在昇騰上訓練更早的模型,技術困難之後退回 NVIDIA。烏蘭察布這座機房若落成,證明的是中國能把「回答使用者」這一段搬到國產矽上;它還沒證明「做出下一代模型」也能搬走。

Bloomberg 原文沒有公布合約總價、有沒有簽字、交貨日曆寫到哪一季。後續媒體用市面單價粗算硬體面額:每顆約 1.6 萬美元(約人民幣 11.1 萬),十六萬顆大約 25 至 26 億美元、約 178 億人民幣。那是推估值,不是已公開的採購合約。觀察者網轉述同一批外媒時補了一句:十六萬顆只對應這座吉瓦級機房的一部分容量,現場採模組化建設、留了擴容空間。

目前能釘死的,和還在空著的格子

項目公開狀態口徑
部署規模知情人士 → Bloomberg至少 16 萬顆昇騰 950DT
地點知情人士 → Bloomberg 及後續轉述烏蘭察布,約一吉瓦
用途知情人士推理;目前不用 950DT 訓練
公司官方確認未確認DeepSeek、華為均未公開承認
合約是否已簽未披露部分轉述仍寫「計劃部署/訂購」
硬體總價非官方後續媒體用單價推估,約 25–26 億美元
部分投產知情人士目標約 2027 年底至 2028 年初
全數交貨產能限制從現在起可能超過一年,完整投運更可能拖到 2028 之後

四月那一波已經把方向寫出來了。DeepSeek-V4 對昇騰 950 的適配被 Reuters 寫成能帶動字節跳動、騰訊、阿里巴巴追單,站內當時的判斷是:中國 AI 開始驗證「國產模型配國產晶片」能不能進生產,而不只是再發一個便宜模型。見DeepSeek-V4 帶火華為 Ascend 950。這一次把「追單」換成一座具體機房、一個具體顆數、一條明確的工作負載分界。

為什麼點名 950DT,而不是已經能量產的 950PR

華為把 950 系列拆成兩張卡。950PR 走 Prefill 與推薦:把使用者那一大段提示詞一次吃進去,記憶體規格是 128 GB HiBL 1.0、頻寬 1.6 TB/s。950DT 走 Decode 與訓練取向:模型開始一個 詞元 接著一個詞元往外吐的時候,瓶頸通常不是算力,而是權重能不能夠快從記憶體搬到計算核心。950DT 用華為自研 HiZQ 2.0,144 GB、記憶體頻寬 4.0 TB/s,晶片對晶片互連再給 2.0 TB/s,並支援 FP8 與 FP4 這類推論常用低精度格式。點 950DT 而不是 950PR,等於把賭注押在高吞吐的逐詞元生成,而不是提示詞前處理。

這些數字全部來自華為自己的發表與中文產業轉述。截至目前,沒有西方獨立實驗室對 950DT 公布過可比的實測。能拿來對照的,是廠商規格表,以及 DeepSeek 創辦人梁文鋒自己的說法。

加速器記憶體頻寬(廠商規格)公開來源限制
昇騰 950DT144 GB HiZQ 2.04.0 TB/s華為口徑;無獨立實測
昇騰 950PR128 GB HiBL 1.01.6 TB/s華為口徑;偏 Prefill
NVIDIA H200141 GB HBM3e4.89 TB/s對中國無法合法出貨的對照組
AMD MI300X128 GB HBM36.55 TB/s同樣是廠商規格,不是這次訂單的標的

梁文鋒在 2026 年 7 月流傳的投資人通話逐字稿裡講得更直:「GB300 能做的,華為超節點都能做,延遲也一樣。唯一代價:四顆華為 GPU 才等於一顆 NVIDIA GPU,而且落後兩年。」華為輪值董事長徐直軍在 2025 年華為全聯接大會上的論述是另一條路:單卡追不上,就把卡堆成叢集來補。烏蘭察布若真堆到十六萬顆,測的就是這套「用規模換單卡落差」能不能在生產流量上成立。在那之前,梁文鋒自己講的 4 比 1,仍是比較誠實的工作假設。

Atlas 950 SuperPoD 的官方想像更誇張:8,192 顆卡走 UnifiedBus 2.0,華為宣稱峰值 8 exaflops。那是機櫃級宣傳數字,不是烏蘭察布已經到貨的實測。InfoQ 轉述 SemiAnalysis 對 950DT 跑 DeepSeek V4 的指令級拆解時寫過:V4 從架構階段就和昇騰一起設計,注意力機制、混合專家模型量化 與專家並行通訊,都考慮了昇騰的執行路徑。V4 發布時,Day 0 完整支援的軟體棧變成兩套:NVIDIA 的 CUDA,以及華為的 CANN。CANN 是華為用來替代 CUDA 的軟體層。黃仁勳更早在 Dwarkesh Podcast 上把同一件事叫做「horrible outcome」:未來模型如果為華為堆疊最佳化、再擴散到世界其他地方,美國就會失去那條以 CUDA 為預設的軟體護城河。

交貨卡在記憶體,不卡在「有沒有錢」

Bloomberg 的來源把時間表綁在華為產能,而不是 DeepSeek 的現金。950DT 的 高頻寬記憶體 是華為為了繞過美國 HBM 出口限制自己做的 HiZQ 2.0,先進堆疊的良率在放量初期本來就不穩。知情人士說,今年 950DT 產量仍會被卡在數十萬顆量級,還要分給其他客戶、以及少量外銷。十六萬顆因此不是「下單明天就到」,而是對全年產出的一大塊索取。The Decoder 補了記憶體這條線:中國長鑫存儲(CXMT)開始小批量出 HBM3E,但距離三星、SK 海力士、美光已經在量產的 HBM4,仍被估算差三到五年。TechTimes 轉述 Bloomberg 來源時寫:DeepSeek 曾要求北京介入、要華為優先給貨。這句目前也只有知情人士口徑,沒有官方文件。

機房本身的選址比較好解釋。烏蘭察布在北京西北大約 350 公里,年均氣溫約 4°C,冷卻負擔低;它也落在「東數西算」把高耗電運算往電價較低地區搬的路線上。The Next Web 引述內蒙古已簽下約 270 億美元的 AI 算力項目。一吉瓦大約相當於 75 萬戶住宅的用電量級——這是後續媒體的換算,用來理解規模,不是電費帳單。部分產能的目標窗口落在 2027 年底到 2028 年初;整批 950DT 若真要一年以上才交完,完整投運往 2028 之後滑,比「明年就能換掉 NVIDIA」更接近現有證據。

DeepSeek 的資金位置夠撐這種時間表。2026 年 5 至 6 月,公司完成首輪外部融資,募資超過 500 億人民幣(逾 74 億美元),估值約 520 至 590 億美元。梁文鋒個人出資約 200 億人民幣。投資人名單包括騰訊、寧德時代、京東、網易、IDG、Monolith,以及中國國家級 AI 產業基金——後者握有投票權、沒有鎖定期,和商業投資人的位置不一樣。同期還有估值約 5,000 億人民幣的 Pre-IPO 討論。路透社 7 月另報:DeepSeek 在做自己的推理晶片。若那條線走得通,華為大單比較像橋,不是終點;晶片從設計到放量通常仍要三到五年,中間還是同一套產能與材料約束。

開發者現在碰到的,不是新機房,是舊帳單

烏蘭察布還沒接客。現在還在跑的,是已經漲過一輪的 API 價。8 月 16 日,V4-Pro 峰谷價生效:離峰輸出每百萬詞元 1.98 美元,峰值 3.96 美元,峰值相對舊價大約翻了 3.5 倍。細節見DeepSeek V4-Pro 峰谷價生效。格隆匯轉述觀察者網時寫:DeepSeek 自己說過,受高端算力限制,4-Pro 的 API 吞吐量 十分有限,預計下半年昇騰 950 超節點批量上市後,Pro 價格會大幅下調。那是公司對未來產能的口頭承諾,不是已經改寫的價目表。在晶片沒進機房、超節點沒放量之前,開發者能驗證的仍是現價、現併發、現在的排隊,而不是 2028 年的電費。

時點對 API 使用者實際發生的事還沒發生的事
現在峰谷價已生效;Pro 吞吐被官方形容為受限烏蘭察布尚未接客
950 超節點若放量DeepSeek 曾預告 Pro 會大幅降價幅度、時程、是否取消峰谷,都未寫進價目
機房部分投產(目標 2027 末–2028 初)推論流量才有機會搬進國產 GPU 叢集訓練是否跟進,知情人士說目前沒有計畫
全數 16 萬顆交完可能已是 2028 之後單卡與 NVIDIA 的 4 比 1 落差是否被叢集抹平

對還在呼叫 DeepSeek 雲端 API 的人,硬體新聞會先變成三件很具體的事。第一,延遲與排隊:官方都承認 Pro 吞吐不夠,新卡沒到之前,尖峰時段的 延遲 與拒答不會因為一篇 Bloomberg 就消失。第二,價:若超節點真讓 Pro 降價,省到的是百萬詞元單價;在那之前,把長任務、批次摘要、代理迴圈排到離峰,仍比賭「國產卡一到就免費」實在。第三,資料落點:推理叢集若設在中國境內,提示詞與輸出走的是中國法律管轄下的基礎設施。美國多州已限制公務裝置使用 DeepSeek,義大利、捷克也對公務場景下手過。隱私與管轄爭議先前就有人寫過。十六萬顆推理卡會把「你的請求在哪裡被算」從隱私政策上的一句話,變成一座看得見的機房。

訓練端的故事相反。V4 能在昇騰上做 Day 0 推理,不代表下一輪預訓練可以整鍋端走。CUDA 生態的工具、除錯器、社群範例與框架適配,累積超過十年;CANN 在 2025 年 8 月才開源,主要使用者也集中在中國開發者與中國硬體。SemiAnalysis 的 trace 證明的是「V4 這一代推論鏈路可以為昇騰重寫」,不是「所有研究人員明天都能在昇騰上復現 NVIDIA 叢集上的訓練曲線」。一個把研究鎖在 NVIDIA、把產品鎖在華為的公司,短期最像的形狀是雙棧:貴的那一棧用來長模型,便宜、可擴、受出口管制較少的那一棧用來接客。

出口管制換成兩套互不相通的工廠

Bernstein 對 2026 年底中國 AI 晶片市占的推估被多家媒體反覆引用:華為約 50%,NVIDIA 從 2025 年約 40% 落到約 8%。這是假設、不是已審計的年終數字,前提包含對華出口許可維持緊縮。黃仁勳 2026 年 5 月對 CNBC 說得更乾脆:需求很大,華為很強,NVIDIA「largely conceded」中國市場。同一段訪問裡,他要投資人對中國資料中心營收「expect nothing」。華為 AI 晶片營收的公開估算是 2025 年約 75 億美元、2026 年目標約 120 億美元。Reuters 稍早寫過,字節跳動拿下昇騰 950 大約一半產能,阿里與騰訊各跟數十萬顆。中國移動 2026–2027 年度超節點集採也點名昇騰節點。DeepSeek 這 16 萬顆不是孤例,是同一條產能隊伍裡又一名大客戶。

美國從 2022 年 10 月開始收緊對華先進 AI 晶片出口,後續幾輪把 H800、H20 也捲進去。政策原意是卡住中國前沿算力。CSIS 一類評估的常見結論是:管制造成了以年計的延遲,同時加快國產替代。黃仁勳擔心的「horrible outcome」,指的不是中國永遠買不到 NVIDIA,而是中國開始用另一套軟硬體標準把模型做進生產,再把這套標準帶出國。DeepSeek 的 V4 已經在 CUDA 與 CANN 兩側做 Day 0;烏蘭察布若建成,是把 CANN 這一側從「能跑」推進到「有一座吉瓦級的家」。

NVIDIA 同一週剛簽字收購 Hugging Face,交割目標寫在 2027 年上半年,見NVIDIA 簽字買 Hugging Face。一邊是閉源實驗室越來越常自研推論晶片、開源模型入口被 NVIDIA 買下;另一邊是中國最被盯上的模型公司,把推理工廠直接開在華為卡上。兩件事不必互相解釋,但它們畫出同一條裂縫:全球 AI 運算正在分成兩套工廠、兩套互連、兩套軟體,中間的轉譯成本只會變高。

這筆訂單現在能證明什麼,不能證明什麼

它能證明的是:DeepSeek 願意把推理——也就是 API 帳單那一端——押在華為下一代卡上,規模大到足以改寫「國產卡只適合示範」的印象。它不能證明的是:中國已經在訓練上取代 NVIDIA。知情人士把那條線畫得很清楚。它也不能證明十六萬顆明年就會亮燈。產能、HBM、其他客戶排隊、以及 DeepSeek 自己有沒有把合約簽完,每一項都還能讓日曆再往後滑。

對還在用 DeepSeek 的人,比較務實的驗證清單不需要等 2028。看三件事就夠。第一,950 超節點有沒有真的放量,以及 Pro 價目有沒有跟著改——口頭「大幅下調」要變成數字。第二,官方或可靠洩漏有沒有修正「950DT 不做訓練」這句話;一旦訓練也搬過去,梁文鋒的 4 比 1 才會被生產數據重寫。第三,新流量是不是開始出現可量到的 吞吐量 改善,而不是只有機房效果圖。在這三件事出現之前,烏蘭察布仍是一座規劃中的推理工廠,不是已經改寫你這週帳單的那台機器。