返回趨勢情報
趨勢情報

華為把昇騰 960DT 提前三季:單卡 2 PFLOPS、288GB HBM,超節點從 1.5 萬卡縮到 4096

2026年9月18日
易賺Ai團隊
23 分鐘閱讀
#NVIDIA#AI晶片#華為#昇騰#超節點
華為把昇騰 960DT 提前三季:單卡 2 PFLOPS、288GB HBM,超節點從 1.5 萬卡縮到 4096

單卡數字先落地。華為輪值董事長汪濤在上海全聯接大會上把昇騰 960DT 的就緒時間改成 2027 年第一季,比原計畫早三個季度。官方規格寫成:單卡 2 PFLOPS FP8、4 PFLOPS FP4,片上 高頻寬記憶體 最大 288GB,訪存頻寬 9.6TB/s。同系列的 960PR 改到 2027 年第三季就緒,單卡同樣 2 PFLOPS FP8,但 FP4 拉到 8 PFLOPS。發言人向 TechCrunch 確認「昇騰 960 晶片提前、性能倍增、一年一代」。晶片時程往前推,是這場大會最容易被寫成標題的一句。

同場還有另一組比較難消化、但對機房採購更關鍵的數字。汪濤發布的昇騰 960 超節點,單節點只擴到 4096 卡,總算力 8 EFLOPS FP8、16 EFLOPS FP4。2025 年全聯接大會的公開規劃裡,Atlas 960 SuperPoD 是 1 萬 5488 卡、30 EFLOPS FP8、60 EFLOPS FP4、220 個機櫃、佔地 2200 平方公尺。中國科技分析師 Rui Ma 在社群上直接點破:晶片提早很多,但這次亮相的 SuperPoD 比原先鋪出去的規模小得多。華為沒有在台上解釋 1.5 萬卡那一版是取消、延後,還是改成由多個 4096 卡超節點再串成叢集。

我們不能接受命運由別人願不願意把晶片賣給中國來決定。不管是對中國政府、中國產業還是華為,推動晶片完全自立都是必須走的路。

這句話出自另一位輪值董事長徐直軍會後對記者的說明。他同時說,昇騰連中國市場都供不上,沒有計畫全面衝海外;部分需求特別強的國家會供一點,量仍有限。他還給了一個沒有附數據的市占判斷:「我認為昇騰在中國的市占應該比 NVIDIA 大。」TrendForce 稍早估過,國產供應商今年可能吃下中國高端 AI 加速器近九成;工信部數據則是,到 6 月底全國智算規模 2185 EFLOPS,年增 177%。產能不夠、市占敘事、超節點變小、晶片提前,四件事在同一天出現,讀起來不像一場單純的發表會。

單卡先對表:960DT、960PR 與一年一代

華為把 960 拆成兩款,用途寫得比去年清楚。DT 走通用與訓練向,PR 把 FP4 推理算力加倍。兩款都還沒公布每百萬 Token 價格、單任務成本,也沒有對標 NVIDIA Blackwell 架構 或 Vera Rubin 機櫃的公開基準。能核對的只有官方自己給的規格與時程。

產品就緒時程對原計畫FP8FP4記憶體
960DT2027 Q1提前三季2 PFLOPS4 PFLOPSHBM 最高 288GB、9.6TB/s
960PR2027 Q3提前一季2 PFLOPS8 PFLOPS未單列
9702028一年一代宣稱再倍增宣稱再倍增訪存與互連同步加
9802029一年一代宣稱再倍增宣稱再倍增同上

汪濤把這條路叫 τ(Tau)Scaling Law:算力規格繼續翻倍,訪存頻寬、訪存容量、互連頻寬一起加,而不是只堆浮點。950 系列已是華為第一代用自研記憶體的昇騰加速卡;美國出口管制切斷了 SK hynix、三星、美光最新 AI 記憶體後,這件事不再是附加規格,而是能不能出貨的前提。Bloomberg 此前引述知情人士:昇騰 950DT 建議售價三個月內跳約 60%,到每卡約 25 萬人民幣(約 3.73 萬美元),對齊 NVIDIA B200 的報價帶。Reuters 另一組消息源把漲幅寫成 20% 到 50%,視合約而定。大會當天汪濤沒有解釋 960 會不會沿用這套漲法,也幾乎沒有展開「訓練向晶片」相對 NVIDIA 旗艦的單卡差距。

South China Morning Post 轉述的系統層對比是:搭載昇騰 960 的 Atlas 960 SuperPoD,對十萬億參數量模型的訓練推理,相對上一代 Atlas 950 SuperPoD 分別提升 2.3 倍與 2.5 倍。這組倍數是系統對系統,不是單卡對單卡。950 SuperPoD 先前公開過 8192 卡、8 EFLOPS FP8;960 超節點 4096 卡、8 EFLOPS FP8,單卡算力倍增、卡數腰斬,總浮點大致打平,再靠互連與光引擎把可用率拉上去。這也是為什麼「晶片提前」和「超節點變小」可以同時成立:單位從一座 1.5 萬卡的大樓,改成一塊 4096 卡的積木。

風冷版超節點標 2027 年第二季上市,液冷版第三季。晶片 Q1 就緒、系統 Q2 才出,中間那一季是組機、光引擎與液冷驗證的空窗。誰在 Q1 能拿到 960DT 單卡、拿來做什麼負載,官方沒寫。

超節點縮到 4096 卡,光進到封裝裡

華為把這代超節點的賣點押在近封裝光學(NPO)。自研光引擎叫 Hi-ONE,單引擎傳輸容量 7.2T,官方稱是業界首個能量產的 NPO、目前容量最大、也是唯一內建光源的 NPO 產品。一座 960 超節點用 5500 個 Hi-ONE,取代原本需要的 4.8 萬顆 800G 光模組,功耗降低超過 550 千瓦,系統無故障運行時間提升一倍,可用度寫成 99.8%。架構是正交佈局加全液冷,記憶體靠靈衢(UnifiedBus)做統一編址。C114 轉述的現場數字還有一項:整節點 HBM 容量到 1PB。用單卡 288GB 乘 4096,約 1.18PB,數量級對得上。

傳統機櫃把光模組插在交換器面板上,線一拉就是機櫃間的跳線。NPO 把光電轉換貼近 NPU 封裝,短電氣路徑換低延遲、低功耗。華為還在全球光互連標準組織 OIF 提案把 NPO 立項。這一步的商業含義很直:單卡追不上 NVIDIA 時,就改寫「卡和卡怎麼說話」。NVIDIA 用 NVLink 把多顆 GPU 綁成一台更大的機器;華為把對標物寫成靈衢,一條開放協定串 CPU、NPU、記憶體、SSD、網卡與交換器,宣稱對等互連、不做主從。

Rui Ma 點名的 4096 對 15488,不能只用「模組化」輕輕帶過。2025 年那版 Atlas 960 SuperPoD 是單一超節點 1.5 萬卡、30 EFLOPS FP8;這次發布的是 4096 卡、8 EFLOPS。若只買一座超節點,算力從規劃中的 30E 掉到 8E。華為的回答藏在下一層:多個 960 超節點用靈衢或 RoCE 再串,二層 CLOS 四平面組網最大 51.2 萬卡,再加多軌道拓撲最大 100 萬卡。Peerium 計算架構的口號就是「讓百萬處理器像一台電腦」。單位變小、叢集變大,對施工、供電、故障域都比較好切;代價是,買家不能再把「一座 SuperPoD = 1.5 萬卡」當成交貨承諾。

項目2025 年規劃的 Atlas 960 SuperPoD這次發布的 960 超節點
單節點卡數15,4884,096
FP8 算力30 EFLOPS8 EFLOPS
FP4 算力60 EFLOPS16 EFLOPS
機櫃/面積220 櫃、2200 m²未給整櫃數
互連UnifiedBus靈衢 + Hi-ONE NPO
光模組未用 NPO 當賣點5500 顆 Hi-ONE 換 4.8 萬顆 800G
可用度未寫99.8%
系統時程2027 Q4風冷 2027 Q2、液冷 Q3

汪濤給的使用場景是十萬億級大型語言模型的訓練與推理。中國科技媒體與 Global Times 都寫成:這套超節點要扛 10 萬億參數模型。他同時拋了一組更遠的需求曲線:今天大模型參數往 10 萬億走,2030 年可能到 100 萬億以上;AI 代理現在能按小時連續工作,2030 年要以月為單位執行任務;中國每日推理 Token 已到每日約 500 萬億,2030 年要到百萬萬億級;端側手機模型從 2024 年的 3B 走到今天的 30B,未來往 100B。這些是華為自己的外推,不是第三方審計數字,但它們決定了為什麼 4096 卡只是積木、百萬卡才是目標。

十萬卡為什麼還是不夠:通訊吃掉四成訓練時間

華為把超節點說成「產、學、研已經形成的共識」,定義寫得很硬:物理上由多個計算節點用高頻寬低延遲協定緊密連接,具備跨物理節點統一記憶體編址,邏輯上像一台電腦。截至大會當天,昇騰 910C 超節點已部署超過 1000 套,昇騰 950 超節點進入規模商用。Atlas 950 SuperCluster 的 25.6 萬卡版本,官方英文稿寫成「已經在部署」。

真正要解決的痛在下一句。當前 10 萬卡 GPU 叢集 已是訓練十萬億級 SOTA 模型的標配,但傳統伺服器架構讓叢集內通訊超過訓練時間的 40%,嚴重卡住模型浮點算力利用率(MFU)。華為馬爾科夫實驗室的仿真:由 4K 超節點組成的 10 萬卡叢集,相對由 8 卡伺服器組成的同規模叢集,MFU 提升 2.75 倍。換句話說,買 10 萬張卡,若互連仍走普通伺服器,四成時間花在卡跟卡打招呼,不是在算Transformer

這解釋了華為為什麼不再把話術停在單卡 FLOPS。單卡追 NVIDIA 受制程、HBM、先進封裝三道牆;系統層還能做的是:把通訊從訓練時間裡摳出來。Peerium 架構的三根柱子是巢狀平行、統一記憶體編址、對等互連。官方稿用 Nested BSP(巢狀批次同步平行)說自己突破圖靈範式、延伸馮紐曼單機、推翻主從架構。工程上能驗證的,仍是那 2.75 倍 MFU 仿真、那 40% 通訊佔比,以及 Hi-ONE 換掉 4.8 萬顆可插拔光模組後省下的 550 千瓦。仿真不是實測;10 萬卡、51.2 萬卡、100 萬卡三檔,目前都還沒有第三方跑分。

分散式訓練團隊,這組數字的讀法很具體。若你的 10 萬卡叢集今天有四成時間耗在 AllReduce 與專家路由的跨機通訊,超節點承諾的是把那四成壓下去,而不是讓單卡突然快 2.75 倍。混合專家模型、長序列、跨節點 KV 快取 會先受益;純單機小模型、已經塞進一櫃的推理池,感知會弱很多。華為也沒有公布 960 超節點在專家平行、流水線平行、張量平行各自的加速比。

代理流量要來了,沙箱與 KV 快取被寫進同一張清單

汪濤把超節點從智算延到通算。升級後的鯤鵬超節點同樣走靈衢全光組網,最大 4096 節點,形成 256TB 統一記憶體池。官方給了兩個代理場景:十萬級 AI 沙箱 啟動比傳統伺服器方案快 30 倍,密度還能再加 25%;百億千維向量檢索,效率相對傳統伺服器倍增。同一套總線上還有 OceanStor M900:標成 L3.5 層、PB 級 KV 快取 叢集,走靈衢「一跳直連」,混合介質加 Retention 演算法,宣稱把 SSD 讀寫壽命提升 16 倍。

這不是附贈功能列表。十萬億參數的 SOTA 模型,訓練與推理已經不是「一排 GPU 伺服器」能描述的系統,而是智算超節點、通算超節點、免協定轉換的互連、再加上推理路徑上的多層 KV 快取。華為把昇騰超節點、鯤鵬超節點、KV 快取叢集寫成對等子系統,協定統一成靈衢,減少協定轉換。對要跑長任務自主智能體的人,這張圖比單卡 PFLOPS 更接近真實帳單:代理要起沙箱、要檢索、要把 KV 放在離計算夠近的地方,否則 4096 張卡也會在等儲存。

同一週稍早,華為在《Intelligent World 2035》裡預測,自主智能體到 2035 年會佔全球 AI Token 流量超過 90%,全球活躍代理上看 9000 億個。Connect 現場把這條需求曲線接進硬體:代理按月執行任務、KV 要 PB 級、沙箱要十萬級並發。徐直軍同時把「代理安全」列進公司十項技術優先。中國也在起草AI 代理安全強制國家標準。硬體發表會把沙箱密度寫進規格,本身就是在承認:下一波不是聊天框,是會自己開門的行程。

開發者能立刻碰的,仍是軟體而不是 960 卡。汪濤宣布 CANN 已進常態化開源社區運作,外部開發者占比 61%,第一次超過內部;社區月活突破 5270,官方自稱中國最活躍開源社區;基於昇騰 + CANN 原生訓練的模型超過 40 個,並稱是國內唯一能走預訓練的技術路線;覆蓋 90 多個主流第三方社區,點名 PyTorch、Triton、vLLM、veRL。在 Linux 基金會支持下,昇騰成為 PyTorch 官網可直接安裝的算力平台,也是第一個來自中國的。鯤鵬生態另報:全球開發者超過 416 萬,夥伴超過 7200 家,支援 560 多個開源專案,openEuler 裝機突破 2000 萬套。

這些數字要跟 CUDA 放在同一張桌上讀。NVIDIA 沒有在大會後立刻回應。遷移成本不在 CANN 的月活裡:算子、圖編譯、通訊庫、除錯工具、現成的訓練配方,缺一塊就會把 2.75 倍 MFU 吃回去。40 個原生訓練模型是生態起點,不是終點;「PyTorch 官網可安裝」降低的是入門摩擦,不是把現有 CUDA 叢集一鍵搬過來。華為自己也把戰略寫成「硬體變現」:軟體開源是為了把昇騰賣出去,不是為了當中立基金會。

中國市場先不夠賣,訓練仍可能還在 NVIDIA 上

徐直軍對記者說,昇騰 950DT 測試結果不錯,正與中國模型開發者密集討論,預期其中許多會在明年開始用這套系統做訓練。「明年開始訓練」這句,等於承認今天多數前沿訓練仍不在昇騰上。稍早已經寫過,DeepSeek 計畫在烏蘭察布部署至少 16 萬顆昇騰 950DT,用途被知情人士說成只跑推理、不跑訓練,訓練仍靠 NVIDIA,見DeepSeek 下單 16 萬顆昇騰 950DT。Straits Times 這次把同一結構又講了一遍:中國前沿實驗室仍大量用美國晶片訓練,再用國產卡去推論。

產能是另一道牆。徐直軍的原話接近:連滿足中國需求的產能都沒有,不會以全面方式衝國際市場。摩根士丹利估過,中國 AI 算力市場 2030 年可能到 6460 億人民幣。需求曲線向上、950DT 才剛漲價、960 還要等兩個季度才有風冷整櫃,中間這段會繼續出現GPU 短缺式的排隊。華為近年用 LogicFolding 等手法,試圖在拿不到最好製程設備的前提下把單卡做強;Morgan Stanley 分析師 Charlie Chan 的判斷是,系統級競爭比單卡更關鍵,多晶粒、先進封裝、機櫃級架構、光網路與軟硬協同,正在把有效差距收窄。收窄不是抹平。NVIDIA 最新 Blackwell 在中國不能直接買到,但不代表訓練端已經換完棧。

海外敘事華為仍想講。汪濤說要「為世界提供新的選擇」,馬來西亞、埃及等市場先前已被點名。徐直軍把量說死了:有供、但有限。美國自 2019 年 5 月起對華為另有貿易限制;出口管制卡的是先進製程設備與高階 HBM,不是簡報上的百萬卡示意。TechCrunch 特別標了一個日曆:這場發表會距川普與習近平在華府會面只剩一週。黃仁勳同一週在 Dreamforce 把「加速」和「安全」說成假選擇,反對靠新法讓全行業一起慢下來,見黃仁勳在 Dreamforce 的回應。華為這場會把同一組詞用反了:中國要先快,才能感覺到美國實驗室已經在談的風險。

徐直軍說的風險:還沒強大到能感覺

會後記者會上,徐直軍把安全討論從「要不要慢」轉成「有沒有資格感覺」。他說,美國主流模型商擁有海量算力,「也許只有他們自己知道自己的模型到了哪裡」;他們能感覺、能知覺的那類 AI 風險,「可能是中國或中國模型商還感覺不到的」。接著他給出自己的處方:「也許中國的模型商需要加快步伐,達到也能感覺 AI 發展帶來的風險的水準。」下一句才是平衡:「要在推動 AI 發展和管理 AI 風險之間取得平衡。」

這段話的背景是美國實驗室正把「放慢前沿」講成公開政策。Anthropic 執行長呼籲 pace the frontier,OpenAI 開始定期揭露模型不當行為,兩邊員工據報對執行長公開喊減速感到意外。中國路徑不同:把先進 AI 當成可管理的技術,邊部署邊做強制標準與安全評估,包括代理繞過控制、對外攻擊這類風險。徐直軍沒有附上中國模型在越獄、自主複製、網路攻擊上的公開事故清單,也沒有對標 OpenAI 那套揭露框架。他的邏輯是能力門檻:算力不夠,風險圖譜不完整;要看見那些風險,先把算力堆上去。

對採購與治理,這是可檢驗的立場,不是口號。若 950DT 明年真的承接國產訓練、960 超節點按 Q2/Q3 出貨,中國實驗室會不會開始發布對齊事故、代理逃逸、獎勵駭入,會比百萬卡示意圖更能驗證「感覺到風險」這句話。若訓練仍留在 NVIDIA、昇騰只消化推理吞吐量,那徐直軍描述的能力落差會維持,風險討論也會繼續隔著一道算力牆。

現場沒有給的東西,同樣要寫進對帳單。960 系列沒有公開每百萬 Token 雲端單價,沒有單卡對 Blackwell 的第三方基準,沒有 4096 卡超節點的實測 MFU,沒有 51.2 萬卡與 100 萬卡的交貨客戶,沒有 CANN 遷移現有 CUDA 訓練任務的平均人月,也沒有解釋 2025 年 1.5 萬卡 SuperPoD 規劃如何折進這次的 4096 卡產品。汪濤沒有回答如何爬出製造瓶頸。徐直軍的中國市占「應該比 NVIDIA 大」沒有附份額。缺這些,不等於發表會作廢;等於買家還不能把簡報當合約。

風冷超節點標在 2027 年第二季。那一季若按時出櫃,要核對的不是口號,而是三件事有沒有同時發生:有沒有實驗室用 950DT 或 960DT 做完整預訓練而不只是推理;4096 卡超節點的實測通訊佔比有沒有從四成壓下來;CANN 那 40 個原生訓練模型之外,有沒有新的萬億級模型把權重訓練過程公開寫在昇騰上。晶片提早三季已經寫進日曆。日曆後面是產能、互連與軟體,三樣都還沒辦法用一張發表會投影片結案。