返回資訊
AI趨勢入門

OpenAI Jalapeño 首批 InferenceX:每瓦吞吐最高 1.9 倍,延遲最低砍到 3.6 倍

2026年8月25日
易賺Ai團隊
12 分鐘閱讀
#NVIDIA#OpenAI#晶片#Jalapeño#InferenceX
OpenAI Jalapeño 首批 InferenceX:每瓦吞吐最高 1.9 倍,延遲最低砍到 3.6 倍

OpenAI 硬體負責人 Richard Ho 在媒體通話裡把話說死:這批數字顯示「相對現有最先進系統,非常、非常顯著的性能躍進」。Jalapeño 能在同一套架構上同時拉高吞吐、壓低延遲——現成的 GPU 系統常常得在兩者之間做選擇。官方部落格把比較單位訂成「每單位電力能完成多少 人工智能 工作」,而不是單顆晶片的峰值。額定功耗 700 瓦;官方寫,實測持續功耗落在 550 瓦或以下。對照組是 GB200 的 1.2 千瓦,以及 GB300、AMD MI355X 的 1.4 千瓦

這不是六月那次「我們做了一顆晶片」的揭幕重播。六月揭的是產品存在,這次揭的是 SemiAnalysis 公開基準 InferenceX 上的第一組可對讀數字。測試模型是 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T,三款都不是為這顆晶片共設計的。大型語言模型推理 只跑、不訓練;SemiAnalysis 也糾正一則常見誤讀:Jalapeño 不是只為 OpenAI 自家權重特化的黑盒,實驗室裡連 Doom 都能用 Codex 提示詞移植上去跑。

指標OpenAI/Hot Chips 說法讀法
峰值每瓦吞吐三款模型 1.5–1.9 倍以各加速器公開晶片功耗正規化
端到端延遲1.7–3.6 倍更低高吞吐到低延遲整個操作區間
互動負載2.1–4.1 倍官方互動場景另列
匹配解碼速度下每千瓦 token 吞吐約 54–104 倍GPT-OSS 約 53.7 倍、R1 約 104.3 倍、Kimi 約 56.1 倍
單用戶速度GPT-OSS 約 1400 tok/s;R1 併發 1 逾 700 tok/sOpenAI 提供、部分 runs 現場核對

ServeTheHome 從現場投影片抄下更細的匹配點:GPT-OSS 120B 約 1.9 倍峰值混合 token/千瓦、端到端延遲約 1.7 倍;R1 約 1.7 倍峰值、延遲 3.6 倍;Kimi K2.5 約 1.5 倍峰值、延遲 3.4 倍。官方對 Kimi 這顆最大公開模型的寫法幾乎同一組數字。單 token 預測的 Jalapeño 直接對上開了多 token 預測的 GB300 時,R1 的領先會收成約 1.5 倍峰值與 2.2 倍延遲——仍正、但已經不是頭條那種倍數。

為什麼 SemiAnalysis 說比較對象該換 Vera Rubin

Decoder 與 SemiAnalysis 的長文把標題裡的「打贏 Blackwell」往後拉一層。Jalapeño 用的是 高頻寬記憶體 HBM4,公平對照是同樣走 HBM4 的 Vera Rubin,不是上一代 Blackwell。Rubin 系統已經開始出貨;Jalapeño 還停在工程樣品。Dylan Patel 的評語被多方轉述:第一代晶片通常沒競爭力,OpenAI 卻打到 Blackwell、甚至 Rubin。

即便如此,SemiAnalysis 寫:Jalapeño 的單 token 預測、每兆瓦輸出 token,仍超過 NVIDIA 與 CoreWeave 七月公布、使用多 token 預測的 Vera Rubin 數字;每美元輸出 token 則大致打平。這句比「全面碾壓」重要。打平的一半原因,是把 NVIDIA 的高毛利換成 Broadcom 仍高、但較低的毛利;另一半才是架構。Jalapeño 這批數字沒有用推測解碼、多 token 預測,也沒有把 prefill 與解碼拆到兩池矽。對照系統有的用了這些技巧。官方與 ServeTheHome 都留一句後手:若補上多 token 預測,等效率下延遲還能再改善約 3 到 5 倍

實驗室核對有邊界。數字由 OpenAI 提供;SemiAnalysis 到場核對 InferenceX,但沒跑完整套件,也還沒看到他們更看重的 AgentX——長上下文、多輪、更接近生產AI代理 快取行為的那一套。8k 輸入/1k 輸出好調;路由、前綴快取、卸載基礎設施,單輪基準測不到。NVIDIA 與 AMD 已經在更大的 DeepSeek V4 Pro、Kimi K3 上公布 AgentX;Jalapeño 還沒交出那兩顆。GSM8k 上,SemiAnalysis 確認分數與 NVIDIA 晶片同級,至少表示沒為了速度把精度偷偷卸掉。

機櫃長什麼樣,以及為什麼 KV 不搬家

單顆:MXFP4 矩陣運算 13.4 PFLOP/s、216 GiB HBM4、頻寬 15.4 TB/s、700 瓦封裝。一櫃 128 顆加速器,約 1.7 EFLOPS(4-bit)、合計約 27.5 TB HBM4,記憶體頻寬接近每秒 2 PB。再往上,半扁平兩層 Clos、Broadcom Tomahawk6,全域域 2048 顆,約 27 EFLOP/s、432 TiB;本地 128 顆域約 600 GB/s,全域約 200 GB/s,張量平行走高頻寬、專家平行走較低頻寬。

OpenAI 把一次請求拆成三段硬體狀態:算力密集的 prefill、超低 batch 的草稿模型、記憶體頻寬綁定、夾帶突發 MoE 通訊的驗證解碼。比例會隨工作負載改。分開買「prefill 矽」和「decode 矽」的異質車隊,閒置那一側仍在付封裝、HBM、I/O 與網路的底噪。Jalapeño 的選擇是單顆平衡晶片:把 KV快取 釘在本地,按階段改變算力/記憶體/網路的啟動比例,用不到的單元關暗,而不是每跨一個階段就讓 KV 在網路上跑一趟。官方原文幾乎是這句:「模型狀態,包括生成回應時用的 KV cache,可以被明確放置並保持在本地。」

紙面頻寬很兇。128 顆合計超過每秒 1 PB 時,只看頻寬天花板,無推測解碼大約是每用戶 1000–2000 tok/s,有推測解碼 5000–10000;OpenAI 承認實系統遠低於這兩個數,表示瓶頸不只在 HBM。每個核心切片配一塊 HBM 切片當快速本地視圖,再加一條專用低延遲集合網路走常見跨核圖案,剩下的走通用 NoC。編程模型叫空間架構:Gluon 把實體核當 thread block 編,張量佈局顯式記錄物理位置,方便人讀,也方便前沿模型去搜映射、排程與管線。內部系統把功能正確的 kernel 往上推,注意力與 MoE kernel 端到端實測比既有專家手寫快 1.5–1.8 倍

時程被寫成兩種算法。OpenAI:從第一版晶片設計到送廠藍圖約 九個月,中間用自家模型加速設計與優化,舊世代幫晶片、新世代幫編程。SemiAnalysis:從中 2024 組隊到 2025 年 11 月 tape-out 約 十六個月。現場時間線還補了 2024 年底架構構想、2025 RTL 凍結、A0 回實驗室後把三款開源模型都跑起來,以及 Codex 已在目標頻率與功耗上跑。B0 已在晶圓廠的說法,被產業日報寫成每瓦再改善約 25%;這是製程踏步,不是這次基準本身。Celestica 負責板、櫃與系統。Ho 給的出貨窗是 2026 年底「非常小的量」,有意義的部署在 2027。CFO Sarah Friar 的定位沒變:這顆晶片補進資料中心、晶片、模型、開發者平台、產品與裝置的一體策略, NVIDIA、AMD、AWS、Cerebras、CoreWeave 這些既有夥伴,不是立刻取代。

這組數字會改誰的採購表

對跑 ChatGPT 與 Codex 的人,短期帳單不會改——你買不到這顆晶片。改的是 OpenAI 自己每焦耳能吐多少 token,以及它還要向黃仁勳下多少訂單。和站內 俄亥俄 PORTS-Pike 殘值擔保 並讀:那邊鎖的是 20 年殼體與電力,這邊鎖的是同一家公司開始用自研推論矽消化部分負載。和 NVIDIA AI 伺服器傳漲逾 15% 並讀:機櫃被 HBM 拖著漲的時候,自研 700 瓦、每兆瓦領先的路線聽起來就不像閒棋。SemiAnalysis 把 CUDA 護城河寫成「可能已死」,理由是 OpenAI 能多快在自有矽上把新模型帶起來;這是分析師判斷,不是 NVIDIA 認輸。Meta、微軟的 ASIC 計畫更早起步卻沒交出對等公開基準,也被拿來當對照:便宜矽只是方程式的一項。

官方把 Jalapeño 寫成多世代平台的 Gen 1。Hot Chips 投影片上 Gen 2 瞄準更好的每瓦,Gen 3 瞄準「划算的低延遲服務」,重點從「再加一截原始頻寬」轉成「把已經買下的 HBM 頻寬真正用滿」。這和 SemiAnalysis 的電力論對得上:OpenAI 現在受資料中心功率限制,不是受預算或地板面積限制;黃仁勳在 Computex 把同一句話說成「你若有 1 GW,每瓦吞吐就是營收」。tok/s/MW 化簡後就是每焦耳 token。誰能在同一條市電上多吐字,誰才有下一輪產品的餘地。Jalapeño 選擇不把 prefill 與 decode 拆池,草稿模型與主模型共用同一批晶片與交換網,換來的是工作負載比例改了不必重買一車異質矽。知識模型、推理模型、代理模型三段時期,輸入/快取寫入/快取讀取/輸出的比例已經翻過幾輪;鎖定異質車隊比例,等於賭比例不再變。

開發者買不到這顆晶片,但能感覺到它存在的方式,是 OpenAI 還有沒有空間繼續降 API 價、以及自有產品的互動延遲還能不能再壓。站內 GPT-5.6 Sol 官方 API 連降三個月 是軟體價;Jalapeño 是硬體帳。兩條線不必同一季兌現,但方向一致:把每百萬 token 的成本從「向 NVIDIA 進貨」部分改成「自己燒電」。TechCrunch 記下 Ho 的部署窗——2026 年底非常小的量、有意義的規模在 2027——意思是這組基準改變的是 2027 年的伺服器採購會議,不是明天的 ChatGPT 延遲面板。SemiAnalysis 還把 Cerebras 在 OpenAI 確定 750 MW 之外那截 1.25 GW 選擇權寫成可能動搖,並點名 AMD 的 kernel 團隊該緊張;這是分析師外推,不是合約變更公告。

社群會把「打贏 Blackwell」當標題,把「對 Rubin 每美元打平、樣品對出貨」當內文。兩句都要留。NVIDIA 與 AMD 還沒被要求用同一套 InferenceX、同一組公開模型、關推測解碼來重跑;OpenAI 也還沒在 AgentX 上證明長上下文代理負載同樣領先。下一步能驗證的很具體:年底小量是否真的進 OpenAI 機房、B0 是否把 700 瓦額定下的持續功耗再往下推、推測解碼補上之後 TCO 還能不能對 Rubin 保持打平或翻面。在那之前,Jalapeño 是第一代就站上 Pareto 前沿的自研推論 ASIC,不是已經能量產改寫供應鏈的第二來源。