企業把大型語言模型訓練完了,下一步往往卡在同一個地方:推理要跑在哪。資料在私有機房、應用在好幾朵雲、使用者散在不同都會,GPU 卻常常集中在另一個區域。Equinix 在首屆客戶與夥伴活動 Horizon 端出的答案,不是再蓋一座訓練工廠,而是把「推論放哪、怎麼連過去」做成一套可賣的服務。
這套服務叫 Equinix Inference Exchange。官方新聞稿把它拆成三層:Equinix 出機房、電力、進階冷卻與日常維運,再用既有的 Equinix Fabric 接到雲、網路與 AI 供應商;NVIDIA 出經過驗證的 Enterprise Reference Architectures,目標寫成提高 AI 工廠吞吐量、壓低每個 Token 成本;Together AI 把推論平台疊在上面,宣稱支援逾 200 個開源模型,並同時提供多租戶共享與單租戶專用兩種環境。Equinix 執行長 Adaire Fox-Martin 的定位句是「架構先天中立、預設開放」。NVIDIA 全球 AI 雲與基礎設施生態副總裁 Raj Mirpuri 則把加速運算直接講成「戰略資產類別」,說這套組合要把智慧放到更靠近資料、應用與客戶的地方。
同場還有第二件產品:Equinix Fabric One。它不跑模型,只管連線。客戶用入口網站、API、自動化工作流、AI代理請求或自然語言提示,寫下「我要連什麼、要滿足哪些條件」,Equinix 再去編排路由、雲端連線、加密、韌性與故障轉移。主導整合夥伴是 Google Cloud 與 AWS,技術底座是兩家雲共同參與的開源 OpenAPI 3.0 Interconnect 規格。Equinix 產品長 Chris Audie 的說法更直白:過去幾十年企業網路是「每個夥伴拉一條線」,這種做法撐不住分散式 AI。
IT Brief、TechWire Asia、Converge Digest 與多家產業媒體在後續報導裡,幾乎都把兩件事當成同一套棋:一邊把開源模型推論搬進 Equinix 的都會機房,一邊把跨雲、跨供應商的連線從專案工程改成託管服務。官方給的交貨時間也很齊:Inference Exchange 從 2027 年第一季開始提供;Fabric One 預計今年稍晚進測試,2027 年正式上市,第一波在北美。
三層分工寫清楚了,價目表還沒寫
先把官方已經肯講、以及明確沒講的東西攤開。Together AI 執行長 Vipul Ved Prakash 說,企業不該在模型表現與營運彈性之間二選一。這句話對得上的是產品形狀:共享叢集省錢、專用叢集隔離,中間用 Fabric 接到你原本就在用的雲與資料。對不上的是採購人員真正要填的格子。
| 項目 | Inference Exchange | Fabric One |
|---|---|---|
| 角色 | 分散式企業 AI 推論部署 | 意圖驅動的任意對任意連線 |
| 夥伴 | NVIDIA、Together AI | AWS、Google Cloud |
| 技術底座 | NVIDIA 企業參考架構;Together AI 逾 200 個開源模型 | OpenAPI 3.0 Interconnect 規格+Equinix Fabric |
| 客戶介面 | Together AI 平台,多租戶或單租戶 | 入口、API、工作流、代理、自然語言 |
| 使用情境 | 都會邊緣推論、閉源遷開源、主權AI | 多雲組網、代理自動開通、分散式 AI 連線 |
| 上市 | 2027 年第一季 | 今年稍晚測試,2027 年正式、北美先上 |
| 尚未公布 | GPU 機種、都會清單、價目、SLA、效能數字 | 價目、SLA、開通都會、服務邊界 |
Converge Digest 把這張表的空白寫得很乾:Inference Exchange 沒有公開 GPU 組態、部署都會、定價與基準測試;Fabric One 同樣沒有價目與服務邊界。Equinix 說 Fabric 會接到各大都會的推論供應商,用來縮短 time-to-first-token(第一個 token 出現前的等待),但沒有給對照組,也沒有說這段等待裡有多少來自網路、多少來自模型載入與排程。你如果把「靠近使用者」理解成「回應一定比較快」,官方材料撐不起這個等式。都會機房只能砍掉網路那一段;模型載入、佇列、加速器選擇、批次大小與推論軟體,仍決定總延遲。
NVIDIA 這一層也要拆開看。Enterprise Reference Architectures 不是一張晶片型號,而是涵蓋運算、網路、儲存與軟體的生產環境藍圖。TechWire Asia 補了一段歷史:2024 年 1 月,Equinix 已經讓企業把自有的 NVIDIA DGX 放進其機房,搭配 NVIDIA AI Enterprise 軟體,由 Equinix 代管。Inference Exchange 是把這段關係從「你帶機器來寄放」推進到「參考架構+開源模型平台+互連,做成方案」。它沒有宣布新的 GPU 供應承諾,也沒有說會在 Equinix 機房裡保證多少 H100、H200 或 Blackwell 產能。記憶體漲價已經讓 NVIDIA AI 伺服器傳出逾 15% 的漲幅,Vera Rubin 與 Grace Blackwell 的出貨時程也被點名;一套 2027 年才開賣的推論交換,現在給不出機種清單,不完全是行銷疏漏,也是供應鏈還在動。
Together AI 這一層則有公開目錄可以對照,只是那份目錄屬於它現有的雲服務,不是 Equinix 方案的報價。CloudZero 整理的 serverless 價差很大:常見模型每百萬 token 大約落在 0.27 到 3.00 美元,全目錄可從約 0.05 拉到 7.00 美元;平台宣稱以單一、與 OpenAI 相容的 API 掛上 Llama、DeepSeek、Qwen、Mistral、Kimi 等家族。ComputePrices 在硬體 API 上抓到的即時 GPU 時薪(快照日期與 Horizon 同一週)又是另一張表:H100 SXM 約 5.40 美元、H200 約 6.60 美元、B200 約 9.00 美元。Together AI 自己的 GPU 叢集頁則把 HGX B200 隨需寫成每顆每小時 8.19 美元,預留價從 6.79 美元起。三組數字對應三種產品:按 token 計費的共享推論、單租戶專用端點、自助 GPU 叢集。Equinix 新聞稿只說「多租戶共享效率、單租戶給需要專用產能的負載」,沒有說企業在 Inference Exchange 裡買到的是哪一層,更沒有說進了 Equinix 機房之後時薪會不會變。
| Together AI 現有公開目錄(不是 Inference Exchange 報價) | 計費單位 | 公開數字 |
|---|---|---|
| Serverless 推論 | 每百萬 token | 常見約 0.27–3.00 美元;全目錄約 0.05–7.00 美元 |
| 專用推論端點 | 每 GPU 小時 | 外部整理:H100 約 5.49 美元、B200 約 8.99 美元 |
| GPU 叢集(官方頁) | 每 GPU 小時 | B200 隨需 8.19 美元,預留從 6.79 美元起 |
| Equinix Inference Exchange | 未公布 | 未公布 |
把這張表放進來,不是為了假裝 Equinix 已經降價,而是為了把「開源比較便宜」從口號拉回可檢驗的區間。開源權重可以從 Hugging Face 下載,不代表推論帳單比較低;Kimi K3 完整權重開放下載後,MXFP4 仍要約 594GB,自架門檻仍是資料中心級。Together AI 要賣的,正是「你不必自己扛那道門檻」。Equinix 要賣的,是把這道門檻搬到你資料已經在的都會。兩邊都還沒告訴你搬過去要付多少。
機房密度是真的,不是每一棟都能塞同等 GPU
Equinix 拿出來的版圖數字很大,而且在官方稿、IT Brief 與 TechWire Asia 之間對得上:超過 280 座資料中心、77 個都會、230 個雲端 on-ramp、超過 10,500 家互連企業。Fabric One 稿再加一層:約 3,000 家雲與 IT 供應商。Equinix 還說,十大 AI 模型供應商裡有八家、十大 AI 雲/neocloud 裡有九家,已經在它的設施裡部署。這解釋了為什麼它敢講「中立交換」:模型商、雲商、企業本來就坐在同一張互連網上,Inference Exchange 是把推論產能嵌進既有鄰接,而不是從零拉專線。
Converge Digest 用 Equinix 自己的監管文件潑了一盆該潑的冷水。IBX(International Business Exchange)零售機房靠近企業資料與使用者,互連密度高;xScale 則多半透過合資,服務超大規模雲的核心部署。兩種建物的電力與冷卻規格本來就不一樣。部分較舊的 IBX 受當初電機設計限制,未必撐得住高密度加速器;新一代 IBX 才被寫成大約兩倍的電力與冷卻需求。換句話說,「280 座資料中心」不能讀成「280 個都能跑同一套 Inference Exchange」。真正有意義的是哪些都會拿到 AI 就緒產能,以及那些點怎麼接到企業資料、公有雲與更大型的訓練叢集。
同一篇分析還補了資本開支節奏:2026 年第二季新增 9,700 條淨互連(公司稱為單季紀錄),33 個市場有 52 個興建專案進行中,全年資本支出預期 50 億到 60 億美元。這跟 NVIDIA 財報盤前把資料中心指引當成主戲 是同一條產業曲線的另一端:晶片側在賣加速器與殘值擔保,機房側在賣電力、冷卻與互連。Equinix 顯然不想只收機櫃與埠口的錢,它想讓已經住進來的生態系再長一層託管連線與模型服務。
Futurum Group 的 Nick Patience 被放進官方稿當分析師背書。他說效能、成本與治理已經變成戰略考量,因為工作負載正分散到不同供應商、資料端與環境;組織愈來愈在意推論跑在哪、能多快進入生產。這段話沒有新數字,但點出買家真正的痛:試點可以容忍高延遲與不清楚的資料出境路徑,正式服務不行。IDC 的 Andrew Buss 則被放在 Fabric One 稿裡,講的是網路仍大量依賴人工設計與操作。兩段分析師引言服務的是同一句銷售詞:複雜度本身就是產品。
三個使用情境,每一個都有沒寫出來的條件
官方點名三類負載。第一類是都會邊緣推論:把模型放到更靠近使用者與資料的地方,換較低延遲,同時沿用 Equinix 的安全與營運規模。這比較接近邊緣AI的都會版,不是手機或工廠現場的裝置端模型。它假設你的資料可以留在該都會的 Equinix 設施,或至少能用 Fabric 私接過去,而不必先丟進遠端超大規模區域。假設不成立的話,你買到的只是另一個需要搬資料的位置。
第二類是開源遷移。Equinix 把對象寫成「正把工作負載從封閉、專有模型轉到開源替代方案,以控制成本、避開鎖定」的企業,並說 Together AI 的開源平台可以走企業已經在用的同一張互連網。這條敘事接得上過去兩個月的權重潮:阿里把 Qwen3.8-2.4T-A95B 權重上線、NVIDIA 自己也開源 Nemotron 3.5 Lightning 打代理執行層、八月中還有一篇把競爭從「參數數字」改寫成「部署能力」的整理,講的就是企業本地化與多模態才是開源模型真正在比的東西。Together AI 的公開目錄確實掛著 LLaMA、DeepSeek、Qwen、Mistral、Kimi 這些家族,但 Equinix 沒有給一份「上了 Inference Exchange 的模型清單」,也沒有保證你現在在 Together AI API 叫得到的檢查點,2027 年第一季在 Equinix 機房裡會以同樣價、同樣上下文窗口出現。遷移故事成立的前提是:模型目錄、資料處理條款、以及你能不能把提示詞與輸出留在指定司法管轄區,三件事都要可契約化。現在三件都還沒寫進新聞稿。
第三類是主權 AI。官方用語是:受監管產業或特定地理區的企業,可以把工作負載放在符合資料駐留與主權要求的位置,比較容易在保有控制的前提下把 AI 做大。這句話只覆蓋了「運算發生在哪棟樓」。主權還包括身分、加密金鑰、日誌、模型權重、提示詞與生成內容要不要出境、誰能看思維鏈、出了事故誰有權關機。Converge Digest 把這層講得很清楚:實體位置只是條件之一,不是條件的全部。Equinix 也沒有公布政策模型、日誌留存地、金鑰託管方式,或單租戶環境能不能拒絕 Together AI 的營運人員碰權重。
Hyundai AutoEver America 執行長 Paul Hager 被放進 Fabric One 稿當客戶聲音,說分散環境需要彈性、可擴充、比較好管的連線,Fabric One「有潛力」加快他們滿足這些需求的速度。這是潛力,不是上線案例,更不是 Inference Exchange 的產能承諾。
對手不是另一家機房那麼簡單
把 Equinix 這一步只讀成「資料中心商開始賣 AI」,會漏掉它真正在擠的位置。超大規模雲已經把閉源旗艦、開源代管與自有晶片捆在一起賣;Anthropic 走的是另一條,聯手 Macquarie 與 GIC 成立 Theseus,專屬資料中心由金主持股、自己當錨定租戶。NVIDIA 自己則一邊賣參考架構,一邊用殘值擔保把工廠級產能鎖給特定買家,俄亥俄那筆最高 1050 億美元的擔保就是例子。Equinix 選的是中間:不擁有模型實驗室,也不自稱 neocloud,而是讓模型商、雲商與開源推論平台在它的交換上相遇。
Together AI 在這張圖裡也不是唯一的推論雲。Groq 才剛再募 3.5 億、估值 35 億,敘事從自研 LPU 對手改成跑 NVIDIA GPU 的推論雲。CloudZero 把 Together AI 的競爭圈畫得更寬:AWS Bedrock 與 SageMaker、Google Vertex AI、Azure OpenAI,以及 Fireworks、Replicate、Groq 這類推論專精商。Together AI 的差異化被寫成「模型種類、微調深度與裸 GPU 寫在同一張屋頂下」;它累計募資約 5.34 億美元、估值約 33 億,和 Groq 那輪估值幾乎貼在同一帶。Equinix 選 Together AI 而不是另一家,等於在 2027 年的企業開源推論上押了「目錄廣、NVIDIA 原生、願意做單租戶」這條產品線。押對或押錯,要等價目與都會清單出來才有辦法驗,現在只能當成夥伴選擇,不能當成效能結論。
開發者端現在能做的,也僅限於現有 Together AI 目錄,不是 Equinix 方案。Serverless 適合流量不穩、不想養閒置 GPU 的負載;專用端點適合要隔離、要自訂檢查點、能接受機器開著就計費的生產服務;自助叢集才把編排、觀測與利用率交回給你。CloudZero 還寫過一條實務門檻:利用率低於約五成時,專用實例往往比 serverless 更貴。Equinix 方案若把「單租戶」當成預設,卻沒有給閒置計費規則,帳單形狀會跟今天的 Together AI 專用端點一樣:機器在,錢就在燒,跟你有沒有請求無關。這不是反對單租戶,而是採購時必須把利用率寫進試算,不要只比較每百萬 token 海報價。
智能體化 AI 會把這筆帳再放大一截。代理不是問一次、拿一段文字回來,它會反覆呼叫工具、讀檔、寫檔、再問模型。最近兩天的模型發布已經示範過同一種陷阱:Gemini 3.8 Flash 導入價沒動,單任務成本卻上漲約 40%;Muse Spark 1.3 標價凍結,AA 測到的單任務均價仍從 0.40 升到 0.55 美元。原因都不是單價漲了,而是代理任務吃進更多輸入 token。Equinix 強調 time-to-first-token,對互動式聊天有意義;對會跑十幾步工具呼叫的代理,第一個 token 只是發票上最小的那一格。你真正要問的是:多租戶夠不夠穩、單租戶能不能就近接到內部系統、Fabric One 能不能讓代理自己開連線,以及這些步驟每一步怎麼計費。後三項,官方材料都還沒有答案。
AWS 網路服務副總裁 Robert Kennedy 與 Google Cloud 雲網路工程副總裁 Rob Enns 被放進 Fabric One 稿,強調企業不該自己想辦法跨雲、跨 AI 環境組網。Enns 把跨雲互通寫成「AI 時代的骨幹」,並說 Fabric One 會接上 Google Cloud 的 Cross-Cloud Network。這對 Equinix 的「中立」敘事是支撐,也是張力:連線規格由兩家超大規模雲帶頭定義,推論平台卻用來跑開源模型、用來降低對閉源旗艦的依賴。中立交換能不能同時討好雲商與想遷走閉源工作負載的企業,要看到 2027 年的合約條款,不是看今天的引言。
若你負責把試點收成正式服務,現在唯一能寫進評估表的,是時間與空白。2027 年第一季之前,Inference Exchange 還不能替代你現有的 Bedrock、Vertex、Together AI 直連或自架叢集。能做的是把「推論必須靠近哪一份資料、哪一群使用者、哪一條合規邊界」先畫出來,再拿這張圖去問 Equinix 三件事:哪些都會真的有 AI 就緒電力與冷卻、Together AI 目錄在那些點的時延與隔離等級、單租戶環境的金鑰與日誌能不能留在你指定的司法管轄區。答得出來,這才是一張可下單的推論交換;答不出來,它仍只是 Horizon 舞台上的架構圖。
