前沿推理模型每一步都親自 git pull、驗工具輸出、格式化結果,帳單會先爆炸。NVIDIA 把這段高頻苦工拆出來,交給新開源的 Nemotron 3.5 Lightning:約 300 億參數的開放混合專家模型(官方敘述約 30B/3B 激活;Artificial Analysis 記為約 31.6B 總參、約 3.6B 激活),定位是長跑AI 代理的執行層,不是再搶一張「最聰明」排行榜。NVIDIA 技術部落格、THE DECODER、Unwire、網易/國際金融報、CNBC 相關報導脈絡等同步跟進;權重以 OpenMDW-1.1 上路,並強調權重、訓練資料與配方盡可能一併開放。
同日還有 NeMo Switchyard:依品質、延遲、成本把請求路由到不同模型。產品組合讀起來很直白——大模型規劃,Lightning 跑量,路由器當帳本。對照前一日 Meta 的本地稠密代理路線,這是另一種開源敘事:不比誰更像全能管家,而比誰更能把代理管線的 token 預算拆開。
規格與速度:Pareto 曲線上的「快」,不是「最全能」
Lightning 延續 Nemotron 3 Nano 一脈的混合 Mamba-Transformer 敘事,提供 BF16 與 NVFP4 檢查點,並在訓練中納入多 token 預測(MTP),另附 DFlash、DSpark 等草稿/推測解碼路徑。官方宣稱同級可比模型最高約 4 倍輸出速度;代理任務完成時間可快約 30%。PinchBench 上約 86% 準確率,完成 1 萬項任務時,比準確率相近的 Qwen3.6 35B 快約三成。
| 指標 | 公開數字/敘述 |
|---|---|
| 架構定位 | 開放 MoE 執行層(非旗艦規劃模型) |
| 參數 | 約 30B/3B 激活(AA:約 31.6B/3.6B) |
| 授權 | OpenMDW-1.1(權重+資料+配方敘事) |
| 上下文 | AA:約 100 萬 token;文字為主 |
| AA Intelligence Index | 24(前代 Nano 約 15;並列 gpt-oss-120b) |
| 吞吐(AA 預發佈 NVFP4) | 近 670 tok/s,對比 Gemini 3.5 Flash-Lite 約 386 |
| 代理相關 | GDPval-AA v2 Elo 824;Terminal-Bench v2.1 約 24.3% |
誠實讀表:同一尺寸帶上,Qwen3.6 35B A3B(AA 約 32)、前一日 Meta Muse Glimmer(AA 約 35)在「純智力」仍更高。Lightning 賣的是完成任務的時間與成本——Index 一題約 0.5 分鐘級,對照 Qwen 約 3.5、Gemma 4 31B 約 5.8 的敘述。封閉模型在整體效率前沿仍常領先(如 Flash-Lite、GPT-5.6 Luna 等更高分/類似時程),但開源高吞吐這一格,NVIDIA 把自己釘在 Pareto 邊緣。
部署面:Jetson、RTX 5090、DGX Spark 到資料中心可用同一檔案敘事;LM Studio、llama.cpp、Ollama、Unsloth、vLLM/SGLang/TensorRT-LLM 與 OpenRouter、build.nvidia.com、Hugging Face、ModelScope 等通路列出。NVFP4 在 AA 上仍維持 Index 24,品質損失被寫成很小——對推論成本敏感的團隊,這比再加 10 分智力更實用。
Switchyard:把「一模型打天下」拆成可計量路由
長跑代理的 token 預算,大半耗在例行呼叫。Switchyard 讓 Lightning 成為路由目標之一:計畫上送前沿(如 Nemotron 3 Ultra),執行下沉 Lightning。Unwire 引述的合作/內部測試數字把故事講硬:
- 路由方案相對單獨用某前沿模型,任務完成成本可壓到約三分之一量級(NVIDIA 內部測試敘事)。
- LangChain:145 項多輪 Deep Agents 任務中,僅約 7% 上送前沿,成本降約 74%,準確度代價約 6%。
- Ramp:自家 SWE-Bench 測出成本約 -58%、執行時間約 -33%。
- Cognition:Devin Desktop 平均成本約 -28%。
- Boomi:約 59% 流量導向快約 5 倍的微調模型,尾延遲改善約 21%。
這些是供應商與夥伴數字,不是獨立複現保證;但方向一致——評估+路由+微調,比單換一個「更強聊天模型」更能改帳單。小模型微調更快、更便宜:NeMo Automodel/Megatron Bridge 做 LoRA 或全量 SFT,NeMo RL/Gym 做強化學習。CrowdStrike(資安)、Harvey(法律)、CodeRabbit/Baseten(程式碼審查)等被點名已試用或客製。
為什麼晶片商急著送開源權重
黃仁勳七月推動開源權重公開信之後,這是具體產品落地:免費或低授權摩擦的權重,最終仍要跑在 GPU 上。Axios 訪問敘事裡,他直說免費 AI 對硬體有利。閉源 API 壓企業預算時,開源把開支從訂閱轉到自建/租用算力——NVIDIA 站在後者收益端。OpenRouter 等聚合層開源權重 token 佔比上升的市場數據,也被拿來佐證「用量在長、單價在掉」;另一面,調查亦顯示企業實際開源採用比例未必同步上升——門檻常在部署、維運與評估,不在「有沒有權重可下」。
和 Meta Glimmer 的並讀也很清楚:Glimmer 是稠密、多模態、Apache 2.0、強調本地代理可靠度;Lightning 是 MoE 執行層、OpenMDW、強調吞吐與路由。兩者都在回應「美國還有沒有開源供應」——但 NVIDIA 額外多賣一層:編排系統,而不只是下載權重。
技術細節:MTP、量化、與「同一檔案多場景」
速度不是魔術。NVIDIA 把多 token 預測寫進預訓練,再加 MTP 強化階段;推論時可用內建 MTP,或外掛 DSpark(偏 DGX Spark/低並發)與 DFlash(需實測誰最快)等草稿路徑。並發升高時,最佳草稿長度通常要縮——這是服務端調參,不是下載即終局。NVFP4 與專用 kernel 橫跨 Blackwell/Hopper/Ampere 敘事,讓「桌面 Spark 與機房」共用檢查點,降低「為本地另訓一版」的摩擦。
文字為主、約百萬 token 上下文,表示它不是 Glimmer 那種螢幕/文件多模態本地管家;它更像代理管線裡的快速執行器。訓練配方與 Nemotron-RL Agentic Terminal Pivot 等開源 RL 資料集,則在暗示:編碼代理能力可以繼續用環境回饋往上推,而不必每次都從封閉 frontier 蒸餾。
對資安與合規團隊,OpenMDW「權重+資料+配方」敘事比「只丟權重」更可審計——但仍要逐檔核對實際釋出清單,不要把行銷句當成 SOC2 證據。對硬體採購,Lightning 把「單卡可跑的代理執行層」寫進產品線,會推高對高階消費卡與小型推理盒的需求,這與黃仁勳「免費模型推升算力」的公開判斷同向。
開發者與採購接下來要驗證什麼
- 獨立基準是否複製 AA/PinchBench 的速度優勢。
- Switchyard 接到 Kong、LiteLLM、LangChain 等閘道後,生產環境的誤路由率。
- OpenMDW-1.1 對訓練資料/配方的實際開放範圍,能否支撐合規審計。
- 與 Nemotron 3 Super/Ultra 組隊時的延遲與成本曲線。
- 本地單卡真實代理長會話是否穩,而不只是吞吐截圖。
企業若還在「選一個最強模型」,這則新聞建議改題:量測自家代理請求分布,把高頻執行層下放,再談要不要買更大的規劃腦。Lightning 不是要取代 frontier——它要讓 frontier 少做苦工。
