返回資訊
AI趨勢入門

螞蟻百靈開源 Ling-3.0-flash:124B/5.1B 激活 MoE,對標上代 1T 旗艦、單機可跑

2026年8月8日
易賺Ai團隊
7 分鐘閱讀
#開源#MoE#螞蟻集團#百靈#Ling-3.0-flash#Agent
螞蟻百靈開源 Ling-3.0-flash:124B/5.1B 激活 MoE,對標上代 1T 旗艦、單機可跑

IT之家等證實:螞蟻集團旗下百靈大模型宣布新一代原生混合推理模型 Ling-3.0-flash 正式開源。架構是 124B 總參數、5.1B 激活參數的 MoE;官方同步丟出基礎版與 FP8/FP4/INT4 等量化變體,並在 Hugging Face(inclusionAI)上架多個 checkpoint。開發者文件寫原生 256K 上下文,最高可擴至 1M

一句話定位:用上代旗艦 Ring-2.6-1T 約 12.4% 總參、約 8.1% 激活,宣稱關鍵基準對標甚至超越——把「智效比」當成產品本身。

三條落地路徑,不是只丟權重

官方把採用拆成三種選擇:

  1. API:最快接入、不必自建推理;面向想先驗證 Agent 產品的團隊。
  2. 單機私有化:MXFP4/INT4 版本可在單台 NVIDIA DGX Spark 跑端到端——資料不出域場景的硬賣點。
  3. 高性能部署:指定 GPU 測試配置下,官方稱平均輸出速率突破 1100 tokens/s;Artificial Analysis 榜單上輸出速度口徑約 353 tokens/s(第三方觀測與峰值測試條件不同,引用時分開標)。

AA 相關通稿另寫:Intelligence Index 上每項任務加權平均調用成本約 0.04 美元,加權平均解碼時間約 1.4 分鐘,並進入「智能—成本/耗時」優勢區。獨立頁面可見與其他模型的對照(例如相對部分 Max 級預覽更便宜、更快),但智慧指數分數仍明顯低於頂尖閉源旗艦——買的是吞吐與單價,不是Arena 榜首。

促銷窗口寫得很死:Ling Studio 自 8 月 7 日 00:008 月 31 日 24:00 限時 2.5 折,9 月 1 日起恢復原價。這對想壓測 Agent 工作流的團隊是明確的成本日曆。

技術形狀:混合推理+Agent 適配

開發者文件把 Ling-3.0-flash 寫成「高性價比混合推理」:相對上一代 flash,長程任務穩定性、工具呼叫精度、常見 harness 適配提升;編程任務對空間/相對位置理解加強。混合 Reasoning 模式依任務難度切換,意圖是高並發、低延遲的 Agent 執行節點,而不是再堆一個萬億旗艦。

HF README 披露更多結構細節(Hybrid-Linear MoE、激活專家數等)與量化表:BF16/FP8/INT4/FP4 在 GPQA-diamond、IFBench、SciCode、ArcPrize 等有可對照分數,量化通常小幅掉點。推理側推薦 SGLang 分支與 MTP/NEXTN 推測解碼;取樣建議 temperature=0.6top_p=0.95top_k=20,並可開 enable_thinking。官方亦稱在 Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw 等框架上有可用體驗——這是給 Agent 編排層的相容性信號,不是替你保證生產 SLA。

華為昇騰「0 Day 支持」等通稿同期出現,顯示國產算力適配被寫進發布敘事;實際 kernel/CANN 成熟度仍要以你場地複測為準。

和同週開源戰場怎麼比

同週 小米 XR-1 搶具身軌跡、Qwen3.8-Max 搶總參與編程代理。Ling-3.0-flash 押的是另一條曲線:小激活、高 TPS、可單機私有化的 Agent 工人。採購表不要混成「誰最大」——要問的是:你的負載是長推理旗艦,還是高頻工具呼叫?

成本敘事上,它也會撞上 DeepSeek V4-Flash 的任務均價戰。一邊是開源權重+單機,一邊是雲端 API 極致單價;資料主權與合規選前者,極致彈性選後者。兩者共同擠壓的是「中價中智能」的模糊中間層——那層以後更難賣。

早期曾有基礎設施評測機構提醒:部分峰值吞吐與 TTFT 聲明缺獨立驗證、權重上線時程與授權要以倉庫為準。現在 HF 已見 FP4/FP8 等倉庫,獨立 AA 頁也開始出現——但仍建議把「官宣 1100 tok/s」與「AA 觀測 353 tok/s」當成不同實驗條件,而不是互相打臉。對 Agent 產品經理,更該盯的是工具呼叫成功率與長程任務完成率,而不是單一吞吐峰值簡報頁。

開發者現在能做什麼

先決定路徑:只驗證產品邏輯就走 API+2.5 折窗口;要資料主權就拉 INT4/MXFP4 試 DGX Spark 或等價單機;要極致延遲再上多卡高吞吐配方。Agent 評測應固定 harness(工具 schema、重試策略、思考開關),否則「對標 1T」會變成無法復現的簡報句。

建議的最小驗證包:一組工具呼叫黃金集(含失敗重試)、一組長上下文召回題、一組真實編碼 agent 軌跡。把 BF16 與 INT4/FP4 分數差記進回歸表——量化省下的顯存,不該用「偶爾工具叫錯」換回來。若你已在用 Claude Code/類似 harness,直接換 base URL 做陰影流量,比重新寫 demo 更快看出適配落差。

許可與治理:以倉庫 LICENSE 與商業條款為準;「開源權重」不等于「可任意再分發微調後權重給客戶」。企業法務仍要核對訓練資料聲明與輸出責任邊界——尤其當模型被定位成高頻 Agent 工人、會連續呼叫內部 API 時。

下一步看三件事:AA Intelligence Index 完整分項是否公開穩定;昇騰/多卡配方是否可一鍵復現;2.5 折結束後 API 單價是否仍打得過 DeepSeek 同檔競品。124B 聽起來很大——真正便宜的是每次只喚醒 5.1B。