🦙Reddit r/LocalLLaMA•最新收集於 60m
Ling-3.0 發布六個基礎檢查點

💡六個 MIT 授權基礎檢查點讓建置者選擇持續訓練的切入點。
⚡ 30-Second TL;DR
有什麼變化
此次發布包含六個獨立的官方儲存庫
為什麼重要
分階段發布讓模型建置者能更靈活地選擇訓練流程的切入點,而不必受限於單一基礎檢查點。這對比較持續預訓練起點的研究者尤其有用,但其下游品質與量化表現仍未獲得證實。
下一步行動
下載同一尺寸的三個 Ling-3.0 訓練階段,使用相同微調流程比較下游驗證損失與任務效能。
誰應關注:Developers & AI Engineers
關鍵要點
- •此次發布包含六個獨立的官方儲存庫
- •提供 tiny 與 flash 兩種模型尺寸
- •每種尺寸均有 pretrained、mid-trained 與 WSM-merged 檢查點
- •所有檢查點都是未經後訓練的基礎模型
- •檢查時所有儲存庫均公開、無限制存取,並聲明採用 MIT 授權
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 16 個來源。
🔑 增強重點摘要
- •AntLing 是螞蟻集團旗下的AI部門,該集團與阿里巴巴集團有關聯,顯示其背後有強大的企業支持。
- •Ling-3.0-Flash 是一個總參數達1240億的混合專家模型(MoE),但每個token僅激活約51億參數,實現了高效率與性能的平衡。
- •Ling-3.0-Tiny 是一個總參數為79億的MoE模型,每個token僅激活13億參數,專為本地和邊緣設備部署而優化,能在消費級硬體上運行。
- •Ling-3.0系列模型採用原生混合線性注意力架構,交替使用KDA(Kimi Delta Attention)和MLA(多頭潛在注意力)層,以優化長上下文處理效率和模型能力。
- •這些模型專為生產級AI代理人工作流程而設計,具備增強的自我修正和長程規劃機制,並在超過10,000個互動環境中進行訓練,以實現端到端的閉環執行。
📊 競品分析▸ Show
| 模型名稱 | 關鍵特點 | 定價/授權 | 基準測試/性能 |
|---|---|---|---|
| Ling-3.0-Flash (AntLing) | 124B總參數,5.1B激活參數 (MoE),256K上下文 (可擴展至1M),混合線性注意力,專為AI代理人工作流程、編碼、工具調用設計。 | 權重開源 (MIT授權),API定價約 $0.06/M輸入token,$0.18/M輸出token。 | 在基礎推理、指令遵循和長上下文處理方面,匹配或超越參數規模為其2-3倍的領先模型。SWE-Bench Pro 56.6,Terminal-Bench 2.1 57.0。 |
| Ling-3.0-Tiny (AntLing) | 7.9B總參數,1.3B激活參數 (MoE),8K上下文,專為本地和邊緣部署優化,混合推理、代理人工具調用、數學任務。 | 權重開源 (MIT授權),API透過OpenRouter提供 (初期免費)。 | 在通用代理人 (GDPval) 和知識非幻覺基準測試中,表現優於Qwen 3.5 9B和Gemma 4。 |
| DeepSeek V3.2 (DeepSeek) | 685B總參數,37B激活參數 (MoE),DeepSeek稀疏注意力,多頭潛在注意力,推理整合至工具使用,擅長複雜代理任務。 | 開源。 | 在處理複雜、真實世界的代理任務方面表現出色。 |
| Qwen 3.5 9B / Qwen 3 (4B) (阿里巴巴) | Qwen 3 (4B) 理解超過100種語言,可無縫整合至工具調用框架。 | 開源 (Qwen 3 4B採用Apache風格授權)。 | Ling-3.0-Tiny在某些基準測試中表現優於Qwen 3.5 9B。Qwen模型在Hugging Face平台下載量巨大。 |
| Gemma 3 4B / Gemma 4 (Google) | 輕量級模型。 | 開源。 | Ling-3.0-Tiny在通用代理人 (GDPval) 和知識非幻覺基準測試中表現優於Gemma 4。 |
🛠️ 技術深入
- 模型架構: Ling-3.0系列採用原生混合線性注意力架構,其中KDA(Kimi Delta Attention)層與MLA(多頭潛在注意力)層交替堆疊。Ling-3.0-Flash以5:1的比例堆疊(35個KDA層和7個門控MLA層),而Ling-3.0-Tiny則以3:1的比例堆疊(每四層包含3個KDA層和1個MLA層)。
- 混合專家 (MoE) 配置: Ling-3.0-Flash總參數為1240億,每個token僅激活約51億參數。Ling-3.0-Tiny總參數為79億,每個token僅激活約13億參數。與前代相比,每個token的專家激活比例從1/32壓縮至1/64,顯著提高了效率槓桿。
- KDA (Kimi Delta Attention) 升級: KDA是從Lightning Attention演進而來,在Delta Rule狀態更新中引入了細粒度對角門控,使模型在處理長文檔和大型程式碼庫時能更精確地保留關鍵資訊。
- 上下文窗口: Ling-3.0-Flash原生支持256K的上下文窗口,並可無縫擴展至1M token。 Ling-3.0-Tiny在8K上下文長度下進行了驗證。
- 代理人工作流程優化: 模型在超過10,000個互動環境中進行了深度訓練,以增強其自我修正和長程規劃機制。它整合了SGLang HiCache + Mooncake分層緩存架構,在長輸入場景中將首個token生成時間(TTFT)減少了60%至80%。
- 多精度支持: Ling-3.0-Tiny提供BF16、FP8和INT4權重,以適應多種硬體和部署環境。
- 推理性能: Ling-3.0-Tiny在使用FP8精度時,在NVIDIA DGX Spark上達到約100-105 token/秒,在M4 Pro MacBook上達到86-90 token/秒,峰值記憶體使用量約為8.34 GiB(8K上下文長度)。
🔮 前景展望AI analysis grounded in cited sources
開源混合推理模型將加速邊緣AI應用發展。
Ling-3.0-Tiny專為本地和邊緣部署優化,能在消費級硬體上提供強大推理能力,降低AI應用門檻。
AI代理人工作流程將變得更高效且成本可控。
Ling-3.0-Flash專為生產級AI代理人工作流程設計,結合高效率架構和長上下文處理能力,能顯著降低複雜任務的執行成本和延遲。
中國在開源大型語言模型領域的影響力將持續增強。
螞蟻集團(AntLing)作為中國科技巨頭,其Ling-3.0系列的開源發布,以及Qwen等中國模型在下載量和參數規模上的表現,顯示中國在推動開源AI生態方面的投入和成果。
⏳ 時間線
2026-07-23
InclusionAI (螞蟻集團) 宣布Ling 3.0 Flash在Kilo上線,限時免費使用,預計稍後開源權重。
2026-07-27
螞蟻集團正式發布Ling-3.0-Flash,強調其作為下一代原生混合推理基礎模型,專為AI代理人工作流程設計。
2026-08-09
Ling 3.0 Tiny因其本地部署能力而受到關注,並在某些基準測試中表現優於Qwen和Gemma等競爭模型。
2026-08-12
QQ新聞報導螞蟻百靈新一代Ling-3.0(包括flash和tiny版本)開源,並提供FP8、INT4等多種精度版本。
2026-08-20
Ling-3.0-tiny-base和Ling-3.0-flash-base正式開源,同步開放兩個模型的預訓練、中期訓練和WSM-merged共六個基礎檢查點。
📎 來源 (16)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。