🦙最新收集於 60m

Ling-3.0 發布六個基礎檢查點

Ling-3.0 發布六個基礎檢查點
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡六個 MIT 授權基礎檢查點讓建置者選擇持續訓練的切入點。

⚡ 30-Second TL;DR

有什麼變化

此次發布包含六個獨立的官方儲存庫

為什麼重要

分階段發布讓模型建置者能更靈活地選擇訓練流程的切入點,而不必受限於單一基礎檢查點。這對比較持續預訓練起點的研究者尤其有用,但其下游品質與量化表現仍未獲得證實。

下一步行動

下載同一尺寸的三個 Ling-3.0 訓練階段,使用相同微調流程比較下游驗證損失與任務效能。

誰應關注:Developers & AI Engineers

關鍵要點

  • 此次發布包含六個獨立的官方儲存庫
  • 提供 tiny 與 flash 兩種模型尺寸
  • 每種尺寸均有 pretrained、mid-trained 與 WSM-merged 檢查點
  • 所有檢查點都是未經後訓練的基礎模型
  • 檢查時所有儲存庫均公開、無限制存取,並聲明採用 MIT 授權

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 16 個來源。

🔑 增強重點摘要

  • AntLing 是螞蟻集團旗下的AI部門,該集團與阿里巴巴集團有關聯,顯示其背後有強大的企業支持。
  • Ling-3.0-Flash 是一個總參數達1240億的混合專家模型(MoE),但每個token僅激活約51億參數,實現了高效率與性能的平衡。
  • Ling-3.0-Tiny 是一個總參數為79億的MoE模型,每個token僅激活13億參數,專為本地和邊緣設備部署而優化,能在消費級硬體上運行。
  • Ling-3.0系列模型採用原生混合線性注意力架構,交替使用KDA(Kimi Delta Attention)和MLA(多頭潛在注意力)層,以優化長上下文處理效率和模型能力。
  • 這些模型專為生產級AI代理人工作流程而設計,具備增強的自我修正和長程規劃機制,並在超過10,000個互動環境中進行訓練,以實現端到端的閉環執行。
📊 競品分析▸ Show
模型名稱關鍵特點定價/授權基準測試/性能
Ling-3.0-Flash (AntLing)124B總參數,5.1B激活參數 (MoE),256K上下文 (可擴展至1M),混合線性注意力,專為AI代理人工作流程、編碼、工具調用設計。權重開源 (MIT授權),API定價約 $0.06/M輸入token,$0.18/M輸出token。在基礎推理、指令遵循和長上下文處理方面,匹配或超越參數規模為其2-3倍的領先模型。SWE-Bench Pro 56.6,Terminal-Bench 2.1 57.0。
Ling-3.0-Tiny (AntLing)7.9B總參數,1.3B激活參數 (MoE),8K上下文,專為本地和邊緣部署優化,混合推理、代理人工具調用、數學任務。權重開源 (MIT授權),API透過OpenRouter提供 (初期免費)。在通用代理人 (GDPval) 和知識非幻覺基準測試中,表現優於Qwen 3.5 9B和Gemma 4。
DeepSeek V3.2 (DeepSeek)685B總參數,37B激活參數 (MoE),DeepSeek稀疏注意力,多頭潛在注意力,推理整合至工具使用,擅長複雜代理任務。開源。在處理複雜、真實世界的代理任務方面表現出色。
Qwen 3.5 9B / Qwen 3 (4B) (阿里巴巴)Qwen 3 (4B) 理解超過100種語言,可無縫整合至工具調用框架。開源 (Qwen 3 4B採用Apache風格授權)。Ling-3.0-Tiny在某些基準測試中表現優於Qwen 3.5 9B。Qwen模型在Hugging Face平台下載量巨大。
Gemma 3 4B / Gemma 4 (Google)輕量級模型。開源。Ling-3.0-Tiny在通用代理人 (GDPval) 和知識非幻覺基準測試中表現優於Gemma 4。

🛠️ 技術深入

  • 模型架構: Ling-3.0系列採用原生混合線性注意力架構,其中KDA(Kimi Delta Attention)層與MLA(多頭潛在注意力)層交替堆疊。Ling-3.0-Flash以5:1的比例堆疊(35個KDA層和7個門控MLA層),而Ling-3.0-Tiny則以3:1的比例堆疊(每四層包含3個KDA層和1個MLA層)。
  • 混合專家 (MoE) 配置: Ling-3.0-Flash總參數為1240億,每個token僅激活約51億參數。Ling-3.0-Tiny總參數為79億,每個token僅激活約13億參數。與前代相比,每個token的專家激活比例從1/32壓縮至1/64,顯著提高了效率槓桿。
  • KDA (Kimi Delta Attention) 升級: KDA是從Lightning Attention演進而來,在Delta Rule狀態更新中引入了細粒度對角門控,使模型在處理長文檔和大型程式碼庫時能更精確地保留關鍵資訊。
  • 上下文窗口: Ling-3.0-Flash原生支持256K的上下文窗口,並可無縫擴展至1M token。 Ling-3.0-Tiny在8K上下文長度下進行了驗證。
  • 代理人工作流程優化: 模型在超過10,000個互動環境中進行了深度訓練,以增強其自我修正和長程規劃機制。它整合了SGLang HiCache + Mooncake分層緩存架構,在長輸入場景中將首個token生成時間(TTFT)減少了60%至80%。
  • 多精度支持: Ling-3.0-Tiny提供BF16、FP8和INT4權重,以適應多種硬體和部署環境。
  • 推理性能: Ling-3.0-Tiny在使用FP8精度時,在NVIDIA DGX Spark上達到約100-105 token/秒,在M4 Pro MacBook上達到86-90 token/秒,峰值記憶體使用量約為8.34 GiB(8K上下文長度)。

🔮 前景展望AI analysis grounded in cited sources

開源混合推理模型將加速邊緣AI應用發展。
Ling-3.0-Tiny專為本地和邊緣部署優化,能在消費級硬體上提供強大推理能力,降低AI應用門檻。
AI代理人工作流程將變得更高效且成本可控。
Ling-3.0-Flash專為生產級AI代理人工作流程設計,結合高效率架構和長上下文處理能力,能顯著降低複雜任務的執行成本和延遲。
中國在開源大型語言模型領域的影響力將持續增強。
螞蟻集團(AntLing)作為中國科技巨頭,其Ling-3.0系列的開源發布,以及Qwen等中國模型在下載量和參數規模上的表現,顯示中國在推動開源AI生態方面的投入和成果。

時間線

2026-07-23
InclusionAI (螞蟻集團) 宣布Ling 3.0 Flash在Kilo上線,限時免費使用,預計稍後開源權重。
2026-07-27
螞蟻集團正式發布Ling-3.0-Flash,強調其作為下一代原生混合推理基礎模型,專為AI代理人工作流程設計。
2026-08-09
Ling 3.0 Tiny因其本地部署能力而受到關注,並在某些基準測試中表現優於Qwen和Gemma等競爭模型。
2026-08-12
QQ新聞報導螞蟻百靈新一代Ling-3.0(包括flash和tiny版本)開源,並提供FP8、INT4等多種精度版本。
2026-08-20
Ling-3.0-tiny-base和Ling-3.0-flash-base正式開源,同步開放兩個模型的預訓練、中期訓練和WSM-merged共六個基礎檢查點。

📎 來源 (16)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. pa.media
  2. reddit.com
  3. novita.ai
  4. kilo.ai
  5. zenmux.ai
  6. huggingface.co
  7. kilo.ai
  8. huggingface.co
  9. youtube.com
  10. qq.com
  11. eastmoney.com
  12. af.net
  13. youtube.com
  14. botpress.com
  15. bnext.com.tw
  16. artificialanalysis.ai
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。