🤗Hugging Face Blog•最新收集於 8m
LFM2.5-DSpark 宣稱推理速度提升 3.2 倍

💡了解 LFM2.5-DSpark 宣稱的 3.2 倍推理提升是否適用於你的工作負載。
⚡ 30-Second TL;DR
有什麼變化
宣稱的最高推理速度提升幅度為 3.2 倍。
為什麼重要
如果此速度提升能在生產環境中成立,LFM2.5-DSpark 可能降低延遲或提高服務吞吐量。實務團隊應先在自身工作負載下驗證此宣稱,再調整模型基礎架構。
下一步行動
使用具代表性的提示,將 LFM2.5-DSpark 與目前的推理堆疊進行基準測試,並衡量延遲、吞吐量與輸出品質。
誰應關注:Developers & AI Engineers
關鍵要點
- •宣稱的最高推理速度提升幅度為 3.2 倍。
- •此次更新聚焦於 LFM2.5-DSpark 的推理效能。
- •提供的內容未說明基準測試方法與部署需求。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 11 個來源。
🔑 增強重點摘要
- •LFM2.5-DSpark 是一種推測性解碼(speculative decoding)草稿模型,專為加速 LiquidAI/LFM2.5-8B-A1B 專家混合(Mixture-of-Experts, MoE)目標模型的推理而設計。
- •該模型採用 Qwen3 風格的分組查詢注意力(Grouped Query Attention, GQA)區塊草稿器,提供 2 層和 3 層配置,並包含一個低秩馬爾可夫轉換頭(秩 256)和一個置信度頭。
- •LFM2.5-DSpark 的實作與 SGLang 推理框架整合,需要支援 DSpark 和 LFM2 的 SGLang 特定建構版本。
- •由 Liquid AI 開發的 LFM2.5 模型系列,廣泛針對各種硬體上的高效能設備端部署進行優化,支援 llama.cpp、MLX、vLLM、SGLang 和 ONNX 等多種推理框架。
- •LFM2.5 模型(包括 LFM2.5-2.6B 等變體)旨在使具備能力的 AI 代理程式能在筆記型電腦到手機等日常硬體上本地運行,其效能可與大四倍的模型競爭。
🛠️ 技術深入
- 模型類型:推測性解碼草稿模型。
- 目標模型:LiquidAI/LFM2.5-8B-A1B (一種專家混合模型)。
- 架構:Qwen3 風格的 GQA 區塊草稿器(2 或 3 層)。
- 關鍵組件:低秩馬爾可夫轉換頭(秩 256)和置信度頭。
- 區塊大小:7 (錨點 + 6 個草稿)。
- 位置編碼:交錯式 (GPT-J) 旋轉位置嵌入 (RoPE)。
- 詞彙權重:草稿模型不包含詞彙權重;嵌入和語言模型頭在載入時從目標模型綁定。
- 整合:設計用於 SGLang,需要 SGLang 建構版本中具備 DSpark 和 LFM2 支援。
- LFM2.5 系列架構 (通用):基於 LFM2 架構的混合模型,透過擴展預訓練和強化學習進行構建。
- LFM2.5-1.2B-Thinking 特定參數:1.17B 參數、16 層(10 個雙門控卷積區塊 + 6 個 GQA 區塊)、28T 訓練令牌預算、32,768 上下文長度、65,536 詞彙大小。
- 推理生態系統支援:LFM2.5 模型支援 llama.cpp、MLX、vLLM、SGLang 和 ONNX。
🔮 前景展望AI analysis grounded in cited sources
LFM2.5-DSpark 的優化將顯著降低在邊緣設備上部署複雜 MoE 模型的門檻。
透過推測性解碼大幅提升 MoE 模型的推理速度,使得這些計算密集型模型在資源受限的環境中更具可行性。
與 SGLang 的整合表明,針對特定模型架構和加速技術的專業推理框架趨勢正在增長。
對支援 DSpark 和 LFM2 的 SGLang 要求,預示著超越通用推理引擎,轉向為最大化效能而高度客製化的解決方案。
Liquid AI 憑藉其 LFM2.5 系列和 DSpark 優化,正將自己定位為高效能設備端 AI 領域的關鍵參與者,特別是在代理程式工作負載方面。
LFM2.5 模型明確為設備端部署而設計,在代理程式任務上提供與更大模型競爭的效能,並強調在各種硬體上的高效推理。
⏳ 時間線
2025-11
Liquid AI 推出 LFM2.5-1.2B-Thinking,一個為設備端部署設計的混合模型新系列,基於 LFM2 架構。
2026-01
Liquid AI 推出 LFM2.5-1.2B-Thinking,強調其「系統 2」慢思考機制,以提升邏輯推理和穩定性,並可在手機上運行。
2026-07
Liquid AI 釋出 LFM2.5-Encoders (230M 和 350M),用於 CPU 上的快速長上下文推理,品質可與更大模型媲美。
2026-08
Liquid AI 釋出 LFM2.5-2.6B,一個專為代理程式設計的模型,可在智慧型手機上運行,其代理程式任務效能可與大四倍的模型競爭。
2026-08
Liquid AI 釋出 LFM2.5-VL-3B,一個用於邊緣設備的視覺語言模型,強調更好更快的視覺能力。
2026-08
Hugging Face 託管 LFM2.5-8B-A1B-DSpark-3L 和 LFM2.5-8B-A1B-DSpark-2L,這些是針對 LFM2.5-8B-A1B MoE 目標的推測性解碼草稿模型。
📎 來源 (11)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。