🤗最新收集於 8m

LFM2.5-DSpark 宣稱推理速度提升 3.2 倍

LFM2.5-DSpark 宣稱推理速度提升 3.2 倍
PostLinkedIn
🤗閱讀原文: Hugging Face Blog

💡了解 LFM2.5-DSpark 宣稱的 3.2 倍推理提升是否適用於你的工作負載。

⚡ 30-Second TL;DR

有什麼變化

宣稱的最高推理速度提升幅度為 3.2 倍。

為什麼重要

如果此速度提升能在生產環境中成立,LFM2.5-DSpark 可能降低延遲或提高服務吞吐量。實務團隊應先在自身工作負載下驗證此宣稱,再調整模型基礎架構。

下一步行動

使用具代表性的提示,將 LFM2.5-DSpark 與目前的推理堆疊進行基準測試,並衡量延遲、吞吐量與輸出品質。

誰應關注:Developers & AI Engineers

關鍵要點

  • 宣稱的最高推理速度提升幅度為 3.2 倍。
  • 此次更新聚焦於 LFM2.5-DSpark 的推理效能。
  • 提供的內容未說明基準測試方法與部署需求。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 11 個來源。

🔑 增強重點摘要

  • LFM2.5-DSpark 是一種推測性解碼(speculative decoding)草稿模型,專為加速 LiquidAI/LFM2.5-8B-A1B 專家混合(Mixture-of-Experts, MoE)目標模型的推理而設計。
  • 該模型採用 Qwen3 風格的分組查詢注意力(Grouped Query Attention, GQA)區塊草稿器,提供 2 層和 3 層配置,並包含一個低秩馬爾可夫轉換頭(秩 256)和一個置信度頭。
  • LFM2.5-DSpark 的實作與 SGLang 推理框架整合,需要支援 DSpark 和 LFM2 的 SGLang 特定建構版本。
  • 由 Liquid AI 開發的 LFM2.5 模型系列,廣泛針對各種硬體上的高效能設備端部署進行優化,支援 llama.cpp、MLX、vLLM、SGLang 和 ONNX 等多種推理框架。
  • LFM2.5 模型(包括 LFM2.5-2.6B 等變體)旨在使具備能力的 AI 代理程式能在筆記型電腦到手機等日常硬體上本地運行,其效能可與大四倍的模型競爭。

🛠️ 技術深入

  • 模型類型:推測性解碼草稿模型。
  • 目標模型:LiquidAI/LFM2.5-8B-A1B (一種專家混合模型)。
  • 架構:Qwen3 風格的 GQA 區塊草稿器(2 或 3 層)。
  • 關鍵組件:低秩馬爾可夫轉換頭(秩 256)和置信度頭。
  • 區塊大小:7 (錨點 + 6 個草稿)。
  • 位置編碼:交錯式 (GPT-J) 旋轉位置嵌入 (RoPE)。
  • 詞彙權重:草稿模型不包含詞彙權重;嵌入和語言模型頭在載入時從目標模型綁定。
  • 整合:設計用於 SGLang,需要 SGLang 建構版本中具備 DSpark 和 LFM2 支援。
  • LFM2.5 系列架構 (通用):基於 LFM2 架構的混合模型,透過擴展預訓練和強化學習進行構建。
  • LFM2.5-1.2B-Thinking 特定參數:1.17B 參數、16 層(10 個雙門控卷積區塊 + 6 個 GQA 區塊)、28T 訓練令牌預算、32,768 上下文長度、65,536 詞彙大小。
  • 推理生態系統支援:LFM2.5 模型支援 llama.cpp、MLX、vLLM、SGLang 和 ONNX。

🔮 前景展望AI analysis grounded in cited sources

LFM2.5-DSpark 的優化將顯著降低在邊緣設備上部署複雜 MoE 模型的門檻。
透過推測性解碼大幅提升 MoE 模型的推理速度,使得這些計算密集型模型在資源受限的環境中更具可行性。
與 SGLang 的整合表明,針對特定模型架構和加速技術的專業推理框架趨勢正在增長。
對支援 DSpark 和 LFM2 的 SGLang 要求,預示著超越通用推理引擎,轉向為最大化效能而高度客製化的解決方案。
Liquid AI 憑藉其 LFM2.5 系列和 DSpark 優化,正將自己定位為高效能設備端 AI 領域的關鍵參與者,特別是在代理程式工作負載方面。
LFM2.5 模型明確為設備端部署而設計,在代理程式任務上提供與更大模型競爭的效能,並強調在各種硬體上的高效推理。

時間線

2025-11
Liquid AI 推出 LFM2.5-1.2B-Thinking,一個為設備端部署設計的混合模型新系列,基於 LFM2 架構。
2026-01
Liquid AI 推出 LFM2.5-1.2B-Thinking,強調其「系統 2」慢思考機制,以提升邏輯推理和穩定性,並可在手機上運行。
2026-07
Liquid AI 釋出 LFM2.5-Encoders (230M 和 350M),用於 CPU 上的快速長上下文推理,品質可與更大模型媲美。
2026-08
Liquid AI 釋出 LFM2.5-2.6B,一個專為代理程式設計的模型,可在智慧型手機上運行,其代理程式任務效能可與大四倍的模型競爭。
2026-08
Liquid AI 釋出 LFM2.5-VL-3B,一個用於邊緣設備的視覺語言模型,強調更好更快的視覺能力。
2026-08
Hugging Face 託管 LFM2.5-8B-A1B-DSpark-3L 和 LFM2.5-8B-A1B-DSpark-2L,這些是針對 LFM2.5-8B-A1B MoE 目標的推測性解碼草稿模型。

📎 來源 (11)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. huggingface.co
  2. huggingface.co
  3. huggingface.co
  4. huggingface.co
  5. huggingface.co
  6. huggingface.co
  7. impress.co.jp
  8. gigazine.net
  9. csdn.net
  10. huggingface.co
  11. huggingface.co
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。