🦙Reddit r/LocalLLaMA•較早收集於 4h
LiquidAI 發布 LFM2.5-8B-A1B 用於邊緣裝置部署

💡一款針對邊緣裝置效能優化的新型混合模型,效能足以媲美大型稠密與 MoE 模型。
⚡ 30-Second TL;DR
有什麼變化
專為邊緣部署設計的混合架構
為什麼重要
對於開發者而言,這款模型為建構無需依賴雲端 API、要求低延遲與高效率的本地優先 AI 應用提供了強大的選擇。
下一步行動
從 Hugging Face 下載 GGUF 版本並使用 llama.cpp 進行測試,以評估其在您特定邊緣裝置應用場景中的效能。
誰應關注:Developers & AI Engineers
關鍵要點
- •專為邊緣部署設計的混合架構
- •效能媲美大型稠密模型與 MoE 模型
- •首日支援 llama.cpp, MLX, vLLM 與 SGLang
- •針對實際代理任務與工具呼叫進行優化
🧠 深度解析
Web-grounded analysis with 15 cited sources.
🔑 增強重點摘要
- •LFM2.5-8B-A1B 在其前身 LFM2-8B-A1B 的基礎上進行了顯著升級,將上下文窗口從 32,768 個詞元擴展至 128,000 個詞元,預訓練數據量從 12 兆提升至 38 兆詞元,並將詞彙量翻倍至 128,000 以提高非拉丁語系的詞元化效率,特別是在印地語、泰語、越南語、印尼語和阿拉伯語方面有強勁的壓縮增益。
- •該模型採用獨特的「僅推理」(reasoning-only)策略,在提供最終答案之前會生成明確的思維鏈(chain of thought),這在計算受限的 MoE 環境中能以較低的計算成本顯著提升品質,並透過基於 avg@k 獎勵的強化學習階段,實現了顯著降低幻覺率的同時保持合理準確性。
- •LFM2.5-8B-A1B 在消費級硬體上展現出卓越的吞吐量,例如在 Apple M5 Max 晶片上每秒解碼 253 個詞元,在 Ryzen AI Max+ 395 上每秒 146 個詞元,且記憶體佔用保持在 6 GB 以下,甚至在手機上也能達到約 30 個詞元/秒的速度,使其能夠在入門級筆記型電腦上流暢運行。
- •其混合架構結合了 MoE(Mixture-of-Experts)、GQA(Grouped-Query Attention)和門控短卷積塊(gated short convolution blocks),總參數為 8.3B,但每個詞元僅激活約 1.5B 參數,這使得它能以 1.5B 級模型的計算成本提供與更大模型媲美的品質。
- •LiquidAI 針對年收入低於 1,000 萬美元的企業提供 LFM 模型的免費開源商業使用權限,旨在降低中小企業採用先進 AI 模型的門檻,並推動邊緣 AI 的普及。
📊 競品分析▸ Show
| 特性/模型 | LiquidAI LFM2.5-8B-A1B | Meta Llama 3 Instruct 8B | Mistral Nemo |
|---|---|---|---|
| 架構 | 混合MoE (8.3B總參數/1.5B活躍參數) | 稠密模型 (8B參數) | MoE模型 (參數未明確,但與LFM2-8B-A1B比較) |
| 上下文窗口 | 128,000 tokens | 80,000 tokens | N/A |
| 推理速度 (GPU) | 18.5K tokens/秒 (H100, 高併發) | 81.2 tokens/秒 | 較慢 (LFM2-8B-A1B更快) |
| 推理速度 (CPU) | M5 Max: 253 tokens/秒, Ryzen AI Max+ 395: 146 tokens/秒 (<6GB RAM) | N/A | N/A |
| 指令遵循 | 媲美Gemma 4-26B等大型MoE模型 | 良好 | N/A |
| 幻覺率 | 顯著較低 | N/A | N/A |
| 定價 (每百萬詞元) | 輸入: $0.01, 輸出: $0.02 (基於LFM2-8B-A1B) / 年收入<10M美元企業免費商用 | 輸入: $0.04, 輸出: $0.14 | 輸入: $0.02, 輸出: $0.06 |
| 編碼能力 | 較Llama 3.2 3B Instruct更佳 (LFM2-8B-A1B) | 編碼指數4.0 (較LFM2-8B-A1B的2.3更佳) | 較LFM2-8B-A1B更差 |
| 數學能力 | 較Llama 3.2 3B Instruct更佳 (LFM2-8B-A1B) | N/A | 較LFM2-8B-A1B更差 |
🛠️ 技術深入
- 模型架構: 採用混合架構,結合了 MoE (Mixture-of-Experts)、GQA (Grouped-Query Attention) 和門控短卷積塊 (gated short convolution blocks)。
- 參數規模: 總參數為 8.3B,每個詞元僅激活約 1.5B 參數。
- 層數: 包含 24 層,其中有 18 個雙門控 LIV 卷積塊和 6 個 GQA 塊。
- 預訓練數據: 經過 38 兆詞元的預訓練。
- 上下文長度: 支援 131,072 (128K) 個詞元。
- 詞彙量: 詞彙量擴展至 128,000,以提高對非拉丁語系的詞元化效率。
- 推理策略: 作為「僅推理」模型,在生成最終答案前會產生明確的思維鏈 (chain of thought)。
- 幻覺緩解: 透過一個目標強化學習階段,使用基於 avg@k 的獎勵機制,以減少幻覺並保持知識準確性。
- 記憶體效率: 在筆記型電腦上運行時,記憶體使用量低於 6GB。
- 支援框架: 提供對 llama.cpp (GGUF 格式)、MLX (針對 Apple Silicon 優化)、vLLM、SGLang 和 ONNX 的首日支援。
- 語言支援: 支援英語、阿拉伯語、中文、法語、德語、日語、韓語、葡萄牙語和西班牙語等多種語言。
🔮 前景展望AI analysis grounded in cited sources
邊緣AI裝置的普及將加速,特別是在隱私敏感的應用中。
LFM2.5-8B-A1B 在消費級硬體上實現了高效能和低記憶體佔用,且強調本地運行以保護隱私,這將推動 AI 助理、代理任務等應用直接在用戶設備上運行。
小型 MoE 模型將成為邊緣 AI 領域的主流架構之一。
LiquidAI 證明了 MoE 架構在小參數規模下也能高效運行,並提供與大型模型媲美的性能,這將鼓勵更多開發者和公司採用此類架構來平衡性能與資源限制。
LiquidAI 將透過其「免費開源商業使用」策略,在中小企業市場獲得顯著份額。
對於年收入低於 1,000 萬美元的企業提供免費商業使用,將大幅降低中小企業採用先進 AI 模型的門檻,從而擴大 LiquidAI 的市場滲透率和生態系統。
⏳ 時間線
2023
Liquid AI 成立,作為 MIT CSAIL 的衍生公司。
2023-12
Liquid AI 獲得 3750 萬美元種子輪融資。
2024-12-13
Liquid AI 獲得 2.5 億美元 A 輪融資。
2025-10-07
Liquid AI 發布 LFM2-8B-A1B,其首個邊緣 MoE 模型,總參數 8.3B,活躍參數 1.5B。
2026-01-06
Liquid AI 發布 LFM2.5 1.2B Instruct 模型,強調其在設備上的推理能力。
2026-05-28
LiquidAI 發布 LFM2.5-8B-A1B 模型。
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗