🦙較早收集於 4h

LiquidAI 發布 LFM2.5-8B-A1B 用於邊緣裝置部署

LiquidAI 發布 LFM2.5-8B-A1B 用於邊緣裝置部署
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡一款針對邊緣裝置效能優化的新型混合模型,效能足以媲美大型稠密與 MoE 模型。

⚡ 30-Second TL;DR

有什麼變化

專為邊緣部署設計的混合架構

為什麼重要

對於開發者而言,這款模型為建構無需依賴雲端 API、要求低延遲與高效率的本地優先 AI 應用提供了強大的選擇。

下一步行動

從 Hugging Face 下載 GGUF 版本並使用 llama.cpp 進行測試,以評估其在您特定邊緣裝置應用場景中的效能。

誰應關注:Developers & AI Engineers

關鍵要點

  • 專為邊緣部署設計的混合架構
  • 效能媲美大型稠密模型與 MoE 模型
  • 首日支援 llama.cpp, MLX, vLLM 與 SGLang
  • 針對實際代理任務與工具呼叫進行優化

🧠 深度解析

Web-grounded analysis with 15 cited sources.

🔑 增強重點摘要

  • LFM2.5-8B-A1B 在其前身 LFM2-8B-A1B 的基礎上進行了顯著升級,將上下文窗口從 32,768 個詞元擴展至 128,000 個詞元,預訓練數據量從 12 兆提升至 38 兆詞元,並將詞彙量翻倍至 128,000 以提高非拉丁語系的詞元化效率,特別是在印地語、泰語、越南語、印尼語和阿拉伯語方面有強勁的壓縮增益。
  • 該模型採用獨特的「僅推理」(reasoning-only)策略,在提供最終答案之前會生成明確的思維鏈(chain of thought),這在計算受限的 MoE 環境中能以較低的計算成本顯著提升品質,並透過基於 avg@k 獎勵的強化學習階段,實現了顯著降低幻覺率的同時保持合理準確性。
  • LFM2.5-8B-A1B 在消費級硬體上展現出卓越的吞吐量,例如在 Apple M5 Max 晶片上每秒解碼 253 個詞元,在 Ryzen AI Max+ 395 上每秒 146 個詞元,且記憶體佔用保持在 6 GB 以下,甚至在手機上也能達到約 30 個詞元/秒的速度,使其能夠在入門級筆記型電腦上流暢運行。
  • 其混合架構結合了 MoE(Mixture-of-Experts)、GQA(Grouped-Query Attention)和門控短卷積塊(gated short convolution blocks),總參數為 8.3B,但每個詞元僅激活約 1.5B 參數,這使得它能以 1.5B 級模型的計算成本提供與更大模型媲美的品質。
  • LiquidAI 針對年收入低於 1,000 萬美元的企業提供 LFM 模型的免費開源商業使用權限,旨在降低中小企業採用先進 AI 模型的門檻,並推動邊緣 AI 的普及。
📊 競品分析▸ Show
特性/模型LiquidAI LFM2.5-8B-A1BMeta Llama 3 Instruct 8BMistral Nemo
架構混合MoE (8.3B總參數/1.5B活躍參數)稠密模型 (8B參數)MoE模型 (參數未明確,但與LFM2-8B-A1B比較)
上下文窗口128,000 tokens80,000 tokensN/A
推理速度 (GPU)18.5K tokens/秒 (H100, 高併發)81.2 tokens/秒較慢 (LFM2-8B-A1B更快)
推理速度 (CPU)M5 Max: 253 tokens/秒, Ryzen AI Max+ 395: 146 tokens/秒 (<6GB RAM)N/AN/A
指令遵循媲美Gemma 4-26B等大型MoE模型良好N/A
幻覺率顯著較低N/AN/A
定價 (每百萬詞元)輸入: $0.01, 輸出: $0.02 (基於LFM2-8B-A1B) / 年收入<10M美元企業免費商用輸入: $0.04, 輸出: $0.14輸入: $0.02, 輸出: $0.06
編碼能力較Llama 3.2 3B Instruct更佳 (LFM2-8B-A1B)編碼指數4.0 (較LFM2-8B-A1B的2.3更佳)較LFM2-8B-A1B更差
數學能力較Llama 3.2 3B Instruct更佳 (LFM2-8B-A1B)N/A較LFM2-8B-A1B更差

🛠️ 技術深入

  • 模型架構: 採用混合架構,結合了 MoE (Mixture-of-Experts)、GQA (Grouped-Query Attention) 和門控短卷積塊 (gated short convolution blocks)。
  • 參數規模: 總參數為 8.3B,每個詞元僅激活約 1.5B 參數。
  • 層數: 包含 24 層,其中有 18 個雙門控 LIV 卷積塊和 6 個 GQA 塊。
  • 預訓練數據: 經過 38 兆詞元的預訓練。
  • 上下文長度: 支援 131,072 (128K) 個詞元。
  • 詞彙量: 詞彙量擴展至 128,000,以提高對非拉丁語系的詞元化效率。
  • 推理策略: 作為「僅推理」模型,在生成最終答案前會產生明確的思維鏈 (chain of thought)。
  • 幻覺緩解: 透過一個目標強化學習階段,使用基於 avg@k 的獎勵機制,以減少幻覺並保持知識準確性。
  • 記憶體效率: 在筆記型電腦上運行時,記憶體使用量低於 6GB。
  • 支援框架: 提供對 llama.cpp (GGUF 格式)、MLX (針對 Apple Silicon 優化)、vLLM、SGLang 和 ONNX 的首日支援。
  • 語言支援: 支援英語、阿拉伯語、中文、法語、德語、日語、韓語、葡萄牙語和西班牙語等多種語言。

🔮 前景展望AI analysis grounded in cited sources

邊緣AI裝置的普及將加速,特別是在隱私敏感的應用中。
LFM2.5-8B-A1B 在消費級硬體上實現了高效能和低記憶體佔用,且強調本地運行以保護隱私,這將推動 AI 助理、代理任務等應用直接在用戶設備上運行。
小型 MoE 模型將成為邊緣 AI 領域的主流架構之一。
LiquidAI 證明了 MoE 架構在小參數規模下也能高效運行,並提供與大型模型媲美的性能,這將鼓勵更多開發者和公司採用此類架構來平衡性能與資源限制。
LiquidAI 將透過其「免費開源商業使用」策略,在中小企業市場獲得顯著份額。
對於年收入低於 1,000 萬美元的企業提供免費商業使用,將大幅降低中小企業採用先進 AI 模型的門檻,從而擴大 LiquidAI 的市場滲透率和生態系統。

時間線

2023
Liquid AI 成立,作為 MIT CSAIL 的衍生公司。
2023-12
Liquid AI 獲得 3750 萬美元種子輪融資。
2024-12-13
Liquid AI 獲得 2.5 億美元 A 輪融資。
2025-10-07
Liquid AI 發布 LFM2-8B-A1B,其首個邊緣 MoE 模型,總參數 8.3B,活躍參數 1.5B。
2026-01-06
Liquid AI 發布 LFM2.5 1.2B Instruct 模型,強調其在設備上的推理能力。
2026-05-28
LiquidAI 發布 LFM2.5-8B-A1B 模型。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA