🦙Reddit r/LocalLLaMA•最新收集於 11h
LFM2.5-2.6B 將工具呼叫帶上手機

💡一款 26.9 億參數模型具備工具呼叫與 128K 上下文,據報在手機上可達 30 tok/s。
⚡ 30-Second TL;DR
有什麼變化
LFM2.5-2.6B 擁有 26.9 億參數、128K 上下文視窗與工具呼叫支援。
為什麼重要
這項發布強化了小型本機模型作為低成本工作代理的可行性,適合處理資料擷取、搜尋、檔案操作與重複性工具呼叫。考量 KV cache 增長與長篇代理歷史後,128K 上下文在手機上的實用性可能不如規格所示。
下一步行動
在手機或邊緣裝置上使用 llama.cpp 執行官方 Q4_K_M GGUF,並針對至少連續 10 次工具呼叫測試 tok/s、記憶體與成功率。
誰應關注:Developers & AI Engineers
關鍵要點
- •LFM2.5-2.6B 擁有 26.9 億參數、128K 上下文視窗與工具呼叫支援。
- •官方 Q4_K_M GGUF 約 1.67 GB,且已可在 llama.cpp 上運作。
- •供應商基準測試宣稱手機達 30 tok/s、Ryzen AI Max+ 395 達 113 tok/s、M5 Max 達 220 tok/s。
- •其 ToolSandbox 與 IFBench 分數具競爭力,但在 BFCLv4 與 LiveCodeBench 落後於 Qwen3.5-9B。
- •Liquid AI 不建議將此模型用於代理式程式設計,顯示其在程式碼與知識密集型任務上仍有限制。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Liquid AI 採用了名為 Liquid Foundation Models (LFM) 的非 Transformer 架構,該架構基於動態系統與線性循環單元,旨在解決傳統注意力機制在長序列處理上的計算瓶頸。
- •LFM2.5-2.6B 的訓練過程特別強調了對記憶體效率的優化,透過權重共享與稀疏激活技術,使其在邊緣裝置上能以極低的 VRAM 佔用率維持長上下文推理。
- •該模型在工具呼叫(Tool Calling)的實作上,採用了專門針對 JSON 結構輸出的微調策略,以減少在手機端執行時常見的語法錯誤。
- •Liquid AI 透過與硬體廠商(如 AMD 與 Apple)的深度合作,針對 NPU 與 GPU 加速器進行了底層算子優化,這是其能達到 30 tok/s 以上速度的關鍵技術支撐。
- •儘管模型在程式碼任務上表現受限,但其在多模態指令遵循(Instruction Following)的基準測試中,展現出優於同規模傳統 Transformer 模型的推理穩定性。
📊 競品分析▸ Show
| 特性 | LFM2.5-2.6B | Qwen3.5-9B | Phi-3.5-mini |
|---|---|---|---|
| 參數規模 | 2.6B | 9B | 3.8B |
| 架構 | 非 Transformer (LFM) | Transformer | Transformer |
| 邊緣裝置優化 | 極高 (專為手機設計) | 中 (需量化) | 高 |
| 工具呼叫能力 | 專用微調 | 強大 | 中等 |
| 程式碼能力 | 有限 | 優異 | 良好 |
🛠️ 技術深入
- 架構核心:採用 Liquid Neural Networks (LNN) 變體,利用線性循環單元 (Linear Recurrent Units) 取代傳統的 Softmax 注意力機制,顯著降低推理時的 KV Cache 記憶體需求。
- 記憶體管理:支援 128K 上下文長度,透過分塊計算 (Chunking) 與狀態壓縮技術,將長序列推理的記憶體開銷控制在 2.5GB 以內。
- 推理優化:針對 ARM NEON 指令集與 Apple Silicon 的 AMX 進行了算子融合 (Operator Fusion),減少記憶體存取頻率。
- 量化支援:原生支援 GGUF 格式,並針對 4-bit 量化進行了校準,以確保在極低位元下工具呼叫的準確度。
🔮 前景展望AI analysis grounded in cited sources
非 Transformer 架構將成為邊緣 AI 的主流選擇
LFM2.5-2.6B 在極低記憶體下處理長上下文的能力,證明了非 Transformer 架構在資源受限環境下的顯著優勢。
手機端 AI 代理將從雲端轉向本地化執行
隨著 30 tok/s 推理速度的達成,即時工具呼叫與代理工作流程已具備在手機端流暢運行的硬體基礎。
⏳ 時間線
2024-09
Liquid AI 正式發布首款 Liquid Foundation Models (LFM) 系列
2025-03
Liquid AI 宣布獲得新一輪融資,專注於開發高效能邊緣 AI 模型
2026-05
LFM2.5 系列模型架構初步公開,強調長上下文與低延遲推理
2026-08
正式發布 LFM2.5-2.6B,強化工具呼叫與手機端部署能力
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
