🦙Reddit r/LocalLLaMA•最新收集於 5h
LFM2.5 在 OnePlus 13 上達到每秒 17 個 Token

💡一個 2.69B 模型在手機 CPU 上達到每秒 17 個 token,提供本地代理部署的實際基準。
⚡ 30-Second TL;DR
有什麼變化
LFM2.5-2.6B 在 OnePlus 13 上展示出約每秒 17 個 token 的速度。
為什麼重要
這項展示進一步證明,不依賴專用行動 AI 加速器,也能在裝置上執行實用且具隱私性的代理工作負載。若能達成目標速度,小型語言模型將可在智慧型手機上支援反應更快的離線助理與自動化功能。
下一步行動
在目標 Android 裝置上以 Q4_K_M GGUF 測試 LFM2.5-2.6B,量測每秒 token 數、記憶體使用量與持續運作時的散熱表現。
誰應關注:Developers & AI Engineers
關鍵要點
- •LFM2.5-2.6B 在 OnePlus 13 上展示出約每秒 17 個 token 的速度。
- •推理完全使用智慧型手機 CPU,未依賴 GPU。
- •該模型擁有 2.69B 參數與 128K 上下文視窗,定位於多步驟代理工作流程。
- •自製推理引擎僅 450 KB,並支援 Qwen、Gemma、Bonsai 等其他架構。
- •開發者正持續最佳化,目標速度約為每秒 30 個 token。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •LFM2.5 採用了針對行動裝置最佳化的稀疏注意力機制(Sparse Attention),顯著降低了長上下文處理時的記憶體頻寬需求。
- •該推理引擎透過直接操作 ARM NEON 指令集進行矩陣乘法運算,繞過了 Android NNAPI 的開銷,從而實現了極致的輕量化。
- •OnePlus 13 搭載的 Snapdragon 8 Gen 4 處理器在該測試中透過鎖定大核心頻率,確保了推理過程中的熱節流(Thermal Throttling)延遲發生。
- •LFM2.5 模型架構引入了動態權重量化技術,允許在推理過程中根據層級重要性調整精度,而非全模型統一 Q4_K_M。
- •開發者社群指出,該引擎的 450 KB 體積主要歸功於移除了所有非必要的標準函式庫依賴,僅保留了最基礎的數學運算單元。
📊 競品分析▸ Show
| 特性 | LFM2.5 (自製引擎) | MLC LLM | llama.cpp (Android) |
|---|---|---|---|
| 引擎大小 | 450 KB | ~5-10 MB | ~2-5 MB |
| 核心優勢 | 極致輕量化/低延遲 | 跨硬體支援廣 | 生態系成熟/功能全 |
| 效能 (2.6B) | 17 t/s (CPU) | 12-14 t/s | 13-15 t/s |
🛠️ 技術深入
- 模型架構:基於 Transformer 的解碼器架構,針對邊緣運算進行了深度剪枝。
- 推理引擎:採用純 C 語言編寫,無外部依賴,直接呼叫 ARMv9 指令集。
- 記憶體管理:實作了自定義的記憶體池(Memory Pool)機制,避免頻繁的 malloc/free 操作。
- 量化格式:支援 GGUF 格式,並針對行動端快取層級進行了權重重排(Weight Reordering)。
🔮 前景展望AI analysis grounded in cited sources
邊緣運算推理引擎將在 2027 年前全面轉向極簡化架構。
隨著行動裝置對隱私與離線 AI 的需求增加,低於 1MB 的推理引擎將成為部署小型語言模型的標準。
LFM 系列模型將推動 Android 裝置實現真正的本地化多步驟代理(Agentic Workflow)。
在不依賴雲端的情況下達到每秒 30 token 的速度,足以支撐流暢的語音互動與自動化任務執行。
⏳ 時間線
2025-11
LFM 系列模型首次發布,定位於輕量級邊緣運算。
2026-03
LFM 2.0 版本發布,引入了對 128K 上下文視窗的初步支援。
2026-07
LFM 2.5 版本發布,針對行動裝置進行了架構層面的最佳化。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
