🦙Reddit r/LocalLLaMA•較早收集於 9h
LFM2-24B-A2B 在 Strix Halo 上達 2 倍速

#amd-hardware#model-speed#rocmlfm2-24b-a2blfm2-24b-a2bstrix halorocmlemonade
💡24B 模型在 AMD Strix Halo 上快 2 倍—立即基準測試你的系統。(42字)
⚡ 30-Second TL;DR
有什麼變化
在 Strix Halo 上幾乎比 gpt-oss-20b 快 2 倍
為什麼重要
凸顯 AMD 硬體在大模型推論效率潛力,可能改變本地 LLM 部署。
下一步行動
在你的 Strix Halo 上使用 ROCm 測試 LFM2-24B-A2B 速度基準。
誰應關注:Developers & AI Engineers
關鍵要點
- •在 Strix Halo 上幾乎比 gpt-oss-20b 快 2 倍
- •使用 ROCm 經 Lemonade v9.4.0 測試
- •24B 模型達到前所未有速度
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •LFM2-24B-A2B 採用混合架構,結合高效閘控短卷積塊與少量分組查詢注意力 (GQA) 塊,經硬體迴圈架構搜尋開發。
- •該模型為 Mixture of Experts 配置,總參數 24B 但每前向傳遞僅啟用 2.3B 參數,推理成本相當於 2B 密集模型。
- •LFM2 系列在 GPQA Diamond、MMLU-Pro 等基準測試中,品質隨參數從 350M 至 24B 呈對數線性提升。
- •Strix Halo (Ryzen AI Max+ 395) 配備 40 CU RDNA 3.5 iGPU,理論 FP16 59 TFLOPS,記憶體頻寬達 256 GB/s。
- •ROCm 工具箱支援 rocWMMA 庫,利用波矩陣乘法累加指令加速 BF16/F16 工作負載。
📊 競品分析▸ Show
| 模型 | 架構 | 總參數 (B) | 啟用參數 (B) | 基準表現 |
|---|---|---|---|---|
| LFM2-24B-A2B | 混合 MoE (40層: 30 conv + 10 attn) | 24 | 2.3 | GPQA Diamond 等 log-linear 提升 |
| Llama 2 7B Q4_K_M | Llama 2 | 7 | 7 | Strix Halo pp512: 906.1 tg128: 40.8 |
| Shisa V2 8B i1-Q4_K_M | Llama 3 | 8 | 8 | Strix Halo pp512: 878.2 tg128: 37.2 |
| dots1 UD-Q4_K_XL | MoE | 142 | 14 | Strix Halo pp512: 63.1 tg128: 20.6 |
🛠️ 技術深入
- •LFM2-24B-A2B: 40 層 (30 卷積 + 10 注意力),上下文長度 32,768 tokens,詞彙大小 65,536,訓練精度混合 BF16/FP8,訓練預算 17 兆 tokens。
- •Strix Halo (Ryzen AI Max+ 395): 16 核心,40 CU RDNA 3.5 iGPU (gfx11),理論 256 GB/s LPDDR5X 頻寬,實際 GPU MBW ~215 GB/s,理論 FP16 59 TFLOPS。
- •測試使用 ROCm 經 Lemonade v9.4.0,ROCm 工具箱預設 ROCBLAS_USE_HIPBLASLT=1 以優化 gfx1151 吞吐量。
- •支援 rocWMMA 庫加速矩陣乘法,-rocwmma-improved 版本針對 32k+ 長上下文優化,但為實驗性補丁。
- •LFM2 混合架構經 hardware-in-the-loop 搜尋設計,實現低記憶體成本的快速預填充與解碼。
🔮 前景展望AI analysis grounded in cited sources
Strix Halo 將推動消費級 APU LLM 推理普及
其 40 CU iGPU 與高頻寬結合 ROCm 優化,使 24B MoE 模型達前所未有速度,降低對獨立 GPU 依賴。
LFM2 MoE 設計將成為低成本高效推理標準
僅 2.3B 啟用參數卻匹敵更大模型,結合可預測擴展行為,適合邊緣裝置部署。
ROCm 在 RDNA 3.5 上將超越 Vulkan 在 LLM 基準
多項測試顯示 HIP/rocWMMA 在 Strix Halo 上提供更高 pp/tg 吞吐量,尤其長上下文工作負載。
⏳ 時間線
2025-12
AMD 公布 Strix Halo (Ryzen AI Max+ 395) 規格與預生產樣品
2026-01
Strix Halo APU Geekbench 基準曝光,接近 Ryzen 7 9800X3D 多核表現
2026-02
LFM2-24B-A2B 模型發布,LM Studio 提供基準數據與 LFM Open License
2026-02-04
AMD Strix Halo ROCm 工具箱基準發布,展示 rocWMMA 加速效果
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- lmstudio.ai — Lfm2 24b A2b
- forum.level1techs.com — 233796
- youtube.com — Watch
- kyuz0.github.io — Amd Strix Halo Toolboxes
- Tom's Hardware — Amds Upcoming Ryzen AI Max 392 Hot on the Heels of 9800x3d in Early Benchmarks New Strix Halo Apu Almost Matches Ryzen 7 Beast in Multi Core Performance
- acemagic.com — Best Amd Cpus 2026
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
