🦙較早收集於 9h

LFM2-24B-A2B 在 Strix Halo 上達 2 倍速

LFM2-24B-A2B 在 Strix Halo 上達 2 倍速
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#amd-hardware#model-speed#rocmlfm2-24b-a2blfm2-24b-a2bstrix halorocmlemonade

💡24B 模型在 AMD Strix Halo 上快 2 倍—立即基準測試你的系統。(42字)

⚡ 30-Second TL;DR

有什麼變化

在 Strix Halo 上幾乎比 gpt-oss-20b 快 2 倍

為什麼重要

凸顯 AMD 硬體在大模型推論效率潛力,可能改變本地 LLM 部署。

下一步行動

在你的 Strix Halo 上使用 ROCm 測試 LFM2-24B-A2B 速度基準。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在 Strix Halo 上幾乎比 gpt-oss-20b 快 2 倍
  • 使用 ROCm 經 Lemonade v9.4.0 測試
  • 24B 模型達到前所未有速度

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • LFM2-24B-A2B 採用混合架構,結合高效閘控短卷積塊與少量分組查詢注意力 (GQA) 塊,經硬體迴圈架構搜尋開發。
  • 該模型為 Mixture of Experts 配置,總參數 24B 但每前向傳遞僅啟用 2.3B 參數,推理成本相當於 2B 密集模型。
  • LFM2 系列在 GPQA Diamond、MMLU-Pro 等基準測試中,品質隨參數從 350M 至 24B 呈對數線性提升。
  • Strix Halo (Ryzen AI Max+ 395) 配備 40 CU RDNA 3.5 iGPU,理論 FP16 59 TFLOPS,記憶體頻寬達 256 GB/s。
  • ROCm 工具箱支援 rocWMMA 庫,利用波矩陣乘法累加指令加速 BF16/F16 工作負載。
📊 競品分析▸ Show
模型架構總參數 (B)啟用參數 (B)基準表現
LFM2-24B-A2B混合 MoE (40層: 30 conv + 10 attn)242.3GPQA Diamond 等 log-linear 提升
Llama 2 7B Q4_K_MLlama 277Strix Halo pp512: 906.1 tg128: 40.8
Shisa V2 8B i1-Q4_K_MLlama 388Strix Halo pp512: 878.2 tg128: 37.2
dots1 UD-Q4_K_XLMoE14214Strix Halo pp512: 63.1 tg128: 20.6

🛠️ 技術深入

  • LFM2-24B-A2B: 40 層 (30 卷積 + 10 注意力),上下文長度 32,768 tokens,詞彙大小 65,536,訓練精度混合 BF16/FP8,訓練預算 17 兆 tokens。
  • Strix Halo (Ryzen AI Max+ 395): 16 核心,40 CU RDNA 3.5 iGPU (gfx11),理論 256 GB/s LPDDR5X 頻寬,實際 GPU MBW ~215 GB/s,理論 FP16 59 TFLOPS。
  • 測試使用 ROCm 經 Lemonade v9.4.0,ROCm 工具箱預設 ROCBLAS_USE_HIPBLASLT=1 以優化 gfx1151 吞吐量。
  • 支援 rocWMMA 庫加速矩陣乘法,-rocwmma-improved 版本針對 32k+ 長上下文優化,但為實驗性補丁。
  • LFM2 混合架構經 hardware-in-the-loop 搜尋設計,實現低記憶體成本的快速預填充與解碼。

🔮 前景展望AI analysis grounded in cited sources

Strix Halo 將推動消費級 APU LLM 推理普及
其 40 CU iGPU 與高頻寬結合 ROCm 優化,使 24B MoE 模型達前所未有速度,降低對獨立 GPU 依賴。
LFM2 MoE 設計將成為低成本高效推理標準
僅 2.3B 啟用參數卻匹敵更大模型,結合可預測擴展行為,適合邊緣裝置部署。
ROCm 在 RDNA 3.5 上將超越 Vulkan 在 LLM 基準
多項測試顯示 HIP/rocWMMA 在 Strix Halo 上提供更高 pp/tg 吞吐量,尤其長上下文工作負載。

時間線

2025-12
AMD 公布 Strix Halo (Ryzen AI Max+ 395) 規格與預生產樣品
2026-01
Strix Halo APU Geekbench 基準曝光,接近 Ryzen 7 9800X3D 多核表現
2026-02
LFM2-24B-A2B 模型發布,LM Studio 提供基準數據與 LFM Open License
2026-02-04
AMD Strix Halo ROCm 工具箱基準發布,展示 rocWMMA 加速效果
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。