🦙較早收集於 2h

優化大型 MoE 模型的 CPU 推論效能

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡了解如何在不支援 AVX512 的消費級 CPU 上優化本地 LLM 推論效能。

⚡ 30-Second TL;DR

有什麼變化

針對消費級硬體運行 Qwen3.6 35B A3B 模型

為什麼重要

了解 CPU 推論的瓶頸對於在沒有高階 GPU 的情況下部署本地 LLM 的開發者至關重要。

下一步行動

使用 llama.cpp 的 bench 工具測試您的特定 CPU 架構,以確定 MoE 模型是否適合您的使用情境。

誰應關注:Developers & AI Engineers

關鍵要點

  • 針對消費級硬體運行 Qwen3.6 35B A3B 模型
  • 僅具備 AVX2 的 CPU 在推論上的效能限制
  • 平衡 MoE 模型推論所需的 RAM 頻寬

🧠 深度解析

Web-grounded analysis with 40 cited sources.

🔑 增強重點摘要

  • Qwen3.6 35B A3B 模型採用混合稀疏專家混合 (MoE) 架構,總參數為 350 億,但每個 Token 僅啟用 30 億參數,使其在本地部署時能以較低的推論成本實現接近大型模型的性能。該模型還支援多模態輸入(文字、圖像、影片)和長達 262K 的原生上下文視窗(可擴展至 1M)。
  • 除了 AVX2,現代 CPU 推論效能的關鍵優化來自於更先進的指令集,例如 Intel 的 AVX512、AVX512 VNNI 和特別是 Intel AMX (Advanced Matrix Extensions)。這些指令集專為加速深度學習工作負載中的低精度(INT8、BF16)矩陣運算而設計,能顯著提升 LLM 推論速度。
  • MoE 模型的量化比傳統密集模型更具挑戰性,因為其門控網路和專家池的獨特結構。為解決此問題,已開發出「組件特定量化」等技術,以及 MoEQuant 等框架,透過專家平衡自採樣 (Expert-Balanced Self-Sampling) 和親和力引導量化 (Affinity-Guided Quantization) 等方法,在降低記憶體佔用的同時保持模型準確性。
  • 在記憶體受限的消費級硬體上運行大型 MoE 模型時,CPU-GPU 混合卸載策略至關重要。像 llama.cpp 和 LM Studio 等工具支援將 MoE 模型的專家權重卸載到 CPU 記憶體,同時將注意力層和 KV 快取保留在 GPU VRAM 中,以平衡資源利用並實現可用的 Token 生成速度。
  • 除了 llama.cpp,還有其他專為 CPU LLM 推論設計的軟體框架,例如 MLC LLM 和 Intel 的 Neural Speed。這些框架透過先進的編譯和運行時優化,以及對特定 CPU 指令集的利用,旨在提供高效能、記憶體效率的 LLM 推論,並支援多種硬體平台。
📊 競品分析▸ Show
特性/框架CPU 優化重點MoE 支援量化支援典型應用場景
llama.cpp廣泛支援 AVX2/AVX512,CPU/GPU 混合卸載,記憶體頻寬優化支援 MoE 專家權重卸載至 CPU (--n-cpu-moe)GGUF 量化格式 (INT4, INT8 等)消費級硬體上的本地 LLM 推論,社群驅動
MLC LLM機器學習編譯器驅動的優化,跨設備高效能,CPU 側優化支援 MoE 模型部署支援 AutoAWQ 等量化模型載入 (W4A16)雲端與邊緣設備的通用 LLM 部署,高吞吐量低延遲
Intel 優化 (IPEX, Neural Speed)專為 Intel CPU 設計,利用 AMX, AVX512, VNNI 等指令集加速矩陣運算支援 MoE 模型推論深度優化低精度 (INT8, BF16) 量化推論Intel Xeon 伺服器上的高效能 LLM 推論,企業級應用
vLLM主要為 GPU 優化,但支援 CPU 推論 (AVX2 有限功能,AVX512 推薦)支援 MoE 模型 (透過 SplitK 優化)支援 BF16 等精度高吞吐量、低延遲的 LLM 服務,主要用於 GPU 叢集

🛠️ 技術深入

  • Qwen3.6 35B A3B 模型架構: 該模型是一個因果語言模型,整合了視覺編碼器。它採用混合稀疏專家混合 (MoE) 設計,總參數為 350 億,但每個 Token 僅啟用 30 億參數。其隱藏維度為 2048,包含 40 層。MoE 層結合了 Gated DeltaNet 線性注意力與標準門控注意力層。模型共有 256 個專家,其中 8 個被路由啟用,另有 1 個共享專家始終啟用。它原生支援 262K 的上下文長度,並可透過 RoPE 縮放擴展至 1M Token。
  • MoE 模型核心機制: MoE 模型透過將傳統 Transformer 模型中的密集前饋網路 (FFN) 層替換為稀疏 MoE 層來運作。每個 MoE 層包含多個「專家」(每個專家都是一個獨立的 FFN)和一個「門控網路」(路由器),該網路根據輸入 Token 動態選擇一小部分專家進行計算。這使得模型能夠在保持巨大總參數量的同時,顯著降低每個 Token 的活躍參數數量,從而減少推論時的計算量。
  • CPU 推論優化技術:
    • 量化 (Quantization): 透過將模型權重和/或激活值從高精度(如 FP32/BF16)降低到低精度(如 INT8/INT4),顯著減少模型記憶體佔用並加速計算。對於 MoE 模型,需要採用組件特定量化,例如對專家 FFN 進行積極量化,同時對門控網路採取更謹慎的策略,以避免精度損失。
    • 指令集架構 (ISA) 利用: 現代 CPU 包含專門的 SIMD (Single Instruction, Multiple Data) 擴展,如 AVX2、AVX512,以及針對低精度整數運算加速的 AVX512 VNNI 和 Intel AMX。AMX 特別針對 INT8 和 BF16 矩陣乘法進行優化,是 Intel Xeon 處理器上 LLM 推論的關鍵加速器。
    • 記憶體頻寬優化: 對於 CPU 推論,記憶體頻寬是主要瓶頸。優化策略包括精心設計資料佈局、預取機制和快取層次結構利用,以最大化資料傳輸效率。
    • CPU-GPU 協同推論: 在記憶體受限的系統中,將 MoE 模型的專家權重(佔模型大部分參數)選擇性地卸載到 CPU 記憶體,而將核心的注意力層和 KV 快取保留在 GPU 上。這種方法利用 GPU 的計算速度處理關鍵部分,同時利用 CPU 的大記憶體容量儲存不常活躍的專家權重,減少了 GPU VRAM 的壓力。
    • 軟體層面優化: 機器學習編譯器 (如 MLC LLM) 可生成高效的特定硬體核心,並進行動態形狀感知記憶體規劃、CUDA Graph 重寫 (針對 GPU,但 MLC LLM 也減少 CPU 開銷) 和推測解碼 (speculative decoding) 等優化,以降低延遲和提高吞吐量。

🔮 前景展望AI analysis grounded in cited sources

消費級 CPU 將能更高效地運行大型 MoE 模型。
隨著專為 MoE 模型設計的量化技術和 CPU 指令集(如 Intel AMX)的進步,以及像 llama.cpp 和 MLC LLM 等框架的持續優化,CPU 推論效能將顯著提升。
混合 CPU-GPU 推論將成為記憶體受限系統上部署大型 MoE 模型的標準。
透過將部分專家權重卸載到 CPU,同時將核心注意力層保留在 GPU 上,可以有效利用現有硬體資源,克服單一消費級 GPU 的 VRAM 限制。
開源 MoE 模型將加速 AI 應用在邊緣設備和本地部署的普及。
Qwen3.6 35B A3B 等模型展示了在保持高性能的同時顯著降低活躍參數數量的能力,這使得它們更適合在資源有限的設備上運行,從而擴大 AI 的應用範圍。

時間線

1991-XX
Robert Jacobs 和 Geoffrey Hinton 發表論文《Adaptive Mixtures of Local Experts》,提出 MoE 概念。
2017-01
Google 發表論文《Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer》,將稀疏門控 MoE 層引入 Transformer 模型。
2023-04
阿里巴巴雲推出 Qwen 系列模型(通義千問)的測試版。
2024-11
Qwen 2.0 發布,成功實施 MoE 架構,在多個基準測試中超越 Llama 3。
2025-08
LM Studio 開始支援 llama.cpp 的 MoE CPU 卸載功能。
2026-04
阿里巴巴雲發布 Qwen3.6-35B-A3B 模型,這是一個開源的稀疏 MoE 模型,具有 35B 總參數和 3B 活躍參數。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA