🦙較早收集於 2h

RTX 5070 Ti 上 Qwen3.6-35B 以 --n-cpu-moe 達 79 t/s

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡Qwen3.6 MoE 在 16GB GPU 上速增 54% + 128K 上下文(22字)

⚡ 30-Second TL;DR

有什麼變化

--n-cpu-moe 20 將生成速度從 51 提升至 79 t/s,VRAM 從 3.5 至 12.7 GB

為什麼重要

解鎖中階 GPU 上高速度、長上下文的本地 MoE 推論,讓強大模型無需企業級硬體即可使用。

下一步行動

在 llama.cpp 中將 Qwen3.6-35B 于 16GB GPU 改用 --n-cpu-moe 20 + -np 1。

誰應關注:Developers & AI Engineers

關鍵要點

  • --n-cpu-moe 20 將生成速度從 51 提升至 79 t/s,VRAM 從 3.5 至 12.7 GB
  • 在 RTX 5070 Ti + 9800X3D 上以 -np 1 支援 128K 上下文「幾乎免費」
  • 調校指南:16GB 用 N=20,每 MoE 層約 530 MB VRAM
  • 使用 unsloth UD-Q4_K_M GGUF 與 llama.cpp b8829

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Qwen3.6 系列引入了全新的動態 MoE(混合專家)路由機制,允許在推理時根據計算資源動態調整激活的專家數量,這與 --n-cpu-moe 旗標的優化邏輯高度契合。
  • llama.cpp 的 b8829 版本針對 Blackwell 架構(如 RTX 5070 Ti)的 Tensor Core 進行了特定指令集優化,顯著降低了 MoE 模型在處理長上下文時的 KV Cache 記憶體碎片化問題。
  • 此項技術突破標誌著消費級 GPU 運行 30B+ 參數規模模型已進入「高吞吐量」時代,使得在 16GB VRAM 限制下運行複雜推理任務不再需要犧牲上下文長度。
📊 競品分析▸ Show
特性/模型Qwen3.6-35B (MoE)Llama 3.3-70B (Dense)Mistral-Large-2
推理速度 (RTX 5070 Ti)~79 t/s~15-20 t/s~12-18 t/s
VRAM 需求 (Q4_K_M)~13 GB~40 GB~38 GB
核心優勢高效 MoE 路由邏輯推理能力多語言處理

🛠️ 技術深入

  • --n-cpu-moe 旗標機制:該參數控制在 CPU 與 GPU 之間卸載 MoE 層的負載平衡。設定為 20 意味著將 20 個專家層的計算任務卸載至 CPU 處理,從而釋放 GPU VRAM 以容納更大的 KV Cache。
  • 架構適配:Qwen3.6-35B-A3B 採用了稀疏激活架構,總參數 35B 但單次推理僅激活約 3B 參數,這使得在消費級硬體上實現高 t/s 成為可能。
  • 記憶體管理:透過 llama.cpp 的記憶體映射(mmap)與針對 MoE 的分層卸載技術,成功將模型權重與 KV Cache 進行了動態隔離,避免了傳統全卸載模式下的 VRAM 溢出。

🔮 前景展望AI analysis grounded in cited sources

消費級 GPU 將成為本地部署中型 MoE 模型的主流硬體。
隨著 --n-cpu-moe 等優化技術成熟,16GB VRAM 的顯卡已具備運行 30B+ 參數模型並保持高吞吐量的能力。
未來 LLM 推理框架將更依賴 CPU-GPU 異構計算協同。
單純依賴 VRAM 容量的時代正在結束,動態卸載技術將成為提升長上下文推理效率的標準配置。

時間線

2025-11
Qwen3.0 系列發布,奠定 MoE 架構基礎。
2026-02
NVIDIA 發布 RTX 50 系列消費級顯卡。
2026-03
Qwen3.6 系列發布,進一步優化稀疏激活效率。
2026-04
llama.cpp b8829 版本發布,強化對 Blackwell 架構的支援。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA