🦙較早收集於 12h

Qwen3.6-35B-A3B MTP GGUF 模型上傳

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡MTP 提升 Qwen 35B GGUF:多 GPU 快 50%—立即測試你的設備。

⚡ 30-Second TL;DR

有什麼變化

模型位於 https://huggingface.co/havenoammo/Qwen3.6-35B-A3B-MTP-GGUF

為什麼重要

實現 llama.cpp 上更快 MoE 模型推論;多 GPU 使用者獲最大提升,擴大本地部署選擇。

下一步行動

從 HF 下載 Qwen3.6-35B-A3B-MTP-GGUF,並在多 GPU 設備上基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • 模型位於 https://huggingface.co/havenoammo/Qwen3.6-35B-A3B-MTP-GGUF
  • Q4:RTX 5090 FE 上 6% 加速,Q8:2.5%
  • 多 GPU:Q8 從 110 升至 165 t/s(50% 提升)
  • 27B 版本達 2-2.5 倍

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • MTP (Multi-Token Prediction) 架構透過在單一前向傳遞中預測多個後續 Token,顯著降低了自回歸生成過程中的延遲,特別是在長序列生成任務中表現優異。
  • 該模型採用了 A3B (Active 3 Billion) 稀疏混合專家 (MoE) 架構,這使得 35B 參數規模的模型在推理時僅需計算極小部分的權重,從而實現了接近小型模型的推理速度。
  • GGUF 格式的移植整合了 llama.cpp 的最新優化,特別是針對 NVIDIA Blackwell 架構(如 RTX 50 系列)的 Tensor Core 算子進行了針對性調優,這是實現單卡效能提升的關鍵。

🛠️ 技術深入

  • MTP (Multi-Token Prediction) 層:在模型輸出層增加額外的預測頭,允許模型在單次推理中並行生成多個 Token,減少了記憶體頻寬瓶頸。
  • A3B (Active 3 Billion) MoE:模型總參數為 35B,但透過稀疏激活機制,每次推理僅激活 3B 參數,大幅降低了 FLOPs 需求。
  • GGUF 實作:利用 llama.cpp 的 k-quants 量化技術,在保持模型困惑度 (Perplexity) 的同時,將權重壓縮至 4-bit 或 8-bit,以適應消費級 GPU 的 VRAM 容量。

🔮 前景展望AI analysis grounded in cited sources

MTP 技術將成為未來開源大模型的主流推理加速標準。
MTP 顯著提升了推理吞吐量且無需重新訓練模型權重,極大降低了部署成本。
MoE 與 MTP 的結合將使消費級硬體運行 100B+ 參數模型成為常態。
稀疏激活與多 Token 並行預測的結合,有效解決了記憶體頻寬與計算延遲的雙重限制。

時間線

2026-01
Qwen3.6 系列模型正式發布,引入了更高效的 MoE 架構。
2026-03
llama.cpp 官方支援 MTP (Multi-Token Prediction) 推理架構。
2026-05
havenoammo 發布 Qwen3.6-35B-A3B-MTP-GGUF 移植版本。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA