🦙Reddit r/LocalLLaMA•較早收集於 12h
Qwen3.6-35B-A3B MTP GGUF 模型上傳
#moe-model#mtp-acceleration#gguf-quantqwen3.6-35b-a3b-mtp-ggufqwen3.6-35b-a3bmtpggufunslothhuggingface
💡MTP 提升 Qwen 35B GGUF:多 GPU 快 50%—立即測試你的設備。
⚡ 30-Second TL;DR
有什麼變化
模型位於 https://huggingface.co/havenoammo/Qwen3.6-35B-A3B-MTP-GGUF
為什麼重要
實現 llama.cpp 上更快 MoE 模型推論;多 GPU 使用者獲最大提升,擴大本地部署選擇。
下一步行動
從 HF 下載 Qwen3.6-35B-A3B-MTP-GGUF,並在多 GPU 設備上基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •模型位於 https://huggingface.co/havenoammo/Qwen3.6-35B-A3B-MTP-GGUF
- •Q4:RTX 5090 FE 上 6% 加速,Q8:2.5%
- •多 GPU:Q8 從 110 升至 165 t/s(50% 提升)
- •27B 版本達 2-2.5 倍
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •MTP (Multi-Token Prediction) 架構透過在單一前向傳遞中預測多個後續 Token,顯著降低了自回歸生成過程中的延遲,特別是在長序列生成任務中表現優異。
- •該模型採用了 A3B (Active 3 Billion) 稀疏混合專家 (MoE) 架構,這使得 35B 參數規模的模型在推理時僅需計算極小部分的權重,從而實現了接近小型模型的推理速度。
- •GGUF 格式的移植整合了 llama.cpp 的最新優化,特別是針對 NVIDIA Blackwell 架構(如 RTX 50 系列)的 Tensor Core 算子進行了針對性調優,這是實現單卡效能提升的關鍵。
🛠️ 技術深入
- MTP (Multi-Token Prediction) 層:在模型輸出層增加額外的預測頭,允許模型在單次推理中並行生成多個 Token,減少了記憶體頻寬瓶頸。
- A3B (Active 3 Billion) MoE:模型總參數為 35B,但透過稀疏激活機制,每次推理僅激活 3B 參數,大幅降低了 FLOPs 需求。
- GGUF 實作:利用 llama.cpp 的 k-quants 量化技術,在保持模型困惑度 (Perplexity) 的同時,將權重壓縮至 4-bit 或 8-bit,以適應消費級 GPU 的 VRAM 容量。
🔮 前景展望AI analysis grounded in cited sources
MTP 技術將成為未來開源大模型的主流推理加速標準。
MTP 顯著提升了推理吞吐量且無需重新訓練模型權重,極大降低了部署成本。
MoE 與 MTP 的結合將使消費級硬體運行 100B+ 參數模型成為常態。
稀疏激活與多 Token 並行預測的結合,有效解決了記憶體頻寬與計算延遲的雙重限制。
⏳ 時間線
2026-01
Qwen3.6 系列模型正式發布,引入了更高效的 MoE 架構。
2026-03
llama.cpp 官方支援 MTP (Multi-Token Prediction) 推理架構。
2026-05
havenoammo 發布 Qwen3.6-35B-A3B-MTP-GGUF 移植版本。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗