🦙Reddit r/LocalLLaMA•較早收集於 7h
NVIDIA 發布量化版 Qwen3.6-35B-A3B 模型

💡使用 NVIDIA 新的 NVFP4 量化 Qwen3.6 模型,以減少 3 倍 VRAM 需求部署大型 MoE 模型。
⚡ 30-Second TL;DR
有什麼變化
使用 NVIDIA Model Optimizer 量化為 NVFP4 格式
為什麼重要
此發布為在 VRAM 有限的消費級或企業級硬體上部署大型 MoE 模型提供了高效路徑。它證明了 4-bit 量化在維持高階推理能力方面的可行性。
下一步行動
從 Hugging Face 下載 NVFP4 權重並在您的 vLLM 管道中進行測試,以減少推論硬體的佔用空間。
誰應關注:Developers & AI Engineers
關鍵要點
- •使用 NVIDIA Model Optimizer 量化為 NVFP4 格式
- •磁碟空間與 GPU 記憶體需求減少約 3.06 倍
- •維持與 BF16 精度相當的基準測試準確度
- •專為 vLLM 推論進行優化
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
