🦙較早收集於 7h

NVIDIA 發布量化版 Qwen3.6-35B-A3B 模型

NVIDIA 發布量化版 Qwen3.6-35B-A3B 模型
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡使用 NVIDIA 新的 NVFP4 量化 Qwen3.6 模型,以減少 3 倍 VRAM 需求部署大型 MoE 模型。

⚡ 30-Second TL;DR

有什麼變化

使用 NVIDIA Model Optimizer 量化為 NVFP4 格式

為什麼重要

此發布為在 VRAM 有限的消費級或企業級硬體上部署大型 MoE 模型提供了高效路徑。它證明了 4-bit 量化在維持高階推理能力方面的可行性。

下一步行動

從 Hugging Face 下載 NVFP4 權重並在您的 vLLM 管道中進行測試,以減少推論硬體的佔用空間。

誰應關注:Developers & AI Engineers

關鍵要點

  • 使用 NVIDIA Model Optimizer 量化為 NVFP4 格式
  • 磁碟空間與 GPU 記憶體需求減少約 3.06 倍
  • 維持與 BF16 精度相當的基準測試準確度
  • 專為 vLLM 推論進行優化
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA