🦙Reddit r/LocalLLaMA•較早收集於 13h
Qwen3.5-9B GGUF 量化 KLD 排名

💡數據驅動 GGUF 量化指南:依 KLD 而非僅大小選最佳 Qwen3.5-9B 檔案。(42字)
⚡ 30-Second TL;DR
有什麼變化
最低 KLD:Q8_0 (0.000814)、unsloth UD-Q8_K_XL (0.000895)
為什麼重要
引導量化選擇最佳保真度與大小權衡,助於在消費級硬體高效部署 Qwen3.5-9B。暴露量化器品質差異。
下一步行動
下載 bartowski Q4_K_S GGUF 用於 Qwen3.5-9B,以平衡大小與低 KLD (0.0108)。
誰應關注:Researchers & Academics
關鍵要點
- •最低 KLD:Q8_0 (0.000814)、unsloth UD-Q8_K_XL (0.000895)
- •最佳 VRAM 受限:bartowski IQ4_XS (4.93 GiB, KLD 0.0127)
- •突出:bartowski Q4_K_S (5.18 GiB, KLD 0.0108)
- •unsloth UD-Q3_K_XL 效率最佳;Q2/IQ2 較差
- •bartowski Q4_K_M (0.0087) 勝 unsloth (0.0222)
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •Unsloth 更新其 Qwen3.5 量化方法於 2026 年 3 月 5 日,提升 MoE 模型的最大 KLD 表現,並確認 imatrix 在低位元量化下顯著改善 KLD。
- •Qwen3.5-9B 的 abliterated(去審查)GGUF 版本即使在 Q6_K 量化下也表現不佳,低於 Q4_K_L 的效能。
- •Unsloth 建議避免過度量化 attn_* 張量及 ssm_out,並指出 MXFP4 在 attn_gate、attn_q 等張量上不如 Q4_K。
- •Qwen3.5-9B 在 SuperGPQA 等基準測試中,量化版本維持高分,如 GPQA Diamond 達 81.7%。
📊 競品分析▸ Show
| 量化器 | 特點 | 基準表現 | 檔案大小範例 |
|---|---|---|---|
| unsloth UD-Q* | 動態量化,imatrix 支援,MoE 最佳化 | 99.9% KLD 領先,最大 KLD 改善 | UD-Q3_K_XL (效率最佳) |
| bartowski IQ/Q* | llama.cpp imatrix,嵌入層 Q8_0 | IQ4_XS KLD 0.0127 (VRAM 低) | IQ4_XS 4.93 GiB |
| 標準 llama.cpp Q* | 無特殊最佳化 | Q4_K_M 0.0087 優於 unsloth 對應版 | Q4_K_S 5.18 GiB |
🛠️ 技術深入
- •模型架構:密集 Transformer 解碼器,9B 參數,32 層注意力,隱藏維度 4096,上下文視窗 128K 權杖。
- •Gated Delta Networks 結合稀疏 MoE,提供高效混合架構;線性注意力頭:V 32 個,QK 16 個。
- •Unsloth 量化洞見:ffn_up_exps/ffn_gate_exps 可至 3bit,ssm_out 敏感避免 Q2_K,attn_* 張量需高精度。
- •bartowski GGUF 使用 llama.cpp b8182 量化,嵌入/輸出權重部分為 Q8_0。
- •評估方法:KLD 與 PPL 對 BF16 基準,相對錯誤增加計算(如 85% 準確率為 50% 相對增加)。
🔮 前景展望AI analysis grounded in cited sources
Qwen3.5 GGUF 量化將推動消費者級 GPU 部署主流化
9B 模型在 RTX 3060/4060 上以 IQ4_XS 等量化運行,結合低 KLD 表現,降低企業級硬體需求。
unsloth 與 bartowski 競爭將加速 GGUF 低位元優化
雙方在 3-4bit 量化 KLD 競爭激烈,imatrix 與動態方法改善預示更低 VRAM 高效模型。
Abliterated 版本量化損失將限制其採用
Q6_K 以下表現遠低於標準 Q4_K,社區評估顯示僅大模型如 397B 適合極低位元。
⏳ 時間線
2026-03
Qwen3.5 系列發布,包含 9B 密集模型
2026-03-05
unsloth 更新 Qwen3.5 GGUF 量化,提升 MoE 最大 KLD
2026-03-12
Reddit r/LocalLLaMA 發布 Qwen3.5-9B 46 種 GGUF KLD 排名
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- kaitchup.substack.com — Summary of Qwen35 Gguf Evaluations
- unsloth.ai — Gguf Benchmarks
- zimage.run — Qwen3.5 9b Complete Guide
- Hugging Face — Qwen3.5 9b Gguf
- Hugging Face — Qwen Qwen3.5 9b Gguf
- kaitchup.substack.com — More Qwen35 Gguf Evals and Speculative
- qwenlm.github.io — Qwen3
- Hugging Face — Qwen3.5 9b Gguf
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。