🦙較早收集於 2h

16GB VRAM 上 Qwen3.5-9B 最高速技巧

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#vram-tuning#gguf-quantsqwen3.5-9bqwen3.5-9bunslothllama.cpp

💡16GB 上 Qwen3.5-9B 22 tps:最佳化你的設備想法(18字)

⚡ 30-Second TL;DR

有什麼變化

Unsloth UD-Q8_K_XL.gguf(12GB)在 4060ti 16VRAM + 32GB RAM

為什麼重要

揭示 9B 模型在消費級 GPU 的實際效能極限。引發本地推理最佳化討論。

下一步行動

在 llama.cpp 上測試 Qwen3.5-9B 的 Q6_K 或 Q4 量化以超越 22 tps。

誰應關注:Developers & AI Engineers

關鍵要點

  • Unsloth UD-Q8_K_XL.gguf(12GB)在 4060ti 16VRAM + 32GB RAM
  • ctx-size 61440、flash-attn on、cache q8_0 達 22 tps 輸出
  • 參數:temp 0.6、top-p 0.95、no-mmap、enable_thinking true
  • 降低 ctx 未提升速度;尋求社群最佳化

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Unsloth 的 UD-Q4_K_XL 量化在 Qwen3.5-397B 模型上僅損失 0.8 個百分點準確度,相對錯誤增加僅 4.3%,遠優於傳統量化[1]
  • Qwen3.5-35B-A3B UD-Q4 在 RTX 5080 16GB GPU 上可達 200k 上下文長度並以 62.98 tps 運行,遠超 16GB VRAM 常規設定[4]
  • Unsloth GGUF 基準顯示 imatrix 技術顯著改善低位元量化 KLD,尤其在 ssm_out 張量上,並使 UD-Q4_K_XL 在 perplexity 上優於其他 Q4 量化[2]
  • Qwen3.5-9B 模型於 2026-03-02 正式發布,涵蓋 9B 至 0.8B 尺寸,並提供詳細基準結果[6]

🛠️ 技術深入

  • Unsloth Dynamic (UD) 量化使用動態上轉重要層(如 ffn_up_exps、ffn_gate_exps 可至 3bit),避免 ssm_out 等敏感張量過度量化,以最小化 KLD 和 perplexity 損失[2]
  • Imatrix 技術在量化過程中加權重要性,特別改善低位元(如 q2_k)表現,使 Q3_K 有時優於 Q4_K 的非單調現象[2]
  • Qwen3.5 支持 MoE 卸載,如使用 -ot ".ffn_.*_exps.=CPU" 將 MoE 層移至 CPU,允許單 GPU 載入非 MoE 層並提升生成速度[3]
  • UD 量化自動使用校準資料集選擇層精度,UD-Q4_K_XL 檔案較小約 8GB 卻在實際基準優於標準 Q4[2]
  • llama.cpp b8189 與 flash-attn 結合,在高 ctx(如 60k)下維持高效,q8_0 快取進一步優化 VRAM 使用[1][2]

🔮 前景展望AI analysis grounded in cited sources

16GB VRAM 將成為 Qwen3.5 中型模型標準部署環境
Unsloth UD 量化與 MoE 卸載使 9B-35B 模型在 16GB GPU 上達 20-60 tps,擴大消費者硬體應用範圍[1][4]
UD 量化將取代傳統 GGUF 成為本地 LLM 首選
基準顯示 UD-Q4_K_XL 在品質與大小上優於標準 Q4,並在多基準保持 <1% 準確度損失[1][2]
Qwen3.5 MoE 模型細調將普及至 17.5GB VRAM
Unsloth 2026 MoE 更新使 Qwen3-30B-A3B 細調僅需 17.5GB VRAM,2x 速度與 70% VRAM 節省[3]

時間線

2026-03-02
Qwen3.5 系列發布,包括 9B、4B、2B 和 0.8B 模型並公布基準
2026-02
Unsloth 更新 Qwen3.5-35B 動態量化 GGUF,成為多位元 SOTA 並修復 mxfp4 張量問題
2026-03-01
Unsloth 發布 Qwen3.5 GGUF 基準,涵蓋 150+ KL Divergence 測試與 9TB GGUF
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。