🦙Reddit r/LocalLLaMA•較早收集於 2h
16GB VRAM 上 Qwen3.5-9B 最高速技巧
#vram-tuning#gguf-quantsqwen3.5-9bqwen3.5-9bunslothllama.cpp
💡16GB 上 Qwen3.5-9B 22 tps:最佳化你的設備想法(18字)
⚡ 30-Second TL;DR
有什麼變化
Unsloth UD-Q8_K_XL.gguf(12GB)在 4060ti 16VRAM + 32GB RAM
為什麼重要
揭示 9B 模型在消費級 GPU 的實際效能極限。引發本地推理最佳化討論。
下一步行動
在 llama.cpp 上測試 Qwen3.5-9B 的 Q6_K 或 Q4 量化以超越 22 tps。
誰應關注:Developers & AI Engineers
關鍵要點
- •Unsloth UD-Q8_K_XL.gguf(12GB)在 4060ti 16VRAM + 32GB RAM
- •ctx-size 61440、flash-attn on、cache q8_0 達 22 tps 輸出
- •參數:temp 0.6、top-p 0.95、no-mmap、enable_thinking true
- •降低 ctx 未提升速度;尋求社群最佳化
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •Unsloth 的 UD-Q4_K_XL 量化在 Qwen3.5-397B 模型上僅損失 0.8 個百分點準確度,相對錯誤增加僅 4.3%,遠優於傳統量化[1]。
- •Qwen3.5-35B-A3B UD-Q4 在 RTX 5080 16GB GPU 上可達 200k 上下文長度並以 62.98 tps 運行,遠超 16GB VRAM 常規設定[4]。
- •Unsloth GGUF 基準顯示 imatrix 技術顯著改善低位元量化 KLD,尤其在 ssm_out 張量上,並使 UD-Q4_K_XL 在 perplexity 上優於其他 Q4 量化[2]。
- •Qwen3.5-9B 模型於 2026-03-02 正式發布,涵蓋 9B 至 0.8B 尺寸,並提供詳細基準結果[6]。
🛠️ 技術深入
- •Unsloth Dynamic (UD) 量化使用動態上轉重要層(如 ffn_up_exps、ffn_gate_exps 可至 3bit),避免 ssm_out 等敏感張量過度量化,以最小化 KLD 和 perplexity 損失[2]。
- •Imatrix 技術在量化過程中加權重要性,特別改善低位元(如 q2_k)表現,使 Q3_K 有時優於 Q4_K 的非單調現象[2]。
- •Qwen3.5 支持 MoE 卸載,如使用 -ot ".ffn_.*_exps.=CPU" 將 MoE 層移至 CPU,允許單 GPU 載入非 MoE 層並提升生成速度[3]。
- •UD 量化自動使用校準資料集選擇層精度,UD-Q4_K_XL 檔案較小約 8GB 卻在實際基準優於標準 Q4[2]。
- •llama.cpp b8189 與 flash-attn 結合,在高 ctx(如 60k)下維持高效,q8_0 快取進一步優化 VRAM 使用[1][2]。
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-03-02
Qwen3.5 系列發布,包括 9B、4B、2B 和 0.8B 模型並公布基準
2026-02
Unsloth 更新 Qwen3.5-35B 動態量化 GGUF,成為多位元 SOTA 並修復 mxfp4 張量問題
2026-03-01
Unsloth 發布 Qwen3.5 GGUF 基準,涵蓋 150+ KL Divergence 測試與 9TB GGUF
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。