🦙Reddit r/LocalLLaMA•較早收集於 11m
Qwen3.5-35B GGUF 量化基準測試
#quantization#benchmarks#kld#local-inferenceqwen3.5-35bqwen3.5-35bggufhugging-faceunsloth
💡Qwen3.5-35B 量化的詳細 KLD/速度基準—選最適合你的 GPU(最高 143 t/s)(62字元)
⚡ 30-Second TL;DR
有什麼變化
KLD 在混合 FLORES 200 + calibration_data_v5_rc.txt 資料集上測量
為什麼重要
幫助 GPU 資源有限的使用者選擇最佳 Qwen3.5-35B 量化版本,平衡品質與速度。強調本地推論中的量化權衡。
下一步行動
從 Hugging Face 下載頂級 KLD 量化如 unsloth_UD-Q4_K_XL,並在你的 RTX 設定上基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •KLD 在混合 FLORES 200 + calibration_data_v5_rc.txt 資料集上測量
- •頂級量化:unsloth_UD-Q4_K_XL (KLD 0.016158, 122 TG/s)
- •在 RTX 3090 + Intel CPU 上速度差異 36% (105-143 TG/s)
- •包含舊版 Unsloth 模型的 cmp-nct 鏡像
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 5 個來源。
🔑 增強重點摘要
- •Qwen3.5-35B-A3B 採用 Mixture-of-Experts (MoE) 架構,總參數 35B 但每 token 僅激活 3B 參數,在 MMLU 和 GSM8K 等基準測試中超越前代 Qwen3-235B 模型[1][2]。
- •Qwen3.5 系列於 2026 年 2 月由 Alibaba Cloud 的 Qwen 團隊發布,包括 Flash、27B、35B-A3B 和 122B-A10B 模型,皆支援 256K+ 上下文視窗及原生多模態能力[1][5]。
- •Q4 量化後 Qwen3.5-35B-A3B VRAM 需求約 12-15GB 或 18GB,可單一 RTX 3090/4090 運行,並高度相容 LoRA/QLoRA 微調[1][2]。
- •在 llama.cpp + openclaw 上 DGX Spark (GB10) 運行 Qwen3.5-35B-A3B 可達 43 tok/s 生成與 63 tok/s 預填充速度[4]。
- •Qwen3.5-27B 作為密集模型在生產部署中表現優異,適合 VRAM 充足的本地環境[3]。
📊 競品分析▸ Show
| 模型 | 類型 | 總參數 | 激活參數 | 上下文視窗 | 關鍵優勢 |
|---|---|---|---|---|---|
| Qwen3.5-Flash | API | ~35B | ~3B | 256K | 速度/成本 |
| Qwen3.5-27B | 密集 | 27B | 27B | 256K | 微調穩定性 |
| Qwen3.5-35B-A3B | MoE | 35B | 3B | 262K | 效率/智能比 |
| Qwen3.5-122B-A10B | MoE | 122B | 10B | 262K+ | 深度推理/長上下文 |
🛠️ 技術深入
- •Qwen3.5-35B-A3B 使用 Gated Delta Network 結合稀疏 Mixture-of-Experts 層架構,實現雙重效率優化[3]。
- •支援 262K 上下文視窗,原生多模態早融合架構,優於 Qwen3-VL 在視覺理解基準[1]。
- •Q4_K_M 量化 VRAM 需求 18GB (27B) 或 12-15GB (35B-A3B),相容 llama.cpp、openclaw 及 LoRA/QLoRA 微調[1][2][4]。
- •提示工程建議使用系統指令定義角色,以激活 MoE 模型的正確專家路由[2]。
- •全量化模型磁碟大小約 37GB,在 GB10 上支援工具呼叫、串流及 [think] 關鍵字切換推理模式[3][4]。
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-02
Qwen3.5 系列發布,包括 35B-A3B MoE 模型
2026-02-16
Qwen3.5-35B-A3B、27B 等模型正式開源至 Hugging Face
2026-03
社群發布 Qwen3.5-35B GGUF 量化基準測試(RTX 3090)
📎 來源 (5)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
