🦙較早收集於 11m

Qwen3.5-35B GGUF 量化基準測試

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#benchmarks#kld#local-inferenceqwen3.5-35bqwen3.5-35bggufhugging-faceunsloth

💡Qwen3.5-35B 量化的詳細 KLD/速度基準—選最適合你的 GPU(最高 143 t/s)(62字元)

⚡ 30-Second TL;DR

有什麼變化

KLD 在混合 FLORES 200 + calibration_data_v5_rc.txt 資料集上測量

為什麼重要

幫助 GPU 資源有限的使用者選擇最佳 Qwen3.5-35B 量化版本,平衡品質與速度。強調本地推論中的量化權衡。

下一步行動

從 Hugging Face 下載頂級 KLD 量化如 unsloth_UD-Q4_K_XL,並在你的 RTX 設定上基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • KLD 在混合 FLORES 200 + calibration_data_v5_rc.txt 資料集上測量
  • 頂級量化:unsloth_UD-Q4_K_XL (KLD 0.016158, 122 TG/s)
  • 在 RTX 3090 + Intel CPU 上速度差異 36% (105-143 TG/s)
  • 包含舊版 Unsloth 模型的 cmp-nct 鏡像

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 5 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B 採用 Mixture-of-Experts (MoE) 架構,總參數 35B 但每 token 僅激活 3B 參數,在 MMLU 和 GSM8K 等基準測試中超越前代 Qwen3-235B 模型[1][2]
  • Qwen3.5 系列於 2026 年 2 月由 Alibaba Cloud 的 Qwen 團隊發布,包括 Flash、27B、35B-A3B 和 122B-A10B 模型,皆支援 256K+ 上下文視窗及原生多模態能力[1][5]
  • Q4 量化後 Qwen3.5-35B-A3B VRAM 需求約 12-15GB 或 18GB,可單一 RTX 3090/4090 運行,並高度相容 LoRA/QLoRA 微調[1][2]
  • 在 llama.cpp + openclaw 上 DGX Spark (GB10) 運行 Qwen3.5-35B-A3B 可達 43 tok/s 生成與 63 tok/s 預填充速度[4]
  • Qwen3.5-27B 作為密集模型在生產部署中表現優異,適合 VRAM 充足的本地環境[3]
📊 競品分析▸ Show
模型類型總參數激活參數上下文視窗關鍵優勢
Qwen3.5-FlashAPI~35B~3B256K速度/成本
Qwen3.5-27B密集27B27B256K微調穩定性
Qwen3.5-35B-A3BMoE35B3B262K效率/智能比
Qwen3.5-122B-A10BMoE122B10B262K+深度推理/長上下文

🛠️ 技術深入

  • Qwen3.5-35B-A3B 使用 Gated Delta Network 結合稀疏 Mixture-of-Experts 層架構,實現雙重效率優化[3]
  • 支援 262K 上下文視窗,原生多模態早融合架構,優於 Qwen3-VL 在視覺理解基準[1]
  • Q4_K_M 量化 VRAM 需求 18GB (27B) 或 12-15GB (35B-A3B),相容 llama.cpp、openclaw 及 LoRA/QLoRA 微調[1][2][4]
  • 提示工程建議使用系統指令定義角色,以激活 MoE 模型的正確專家路由[2]
  • 全量化模型磁碟大小約 37GB,在 GB10 上支援工具呼叫、串流及 [think] 關鍵字切換推理模式[3][4]

🔮 前景展望AI analysis grounded in cited sources

MoE 效率將主導 35B 級本地部署
Qwen3.5-35B-A3B 以 3B 激活參數超越 235B 密集模型,證明 MoE 在單 GPU 環境的計算優勢[1][2]
Qwen3.5 GGUF 量化將加速開源本地 AI 採用
RTX 3090 上 143 TG/s 速度及低 VRAM 需求,使高性能多模態模型普及至消費級硬體[1][4]
Alibaba Qwen 將挑戰西方 LLM 霸權
Qwen3.5 系列在 2026 年初即達領先基準,結合開源策略快速累積社群支持[5]

時間線

2026-02
Qwen3.5 系列發布,包括 35B-A3B MoE 模型
2026-02-16
Qwen3.5-35B-A3B、27B 等模型正式開源至 Hugging Face
2026-03
社群發布 Qwen3.5-35B GGUF 量化基準測試(RTX 3090)

📎 來源 (5)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. curateclick.com — 2026 Qwen35 Models Guide
  2. explore.n1n.ai — Qwen3 5 Model Series 2026 Guide 2026 02 25
  3. youtube.com — Watch
  4. forums.developer.nvidia.com — 362000
  5. GitHub — Qwen3
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。