🦙Reddit r/LocalLLaMA•較早收集於 21h
Qwen3.5-35B-A3B RTX 5080 基準測試更新
#quantization#benchmarks#moe#kv-cacheqwen3.5-35b-a3bqwen3.5-35b-a3brtx-5080llama.cpp
💡證實 KV q8_0 在 RTX 5080 上為 Qwen MoE 免費加速—立即測試達 74 tok/s。
⚡ 30-Second TL;DR
有什麼變化
KV q8_0 確認為「免費午餐」,PPL 變化 <0.4%
為什麼重要
優化消費級 GPU 上 MoE 模型的本地推理,讓 AI 開發者運行大型模型時加速而不犧牲品質。
下一步行動
在你的 Qwen3.5-35B-A3B 上執行 llama.cpp 搭配 -ctk q8_0 -ctv q8_0,提升吞吐量 12-38%。
誰應關注:Developers & AI Engineers
關鍵要點
- •KV q8_0 確認為「免費午餐」,PPL 變化 <0.4%
- •Q4_K_M 在 PPL 和 KLD 指標中為最佳量化
- •--fit 不加 batch 旗標達 74.7 tok/s (+7%)
- •UD-Q4_K_XL KLD 比 Q4_K_M 差 3.9 倍
- •在 RTX 5080 16GB 上使用 llama.cpp CUDA 12.8 測試
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
🛠️ 技術深入
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-02-24
Qwen3.5-35B-A3B 正式發布,包含 MoE 系列模型
2026-02-25
模型上架 Writingmate 等平台,提供 API 存取
2026-02-28
Reddit r/LocalLLaMA 發布 RTX 5080 量化基準測試
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。