🦙較早收集於 21h

Qwen3.5-35B-A3B RTX 5080 基準測試更新

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#benchmarks#moe#kv-cacheqwen3.5-35b-a3bqwen3.5-35b-a3brtx-5080llama.cpp

💡證實 KV q8_0 在 RTX 5080 上為 Qwen MoE 免費加速—立即測試達 74 tok/s。

⚡ 30-Second TL;DR

有什麼變化

KV q8_0 確認為「免費午餐」,PPL 變化 <0.4%

為什麼重要

優化消費級 GPU 上 MoE 模型的本地推理,讓 AI 開發者運行大型模型時加速而不犧牲品質。

下一步行動

在你的 Qwen3.5-35B-A3B 上執行 llama.cpp 搭配 -ctk q8_0 -ctv q8_0,提升吞吐量 12-38%。

誰應關注:Developers & AI Engineers

關鍵要點

  • KV q8_0 確認為「免費午餐」,PPL 變化 <0.4%
  • Q4_K_M 在 PPL 和 KLD 指標中為最佳量化
  • --fit 不加 batch 旗標達 74.7 tok/s (+7%)
  • UD-Q4_K_XL KLD 比 Q4_K_M 差 3.9 倍
  • 在 RTX 5080 16GB 上使用 llama.cpp CUDA 12.8 測試

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B 於 2026 年 2 月 24 日由 Alibaba 的 Qwen 團隊發布,總參數 35B、激活 3B,支持 262,144 tokens 上下文長度。[1][2][6]
  • 模型採用混合架構,整合線性注意力機制與稀疏混合專家 (MoE,256 專家、8 路由 +1 共享),提升推理效率,效能媲美 Qwen3.5-27B。[1][2]
  • 基準測試顯示 GPQA 84.5%、HLE 19.7%、SciCode 37.7%,支援文字、圖像、影片輸入,並具工具使用與推理能力。[2]

🛠️ 技術深入

  • 架構細節:32.5B 參數、64 層 Transformer,使用 RoPE 位置編碼、SwiGLU 激活、RMSNorm 規範化、注意力機制。[5]
  • MoE 配置:256 總專家、每次激活 8 路由專家 + 1 共享專家,結合 Gated Delta Networks 實現高效推理。[1]
  • 多模態能力:統一視覺語言基礎,早融合訓練支援跨模態 token,涵蓋推理、編碼、代理與視覺理解。[1][7]
  • 支援功能:啟用思考模式 (Enable Thinking),強化學習擴展至百萬代理環境,支援 201 語言與方言。[1]

🔮 前景展望AI analysis grounded in cited sources

Qwen3.5-35B-A3B 將推動本地端 MoE 模型普及
其高效混合架構與量化支援(如 GGUF)使 35B 模型在 RTX 5080 等消費級硬體上實現高吞吐,降低部署門檻。[4]
多模態 MoE 模型將超越傳統密集模型規模
35B-A3B 超越 6 倍大小前代模型,強調架構、資料與 RL 優化勝過純參數擴張。[1][4]

時間線

2026-02-24
Qwen3.5-35B-A3B 正式發布,包含 MoE 系列模型
2026-02-25
模型上架 Writingmate 等平台,提供 API 存取
2026-02-28
Reddit r/LocalLLaMA 發布 RTX 5080 量化基準測試
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。