🦙Reddit r/LocalLLaMA•較早收集於 43m
Qwen3.5-27B FP8 效能媲美 BF16

#quantization#kv-cache#benchmarkqwen3.5-27bqwen3.5-27bvllmaider
💡Qwen3.5-27B FP8 量化不損效能即倍增上下文—立即測試本地執行(32字元)
⚡ 30-Second TL;DR
有什麼變化
在 RTX 6000 Pro 上使用 Aider 基準測試
為什麼重要
這驗證了低精度量化適用於生產推理,減少記憶體使用並提升本地 LLM 部署的上下文容量,無品質損失。
下一步行動
在 vLLM 中將 Qwen3.5-27B 量化為 FP8 並啟用 8 位元 KV 快取,以獲得更長上下文。
誰應關注:Developers & AI Engineers
關鍵要點
- •在 RTX 6000 Pro 上使用 Aider 基準測試
- •FP8 權重 + 8 位元 KV 快取結果與 BF16/16 位元相同
- •在相同硬體上大幅增加上下文
- •細微差異來自單次執行隨機噪聲
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •Qwen3.5-27B 的 FP8 量化在 MMLU-Pro、SWE-bench Verified 和 MMMU 等關鍵基準測試中的表現與更大的模型(如 235B Qwen3 和 GPT-5-mini)相當或超越[1]
- •量化研究表明,即使在激進的 4 位元量化下,Qwen3.5-32B 在 MMLU-Pro 上仍保留 98.1% 的基線推理能力,而從 BF16 到 Int8 的精度下降僅為 0.04%[3]
- •FP8 量化相比 BF16 能將模型權重從 61GB 減少至約 18GB,在相同硬體上將並發使用者容量從 4 人增加至 47 人,或將每位使用者的對話長度延長 12 倍[3]
- •Qwen3.5-27B 在 H100 SXM GPU 上的吞吐量達 312 tokens/s,在 RTX Pro 6000 Blackwell 上達 102 tokens/s,支援 201 種語言和工具調用功能[1]
📊 競品分析▸ Show
| 特性 | Qwen3.5-27B (FP8) | Qwen3.5-35B-A3B | GPT-5-mini | Qwen3 Max |
|---|---|---|---|---|
| 參數量 | 27B | 35B | 未公開 | 未公開 |
| MMLU-Pro 分數 | 86.1 | 未提供 | 相當或更低 | 未提供 |
| H100 吞吐量 | 312 tok/s | 更快 | 未提供 | 未提供 |
| 量化格式 | FP8 | A3B | 未公開 | 未公開 |
| 上下文長度支援 | 最高 256K | 最高 256K | 未提供 | 未提供 |
🛠️ 技術深入
- 架構設計:Qwen3.5-27B 採用 Gated Delta Network + Gated Attention 混合佈局,64 層設計,隱藏維度 5120[1]
- 量化方案:官方 INT4 量化特別強大,因為注意力層保持未量化狀態,性能與原始模型相當[7]
- 記憶體優化:FP8 量化將模型權重從 61GB 減少至約 18GB,為 KV 快取釋放 47.3GB 空間,支援 4096 tokens 上下文長度下 47 個並發使用者[3]
- 推理效能:在 RTX Pro 6000 Blackwell 上,32K 上下文的聊天機器人應用可支援 3 個並發使用者;在 H100 SXM 上可支援 6 個使用者[1]
- 多模態能力:支援圖像-文本-文本多模態推理,MMMU 基準分數達 82.3[1]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2025-09
Qwen3.5 系列模型發佈,包括 27B、35B-A3B 等多個變體
2026-02
Qwen3.5-27B 的 AWQ-BF16-INT4 量化版本在 Hugging Face 上更新發佈
2026-03-15
Qwen 官方更正 Qwen3.5 系列的比較基準分數
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。