Qwen 3.5 397B Q4_K_M 在 3060 上達 1.4 t/s
用戶成功在 Ryzen 5、48GB RAM、RTX 3060 12GB 和 1TB NVMe 上運行量化 Qwen 3.5 397B,達 1.4 權杖/秒。質疑本地運行 397B 模型是否值得。徵求社群意見。
Tag: #quantization201 results
用戶成功在 Ryzen 5、48GB RAM、RTX 3060 12GB 和 1TB NVMe 上運行量化 Qwen 3.5 397B,達 1.4 權杖/秒。質疑本地運行 397B 模型是否值得。徵求社群意見。
使用者回報 Unsloth GGUF 量化版本在 Qwen3.5 小型密集模型中無法啟用思考功能,不論傳入何種參數。Unsloth 文件指出 0.8B、2B、4B、9B 模型預設停用推理,可透過 --chat-template-kwargs '{"enable_thinking":true}' 啟用。Bartowski 量化版本則正常運作。
使用者基準測試 Qwen3.5 模型(2B-122B),顯示思考模式大幅提升小型模型的推理與脈絡回憶,但對 27B+ 模型無益。小型模型常在正確答案後多想;大型模型本已足夠。使用 Unsloth 在 LM Studio 測試,各種量化。
如 35B A3B 的 Qwen 3.5 模型在 llama.cpp 中需要 bf16 KV 快取以確保準確困惑度,而非預設 f16。測試顯示 bf16 PPL 為 6.5497,f16/f32 為 6.5511。vLLM 正確預設 bf16,但 llama.cpp 需要手動旗標。

Bartowski 上傳了多個 Qwen3.5 27B Imaxtrix 的新 Imatrix 量化版本。在 RTX 5060 Ti 上,IQ2_M 量化達到 450 t/s pp 和 20 t/s tg,支援 128k 上下文。此版本在除錯任務中優於其他 Q2 量化,但功耗達 170-175W。

貼文回顧 DeepSeek R1 時期進展:原 $6000 設備 5 tps,如今 $600 小型 PC 執行更優 Qwen3-27B Q4 達同速。欲更快 17-20 tps,使用 Qwen3.5-35B-A3B Q4/Q5。預測明年 4B 模型勝 Kimi 2.5。
用戶讚揚 Qwen 3.5-35B-A3B 取代 120B 模型為日常主力,體積僅 1/3。在 N8N 彙總、系統生成、視覺與程式碼分析等開發任務表現出色。以 unsloth Q4-K-XL 運行,支援 100k 上下文。

使用者在 Pi 5 16GB 上達 3+ t/s、在 8GB 上達 1.5+ t/s,使用 2-bit 量化無 SSD。計劃包含自訂 llama.cpp 建置、SSD HAT、更好散熱及 ARM KleidiAI 測試。適合代理邊緣任務。
使用者測試顯示 Qwen3 Coder Next 30B 在激進 Q2 量化下表現出色,一次生成 HTML 並自我修正,超越 Qwen 30B 與 Devstral 等其他 30B 模型,且無需大量引導。
用戶報告在 RTX 3060 12GB(有效 8GB VRAM)上以 MXFP4 運行 Qwen3 Coder Next,131k 上下文持續 23 令牌/秒。分享網頁開發配置,取代付費 Claude。需 64GB RAM;適合 SaaS 程式委託。