
RTX GPU 後訓練量化使用 Model Optimizer
模型量化可減少 NVIDIA GeForce RTX GPU 的 VRAM 使用並提升推論效能。它降低運算與記憶體需求同時保留模型品質。NVIDIA Model Optimizer 簡化後訓練量化流程。
Tag: #quantization201 results

模型量化可減少 NVIDIA GeForce RTX GPU 的 VRAM 使用並提升推論效能。它降低運算與記憶體需求同時保留模型品質。NVIDIA Model Optimizer 簡化後訓練量化流程。

ParoQuant 提出配對旋轉量化技術,用於 LLM 高效推理,降低量化誤差。專案包含 GitHub 儲存庫、z-lab.ai 頁面及 HuggingFace 模型集合。目標提升推論速度與準確度。

使用者以自訂國際象棋 PGN 轉 SVG 任務基準測試 Qwen 3.6 27B 從 BF16 到 IQ3_XXS 的量化版本,以找出適合 16GB VRAM 的最佳選擇。高量化如 Q6_K 在棋盤狀態追蹤及 SVG 渲染表現出色;Gemma 4 和 Qwen 3.5 等其他模型大多失敗。測試使用 llama.cpp 固定取樣參數。
Hipfire是專為所有AMD GPU設計的新推理引擎,採用mq4量化。創作者在Hugging Face分享量化模型。Localmaxxing基準測試顯示RDNA3及舊卡大幅加速。
使用者在 5090 筆電(24GB VRAM)測試 Qwen 3.6 27B,通過工具呼叫及 pyspark/python 資料科學基準。計畫取消雲端訂閱。在 llama.cpp q4 量化下高效運行。

基準測試顯示 Qwen3.6 UD_Q_4_K_M 在 16GB VRAM + 32GB RAM 上以 50+ 令牌/秒運行,支援 200k 上下文視窗。由 ik_llama 推理驅動。於 r/LocalLLaMA 分享。
使用者在 MBP M5 Max 128GB 上透過 OpenCode 運行 8-bit 量化的 Qwen3.6-35B-A3B,具 64k 上下文,效能媲美 Claude。適合工具呼叫及長研究任務,如偵錯 Android 序列化問題。取代如 Kimi k2.5 等雲端模型成為日常主力。
用戶表示 Qwen3.6-35B-A3B 在預算應用程式的複雜編碼問題上表現出色,這些問題曾難倒 Qwen3.5-27B 和更大模型。它能有效重構程式碼、識別低效之處,並使用子代理處理安全審核,維持在 128k 上下文內。在 RTX 5070 Ti 上運行順暢,處理速度達 320t/s。

Mac 專用 MiniMax M2.7 量化版在 200q MMLU 達 88% (63GB) 及 95% (89GB)。M5 Max 上高效 ~50 tokens/s 及 400pp。定位為「家用 Sonnet 4.5」水準。

教學讓Qwen3.5-397B-A13B經vLLM在8x AMD R9700 GPU上運行,使用MXFP4量化。單請求達30 t/s,批次高達100 t/s。包含Dockerfile修補與啟動腳本以達高吞吐。