Search

Tag: #quantization201 results

Qwen3.5-9B GGUF 量化 KLD 排名

Qwen3.5-9B GGUF 量化 KLD 排名

Qwen3.5-9B 的 46 種 GGUF 量化全面比較,使用 KLD 與 PPL 對 BF16 基準。頂級選擇:bartowski IQ4_XS (VRAM 受限最低 KLD)、Q4_K_S,以及 unsloth UD-Q3_K_XL 效率最佳。揭示 bartowski 與 unsloth Q4_K_M 等量化器差異。

Reddit r/LocalLLaMACommunityMar 11#quantization#kld#ppl
TorchAO 擴展邊緣 LLM 的 QAT

TorchAO 擴展邊緣 LLM 的 QAT

TorchAO 已擴展針對使用 ExecuTorch 的邊緣設備的大型語言模型的量化感知訓練 (QAT) 流程。這建立在前一篇部落格介紹的初始 QAT 基礎上。此更新提升了資源受限環境下的模型最佳化。

PyTorch BlogMediaMar 4#quantization#qat#edge-deployment
Qwen3.5-27B Q4 量化排名比較

Qwen3.5-27B Q4 量化排名比較

對 Qwen3.5-27B GGUF 檔案的 Q4 量化進行全面比較,使用自訂聊天與 Wikitext2 數據集對 BF16 基線的 KLD。unsloth_Qwen3.5-27B-UD-Q4_K_XL 以最低 KLD 0.005087 領先。IQ4_XS 變體在 VRAM-大小平衡上效率最佳。

Reddit r/LocalLLaMACommunityMar 3#quantization#gguf#kld-benchmark
Page 9 of 21