Search

Tag: #quantization201 results

APEX:MoE 推理加速 33% 發布

APEX:MoE 推理加速 33% 發布

全新 APEX MoE 模型量化技術,在準確度上優於 Unsloth Dynamic 2.0 且體積減半,以 Qwen3.5-35B-A3B 為基準。提供從 12GB VRAM 的 GPU 等級,兼容標準 llama.cpp,並透過 TurboQuant 提示處理加速 14%。開源,模型在 Hugging Face。

Reddit r/LocalLLaMACommunityApr 1#moe#quantization#inference-speed
ByteShape Qwen 3.5 9B 量化指南

ByteShape Qwen 3.5 9B 量化指南

ByteShape 發布 Qwen 3.5 9B 量化版本,並跨 5090/4080 等 GPU 及 CPU 基準測試。GPU 關鍵選擇:5.10 bpw 基準、4.43 bpw 平衡、3.60 bpw 快速。部落格提供互動圖表供硬體特定選擇;首波 Qwen 發布,後續更多。

Reddit r/LocalLLaMACommunityMar 31#quantization#benchmarks#qwen
PickyTrain 直接編輯 GGUF 權重

PickyTrain 直接編輯 GGUF 權重

開源 PickyTrain 工具允許無 GPU 或訓練直接外科式編輯 GGUF 模型個別權重。具語意辨識注意力頭等張量、影響警告、漂移護欄及完整回滾。Rust 核心配 Python 綁定支援常見量化;早期釋出尋求貢獻者。

Reddit r/LocalLLaMACommunityMar 30#model-editing#quantization#rust-tool
谷歌 TurboQuant 論文遭 RaBitQ 嚴重質疑

谷歌 TurboQuant 論文遭 RaBitQ 嚴重質疑

谷歌推出 TurboQuant 極端壓縮演算法,聲稱可將 AI 記憶體占用降至 1/6、推理速度提升 8 倍,解決大模型 KV Cache 瓶頸。蘇黎世聯邦理工學院中國博士後高健揚指控該論文嚴重誤傳其 RaBitQ 工作,包括未承認關鍵相似性、無證據稱其理論次優,以及不公平實驗設定——這些問題投稿前已提但未修正。論文已被 ICLR 2026 接收並獲谷歌大力推廣。

Page 6 of 21