Search

Tag: #quantization201 results

🤖

Muse-Glimmer-30B 挑戰 Qwen 3.6-27B

一份早期使用者評測指出,Muse-Glimmer-30B 在部分使用情境中勝過 Qwen 3.6-27B,尤其是在高效率推理、無工具常識問答與 OpenCode 代理工作流程方面。評測者表示該模型量化表現良好,但在多數程式設計任務上較弱。

Reddit r/LocalLLaMACommunityAug 11#quantization#agentic-coding#local-gpu
Kimi K3 在雙叢集上本地運行

Kimi K3 在雙叢集上本地運行

一名 LocalLLaMA 使用者分享了首次本地執行 Kimi K3 的經驗,透過 llama.cpp 的 RPC 橫跨兩個 GPU 叢集運行。目前配置依賴部分卸載與 IQ1_M 量化,後續計畫整合 GPU 並升級至 Q2_K_XL,以改善速度與品質。

Reddit r/LocalLLaMACommunityAug 8#quantization#rpc#gpu-cluster
🤖

Mac Studio 本地模型配置 - 2026年5月

Reddit 使用者分享在 Mac Studio 上運行 LLM 的實務經驗,讚揚 GLM 5.1 適合 6/10 級以下編碼,Kimi K2.6 速度快但記憶體需求高,Qwen 3.5 9B 適合高效多模態任務。指出 Gemma 4 31B 支援問題,並期待 Deepseek/Mimo 整合。關注 Exo、tinygrad 及新型量化格式等未來工具。

Reddit r/LocalLLaMACommunityMay 7#local-inference#apple-silicon#quantization
🔬

INT8 精度勝過 FP16

深度學習從業人員觀察到 ONNX 導出模型上,INT8 訓練後量化推理精度高於 FP16,超出相對於 FP32 基準的預期。尋求此異常解釋。

Reddit r/MachineLearningCommunityApr 27#quantization#int8#fp16
Page 16 of 21