Search
Tag: #quantization201 results
Muse-Glimmer-30B 挑戰 Qwen 3.6-27B
一份早期使用者評測指出,Muse-Glimmer-30B 在部分使用情境中勝過 Qwen 3.6-27B,尤其是在高效率推理、無工具常識問答與 OpenCode 代理工作流程方面。評測者表示該模型量化表現良好,但在多數程式設計任務上較弱。

Kimi K3 在雙叢集上本地運行
一名 LocalLLaMA 使用者分享了首次本地執行 Kimi K3 的經驗,透過 llama.cpp 的 RPC 橫跨兩個 GPU 叢集運行。目前配置依賴部分卸載與 IQ1_M 量化,後續計畫整合 GPU 並升級至 Q2_K_XL,以改善速度與品質。
Gemma 4 QAT 使用舊式 Q4_0 可能降低模型保真度
一篇社群分析認為,Gemma 4 QAT 若以現代 q4_k 格式為目標,而非 q4_0,可能保留更多模型品質。作者表示,QAT 雖能降低記憶體使用量,但在程式設計、創意寫作、長上下文回憶與知識任務上,可能不如高精度的 Q4_K 變體。

Qwen3.6 27B 揭示量化造成的非線性知識損失
一項案例研究探討量化如何影響 Qwen3.6 27B 的知識保留能力。研究核心指出,隨著精度降低,模型知識劣化可能不會呈線性增加。
Mac Studio 本地模型配置 - 2026年5月
Reddit 使用者分享在 Mac Studio 上運行 LLM 的實務經驗,讚揚 GLM 5.1 適合 6/10 級以下編碼,Kimi K2.6 速度快但記憶體需求高,Qwen 3.5 9B 適合高效多模態任務。指出 Gemma 4 31B 支援問題,並期待 Deepseek/Mimo 整合。關注 Exo、tinygrad 及新型量化格式等未來工具。
Qwen3.6 量化版在 VS Code 編碼表現優異
使用者報告使用 Q5_K_XL 量化 Qwen3.6-35B-A3B 在 AMD RX 7900 上搭配 llama.cpp Vulkan 伺服器獲得優異成果。整合 VS Code Copilot 從大型提示產生完整 React 應用與 Playwright 測試。分享詳細伺服器指令、取樣參數與聊天設定。
INT8 精度勝過 FP16
深度學習從業人員觀察到 ONNX 導出模型上,INT8 訓練後量化推理精度高於 FP16,超出相對於 FP32 基準的預期。尋求此異常解釋。
Transformer 超越 FP16 ONNX 最佳化
開發者將 Transformer 轉 FP16(尺寸減半至 162MB)、用 ONNX 加速推理,但修剪/圖形最佳化獲益有限。尋求低階分解、INT8/4 量化(GPTQ/AWQ/SmoothQuant)、蒸餾、TensorRT、FlashAttention 等實務建議。
Android 提取的 Gemma 4 e4b 勝過 Unsloth
使用者透過 ADB 從 Android Google AI Edge 提取 3.6GB Gemma 4 e4b,聲稱其智慧勝過 Unsloth GGUF 及其他網路版本。litertlm 社群版有 Bug,在俄文產生不連貫文字。