Search

Tag: #model-quantization9 results

⚙️

為 16GB VRAM 調校 Qwen3.8

一名 LocalLLaMA 使用者分享了在 Windows 上,於約 16GB VRAM 內執行 Qwen3.8 27B IQ4-XS-MTP GGUF 模型的配置。該設定透過將多模態元件與特定張量移至系統 RAM,以量化品質與速度換取 90K–100K 的上下文視窗。

Reddit r/LocalLLaMACommunity6h ago#16gb-vram#gguf#model-quantization