
Gemma 4 31B 對 Qwen 3.5 27B:長上下文最佳者?
使用者於 RTX 3090 Ti 基準測試 Gemma 4 31B 及 Qwen 3.5 27B,長達 70-100K 上下文。Qwen 勝於速度、引用及長輸出;Gemma 幻覺較少但較慢,直至 Unsloth 優化。兩者為 24GB VRAM 本地 SOTA。
Tag: #quantization201 results

使用者於 RTX 3090 Ti 基準測試 Gemma 4 31B 及 Qwen 3.5 27B,長達 70-100K 上下文。Qwen 勝於速度、引用及長輸出;Gemma 幻覺較少但較慢,直至 Unsloth 優化。兩者為 24GB VRAM 本地 SOTA。
HNSW 儲存 3-bit 量化嵌入(每個節點 ~388B 對比 float32 4KB),使用 PolarQuant 旋轉與 Lloyd-Max。預算表實現快速查表遍歷;精確距離重新排序。達 >85% recall@10,程式碼在 GitHub。

社群成員從 .litertlm 提取 Gemma 4 模型權重,轉為多個 INT8 量化 .tflite 檔案。尋求 C++ 專家使用 Google AI Edge Model Explorer 等工具逆向轉為 PyTorch nn.Module。Hugging Face 儲存庫提供檔案、步驟及 graphdef JSON。
PR #21534 合併解決 llama.cpp 中所有已知 Gemma 4 問題。執行提示包括使用交錯聊天模板、--cache-ram 2048,以及 Q5 K/Q4 V 快取。從 master 建置,避免 CUDA 13.2。

GGML 引入 Q1_0 1 位元量化支援 CPU 推論。Bonsai 8B 模型壓縮至 1.15GB,完全可在 CPU 運行。HF 收藏:prism-ml/bonsai。
使用者可透過 Q8_0 mmproj 取代 F16 處理 Gemma 4 26B 的視覺功能,獲得額外 30K 上下文,無品質損失且測試中略有提升。這能以 FP16 快取實現 60K+ 總上下文並保留視覺功能。最近回歸問題的修復即將推出。

在 Intel Lunar Lake iGPU 上對 Qwen3.5-4B GGUF 量化版本進行詳細基準測試,比較 tk/s、KLD 散度、大小與效率。Unsloth 與 Bartowski 量化 KLD 低於 0.01 領先。有助邊緣硬體本地推理的最佳選擇。
記憶體晶片市場因 TurboQuant(推理用 KV cache 壓縮論文)在 48 小時內蒸發數百億。此技術不影響訓練記憶體(如激活、梯度、優化器狀態),後者佔 HBM 需求大宗。機器學習社群立即看出市場過度恐慌,商用推理已用 4-8 位元精度。

使用者實現 397B 模型 35% REAP 壓縮。在 96GB GPU 上運行具潛在可用品質。貼文連結 r/LocalLLaMA 細節。

快速測試比較 unsloth 的 Gemma4-31B 和 Qwen3.5-27B Q4 量化版。Gemma 4 在創意寫作、冷門語言翻譯、函數呼叫、編碼及 SVG 創作表現出色。徵詢 Qwen3.5 勝出的領域。