Llama.cpp 整合 Turboquant、H2O 和 StreamingLLM
開發者 peva3 在 llama.cpp 中加入 Turboquant、Heavy-Hitter Oracle (H2O) 和 StreamingLLM,大幅提升效能。在 16GB 4060ti GPU 上,使用 Qwen 3.5 4B 模型可達 256k+ 上下文的全速生成。CPU 和 CUDA 版本已完整可用,GitHub 上有詳細文件。
Tag: #quantization201 results
開發者 peva3 在 llama.cpp 中加入 Turboquant、Heavy-Hitter Oracle (H2O) 和 StreamingLLM,大幅提升效能。在 16GB 4060ti GPU 上,使用 Qwen 3.5 4B 模型可達 256k+ 上下文的全速生成。CPU 和 CUDA 版本已完整可用,GitHub 上有詳細文件。
AIfred Intelligence 在審判多代理模式下,對9款模型(80B-235B)進行「狗 vs 貓」辯論基準測試。Qwen3-Next-80B-A3B 僅3B活躍參數,即匹配235B品質且速度快3倍。硬體使用4張GPU共120GB VRAM搭配llama.cpp。
PentaNet 是一種新 LLM 架構,使用原生五元 {-2,-1,0,1,2} 量化,在 WikiText-103 上比 BitNet 改善 6.4% 困惑度,同時透過位元移位保留零乘法推理。權重分佈穩定而不崩潰為三元,提供更多模型容量。程式碼、PyTorch 層與模型已在 GitHub 和 HuggingFace 開源。

研究人員使用 Google 的 TurboQuant 壓縮方法修補 llama.cpp,在基礎 M4 MacBook Air (16GB) 上運行 Qwen 3.5-9B,支援 20k 令牌上下文。這使得在 Mac Mini 等平價硬體上進行大上下文推論成為可能。MacOS 開源應用程式可在 atomic.chat 下載。
標準 LoRA 縮放在 FP8 E4M3 硬體上溢位凍結適配器,造成 68% 品質損失。新 b-bit 浮點縮放方法將損失降至 5.2%,過擬合降 33 倍。在 A100、H200 和 B300 上驗證,詳見 koscak.ai。
TurboQuant 將演算法適應至 LLM 權重壓縮,提供 nn.Linear 即插即用替代方案,具近最佳 4 位元量化與無損 8 位元殘差。在 Qwen3.5-0.8B 上基準測試顯示 8 位元總計 PPL 零增加與 3.2 倍記憶體縮減。GitHub 提供完整文件、基準與 Triton 核心。

Google發表TurboQuant,將LLM記憶體消耗減至6分之1,同時維持精度。結合PolarQuant與QJL,將KV快取壓縮至3位元。在NVIDIA H100上計算速度最高提升8倍,適用Gemini等模型。
使用者各花費 10K 美元購買 Dual DGX Sparks 和 Mac Studio M3 Ultra 512GB,在本地運行 Qwen3.5 397B 以取代 API 費用。Mac Studio 憑高頻寬達 30-40 tok/s 但預填充慢;Sparks 預填充更快且有 CUDA 生態,達 27-28 tok/s 但設定複雜。兩者皆保留,用 Mac 推理、Sparks 處理 RAG。

基準測試顯示 Google 的 TurboQuant 整合至 llama.cpp,在 Apple Silicon 的 Metal 上實現顯著 KV 快取節省。使用者回報在低 VRAM 裝置上可支援更大上下文,並有 MLX 和 VLLM 的 PR。此進展提升本地模型能力,而不取代 RAG。

RotorQuant 利用 Clifford 轉子進行向量量化,比 TurboQuant 快 10-19 倍,參數僅 1/44。它在 Qwen2.5-3B KV 快取上餘弦相似度近乎相同(0.990),並在融合 CUDA/Metal 核心中表現出色。程式碼與論文現已開放。