Spiral 推出 INT3 Qwen 7B Mac 版
獨立創辦人推出 Spiral,使用 INT3 模型壓縮(+0.14 nats)和 2-bit KV 快取,搭配 Apple M 系列的自訂融合 Metal 核心。Qwen 7B 預覽版可透過 brew 安裝。未來將支援 Triton GPU 核心並推出更多 100B 以下模型。
Tag: #quantization201 results
獨立創辦人推出 Spiral,使用 INT3 模型壓縮(+0.14 nats)和 2-bit KV 快取,搭配 Apple M 系列的自訂融合 Metal 核心。Qwen 7B 預覽版可透過 brew 安裝。未來將支援 Triton GPU 核心並推出更多 100B 以下模型。
個人評測比較 Gemma 4 26B MoE 以 Q8 量化、Qwen 3.5 27B 密集模型及 Gemma 4 31B 密集模型在程式碼代理任務上的表現。Qwen 3.5 27B 及 Gemma 4 31B 皆修復 100% 測試且無回歸,優於其他模型。詳細指標涵蓋修復數、令牌、工具呼叫及效率。

PrismML 推出 Ternary Bonsai,一款以極低 1.58 位元/參數實現頂級智能的模型。此三元量化方法推動 AI 模型效率邊界。
使用 24GB VRAM 和 128GB RAM 及 llama.cpp,在 MMLU 資料集基準測試多款 GGUF 量化模型。Qwen3.5-27B 系列以 87%+ 領先。分享結果徵求社群回饋。

輕量 290MB 的 1-bit 量化 Bonsai 1.7B 模型現可在網頁瀏覽器中使用 WebGPU 完全本地運行。Demo 由 webml-community 在 Hugging Face Spaces 上架設。這實現了無伺服器依賴的輕量 LLM 推論。

Unsloth 調查 MiniMax-M2.7 GGUF 量化中 21-38% 的 NaN,歸因於 llama.cpp 特定區塊溢位。修復其 UD-Q4_K_S 等量化於 unsloth/MiniMax-M2.7-GGUF。基準確認良好 PPL/KLD;註記 CUDA 13.2 問題。

DFlash 推測解碼的原生 MLX 實作,在 M5 Max 上為 Qwen3.5-9B 帶來 3.3 倍加速。基準測試顯示各模型大小與量化皆有顯著提升。開發者分享優化技巧與未來計畫,包括開源。

MiniMax 的 Yuan 宣布 M2.7 開放權重將於今日或明日發布。社群興奮,因其與 2.5 同參數,量化版本適合本地運行。盼無延遲,或成最佳本地模型。
在 BGE-M3 嵌入上,先施加 PCA 再截斷,能保留近乎完美的餘弦相似度,不像單純截斷。結合 3-bit 量化,達到 27.7 倍壓縮並有強勁表現。尋求基線、指標及適用性的回饋。
turboquant-pro 推出 autotune CLI,從 PostgreSQL/pgvector 取樣嵌入向量,測試 12 種壓縮配置,在約 10 秒內依最小召回率推薦最佳方案。在 194K 生產嵌入上達 20.9 倍壓縮、96% 召回率,將 758MB 縮至 36MB。僅需 CPU、無需訓練,使用 PCA-Matryoshka + TurboQuant。