TurboQuant Pro:嵌入向量壓縮5-42倍
TurboQuant Pro 是一個開源工具包,可將高維向量壓縮 5-42 倍,同時保留 0.95+ 餘弦相似度。它在 240 萬個真實 BGE-M3 嵌入向量上基準測試 6 種方法,並與 pgvector/FAISS 整合。MIT 授權,透過 pip 安裝,用於 RAG、KV 快取和向量資料庫。
Tag: #quantization201 results
TurboQuant Pro 是一個開源工具包,可將高維向量壓縮 5-42 倍,同時保留 0.95+ 餘弦相似度。它在 240 萬個真實 BGE-M3 嵌入向量上基準測試 6 種方法,並與 pgvector/FAISS 整合。MIT 授權,透過 pip 安裝,用於 RAG、KV 快取和向量資料庫。

EXAONE 4.5-33B 以多種格式發布,包括 FP8 和 GGUF 以利高效推理。LGAI-EXAONE 的 Hugging Face 儲存庫立即可用。針對本地部署和量化用戶。

PyTorch 部落格宣布在 NVIDIA Blackwell GPU 上使用 MXFP8 和 NVFP4 格式,搭配 Diffusers 和 TorchAO 優化擴散模型。這些功能實現超逼真影像與影片生成,同時解決記憶體與運算限制。此更新促進擴散模型在 AI 工作流程中的採用。
Hugging Face 將 Safetensors 移交 PyTorch 基金會,由 Linux Foundation 中立治理。用戶無立即變動;著重生態優化如裝置感知載入與量化。部落格詳述路線圖合作。
Unsloth 發布更新版 Gemma 4 GGUF 模型(2B 和 27B),回應 llama.cpp 最新拉取請求。關鍵修復包括異質 iSWA 的 KV-cache、CUDA 緩衝區重疊檢查,以及 Gemma 4 專屬 tokenizer 和 parser 改進。提供 Hugging Face 儲存庫連結。
Gemma 4 26b A3B 在 RTX 3090 上使用 unsloth q3k_m 量化達到 80-110 令牌/秒且工具呼叫完美。透過 Ollama CPP 與 flash attention 處理 260k 上下文。代理編碼品質媲美 Claude Sonnet,並優於 Perplexity 搜尋。

1-bit Bonsai 是一款具備80億參數的輕量化LLM,經優化僅需1.15GB即可在智慧手機上運行。透過創新的訓練方法,它宣稱達到與現有8B級模型相當的生產級效能。此模型已在AI社群引起廣泛關注。
TurboQuant KV 快取量化在 llama.cpp 的 Gemma 4 26B 上表現優異,於 M4 Pro 達 q4_0 品質、~3.1 bits/K 且長上下文加速 34%。逐層異常值感知 K 量化於較低位元率下勝過 Qwen PPL 公開分支。
推薦 Gemma 4 26B A4B MoE 的 unsloth UD-IQ4_XS 量化版適用 16GB VRAM,調校參數優化編碼與視覺。勝過 Qwen 3.5 27B 在速度、多語系、SysOps 及真實編碼;容納 30K+ 權杖。
Gemma-4-31B 以 NVFP4 量化在單張 RTX Pro 6000 GPU 的基準測試顯示,一用戶 64K 上下文生成速度達 44.5 tok/s。KV 快取使用 FP8 精準度以適應 32GB 模型大小。測試顯示解碼速度與 Qwen3.5 相當,但預填充較慢,建議多用戶長上下文使用快取。