TurboQuant 將 LLM 記憶體減 6 倍
Google 的 TurboQuant AI 壓縮演算法將 LLM 記憶體使用減 6 倍而不損輸出品質。Ars Technica 文章強調效率提升。用於家用大型模型部署的希望。
Tag: #local-inference187 results
Google 的 TurboQuant AI 壓縮演算法將 LLM 記憶體使用減 6 倍而不損輸出品質。Ars Technica 文章強調效率提升。用於家用大型模型部署的希望。

基準測試顯示 Google 的 TurboQuant 整合至 llama.cpp,在 Apple Silicon 的 Metal 上實現顯著 KV 快取節省。使用者回報在低 VRAM 裝置上可支援更大上下文,並有 MLX 和 VLLM 的 PR。此進展提升本地模型能力,而不取代 RAG。
全面 llama-bench 測試比較 RTX 5090、DGX Spark、AMD AI395 和 R9700 在 Qwen 模型上的表現。RTX 5090 在模型適合 32GB VRAM 時表現卓越,而 AMD 在大型 MoE 的統一記憶體中閃耀。ROCm 在提示處理優於 Vulkan,但 Vulkan 在生成略勝。
全新無審查 9B 模型 Omnicoder-Claude-4.6-Opus-Uncensored-GGUF,透過合併 Claude Opus 蒸餾的 Qwen 3.5 模型打造。Hugging Face 上提供 Q4_K_M 與 Q8_0 量化版本。使用加差合併方法,保留 GGUF 相容性以供本地使用。

在 GTC 大會上,NVIDIA 展示 RTX PC 與 DGX Spark 可本地運行最新開源模型與 AI 代理。這標誌著從傳統 PC 與智慧手機轉向「代理電腦」新類別。像 DGX Spark 桌面 AI 超級電腦等裝置,讓使用者體驗個人生成式 AI,特別是 OpenClaw。
Mistral-Small-4-119B-2603-GGUF 這款新的量化模型現已推出。在 Reddit 的 r/LocalLLaMA 子版塊由用戶 /u/KvAk_AKPlaysYT 發布。此版本可實現大型 Mistral 模型的高效本地推理。

Dell 推出搭載 Nvidia Grace Blackwell Ultra GB300 超級晶片的 Pro Max GB300 桌面電腦,能本地運行如 Kimi K2.5 等兆參數 AI 模型,以降低雲端成本。它為開發者提供資料安全與雲端部署前的實驗環境。此系統耗電 1600W,價格高昂,類似 97,000 美元工作站。

Nvidia 推出 DGX Station,桌面超級電腦具 748GB 一致記憶體及 20 petaflops,可本地運行萬億參數模型。基於 GB300 Grace Blackwell Ultra Superchip 及 NVLink-C2C 實現無縫 CPU-GPU 記憶體共享。針對無雲端依賴的代理式 AI 開發。
Reddit 貼文詳細說明如何在 opencode 中使用 llama.cpp 啟用 Qwen 3.5 的多模態圖像理解。使用者需在 opencode.json 檔案中新增「modalities」設定,指定文字與圖像輸入。這可讓 35B 模型在本地運行視覺功能。
ByteDance 的循環通用 Transformer Ouro-2.6B-Thinking 現已修復 modeling 程式碼錯誤,支援 transformers 4.55 正確運行。在 NVIDIA L4 上達 ~3.8 t/s,使用 5.3 GB VRAM。儲存庫:huggingface.co/scpalmetto/Ouro-2.6B-Thinking-Fixed。