尋求 TurboQuant 實作經驗
Reddit 貼文詢問 Google TurboQuant 論文的實作情況。論文聲稱 6 倍 KV 快取壓縮且零精度損失,在 H100 上最高 8 倍注意力加速。於 ICLR 2026 發表,尋求超出基準的真實世界收益。
Tag: #quantization201 results
Reddit 貼文詢問 Google TurboQuant 論文的實作情況。論文聲稱 6 倍 KV 快取壓縮且零精度損失,在 H100 上最高 8 倍注意力加速。於 ICLR 2026 發表,尋求超出基準的真實世界收益。

oQ推出適用Apple Silicon的資料驅動混合精度量化,與mlx-lm相容,透過校準資料優化每層位元分配。在Qwen3.5-35B基準測試顯示優異表現,如2-bit oQ達64% MMLU,對比mlx-lm的14%。輸出適用LM Studio等多種推理伺服器。

Qwen3.5-27B 在 Aider 基準測試中比較 BF16/FP8 權重與 KV 快取,10 次運行無統計顯著差異。平均任務使用 13k 權杖。FP8 在代理編碼中與 BF16 表現相當,無明顯損失。

Reddit 用戶在嚴苛自訂基準測試中檢驗新 Nemotron 3 4B Q8,包括數學證明、模運算求和及 JSON 結構化輸出。Qwen 3.5 4B 完美通過所有任務,而 Nemotron 儘管承諾更大上下文,卻嚴重失敗。詳細提示與失敗案例凸顯推理缺陷。
基準測試比較 Hugging Face 上 Qwen3.5-35B GGUF 量化版本(16-22 GiB)的 KLD 差異和速度。使用多語言 FLORES 200 和校準資料集。表格依 KLD 平均值和 99% 排名,在 RTX 3090 上 TG/s 最高達 143。

PocketBot 是一款完全本機的 iPhone AI 代理,將英文轉換為手機自動化,使用 llama.cpp on Metal 執行量化 3B 模型。團隊尋求社群建議:更好 sub-4B 模型用於工具呼叫、最佳量化如 Q4_K_M vs Q5_K_S、動態取樣及脈絡管理。Beta 已於 TestFlight 上線。
新方法使用代碼簿打包 FP16 中獨特權重(12-13 位元),實現 LLM 10-25% RAM 減少。以大小換取推理速度,在 P2200 GPU 和 CPU 測試。GitHub POC 包含損失/平衡模式;測量模型緊湊度。

llama.cpp 第 8294 版在具 Apple A18 Pro 晶片與 8GB RAM 的 500 美元 MacBook Neo 上運行 Qwen3.5-9B Q3_K_M,提示速度達 7.8 個令牌/秒,生成功率 3.9 個令牌/秒。基準測試顯示 9B 模型可達 5 t/s,4B 模型達 10 t/s 配置。使用 Metal GPU 加速與特定超參數。

Sabomako在Hugging Face發佈Qwen3.5-122B-A10B-heretic的GGUF版本。實現巨型模型的高效本地推理。在r/LocalLLaMA社群分享。