
Gemma 4 31B 推測解碼平均加速 29%
使用 Gemma 4 E2B 草稿模型的推測解碼,讓 Gemma 4 31B 推理速度平均提升 29%,程式碼生成達 50%。關鍵問題是 GGUF 元數據不匹配導致權重翻譯開銷。結構化任務如數學和程式碼有高接受率。
Tag: #gguf30 results

使用 Gemma 4 E2B 草稿模型的推測解碼,讓 Gemma 4 31B 推理速度平均提升 29%,程式碼生成達 50%。關鍵問題是 GGUF 元數據不匹配導致權重翻譯開銷。結構化任務如數學和程式碼有高接受率。
ZINC 是用 Zig 撰寫的新 LLM 推理引擎,可在 $550 AMD GPU 上運行 35B 模型,透過 Vulkan。它載入 GGUF 模型,在 RDNA4 上達 7.1 tok/s,解決 AMD 消費級 GPU 缺口。儲存庫:github.com/zolotukhin/zinc。

對 Qwen3.5-27B GGUF 檔案的 Q4 量化進行全面比較,使用自訂聊天與 Wikitext2 數據集對 BF16 基線的 KLD。unsloth_Qwen3.5-27B-UD-Q4_K_XL 以最低 KLD 0.005087 領先。IQ4_XS 變體在 VRAM-大小平衡上效率最佳。
Qwen3.5-4B 模型的新無審查版本以 GGUF 格式發布,在 465 次測試中零拒絕。保留完整能力,支持多模態輸入,提供從 2.6GB 到 7.9GB 的各種量化版本。更大 Qwen3.5 尺寸的無審查版本正在開發中。
mradermacher 上傳 Qwen3.5-122B-A10B-heretic GGUF 至 Hugging Face,移除拒絕機制以無限制使用。在 Reddit 分享給本地執行者參考。非上傳者原創。

Unsloth 在 Hugging Face 發布 Qwen3.5-9B-GGUF,這是一款 9B 因果語言模型帶視覺編碼器。具備 Gated DeltaNet 等先進架構,並支援高達 100 萬 token 上下文長度。以多步驟 MTP 進行預訓練與後訓練。

一名開發者展示 LFM2.5-2.6B 僅使用 OnePlus 13 的 CPU 執行,速度約為每秒 17 個 token。該配置使用 Q4_K_M GGUF 模型、自製的 450 KB 推理引擎,以及基於 ADB 的裝置探測工具,目標速度約為每秒 30 個 token。
開發者分享了從零開始訓練 216M 參數小型語言模型的經驗,強調了分詞器 (Tokenizer) 品質對模型效能的影響遠大於架構調整。文中詳細說明了 GGUF 導出過程中的技術挑戰以及數據集組成對對話能力的影響。
用戶分享了 Qwen 3.6 27B 模型的 AutoRound GGUF 量化版本,並強調其在程式編寫任務中的高效表現。該貼文邀請社群針對此模型與其他量化方法的效能進行反饋。
單張 RTX 3090 Ti 上運行 Qwen3.5/3.6 模型,使用 llama.cpp 的 NextN MTP 推測解碼,MoE 模型達 ~150 tok/s。需 cherry-pick 開放 PR #22400 和 #22673;包含建置指示和推薦 GGUF 量化檔。