
Qwen3.8-27B 在本地打造 Mario 遊戲
一名 Reddit 使用者表示,在本地執行的 Qwen3.8-27B 一次生成了 Super Mario 複製版遊戲。Q8 GGUF 版本在 Framework Desktop 上執行速度較慢,但被認為適合隔夜批次處理與背景程式設計工作。
Tag: #quantization201 results

一名 Reddit 使用者表示,在本地執行的 Qwen3.8-27B 一次生成了 Super Mario 複製版遊戲。Q8 GGUF 版本在 Framework Desktop 上執行速度較慢,但被認為適合隔夜批次處理與背景程式設計工作。

一個開發中的 llama.cpp PR 為 Q2_0 × Q8_0 點積加入 AVX-VNNI 與 AVX-512 VNNI 實作。受控基準測試顯示 CPU 吞吐量提升約 3 至 3.6 倍,其中 8B 解碼速度由每秒 2.39 個 token 提升至 8.20 個。

Ling-3.0-flash 的 MXFP4 版本已發布,據報可在單台 NVIDIA DGX Spark 上本機運行。據稱解碼速度約為每秒 80 tokens,長輸入預填充速度為每秒 2,500–3,500 tokens,並可支援 3 至 4 名同時使用者。

這項研究介紹了一種能為大型語言模型實現統計無損性能的新型量化方法。該技術旨在降低記憶體佔用與計算需求,同時不犧牲模型的準確性。
ExTernD 引入了一種創新的訓練後量化 (PTQ) 方法,將矩陣分解為兩個三元矩陣和一個對角縮放矩陣。這種方法允許任意大的內部秩,使三元 LLM 能夠達到與更高精度量化相當的準確度。
本基準測試分析了在 NVIDIA L4 GPU 上運行 Gemma 2 9B 模型時,FP8 量化對效能的影響。研究顯示,儘管 FP8 提升了解碼速度,但會產生顯著的「預填充稅」,導致首個 Token 生成時間 (TTFT) 增加。

Unsloth 發布了全新的 Cohere 30B A3B 模型 GGUF 版本,使其能夠進行本地推論。此發布可能與 llama.cpp 生態系統近期為提升模型相容性所做的更新有關。

Model Best 發布了開源框架 BitCPM-CANN,旨在協助在國產 AI 加速器上進行 1.58-bit 模型訓練。此進展顯著降低了高效能模型部署的硬體門檻。

一項評估 TurboQuant 變體的報告顯示,標準 FP8 仍然是 KV-cache 量化的最佳選擇。如 k3v4-nc 等低位元變體在長上下文任務中表現出顯著的準確度下降。
Qwen3.6 27B 的全新無審查版本「heretic v2」,保留原生 MTP 並完整保存 15 個 MTP,KLD 0.0021,僅 6/100 拒絕率。可在 HuggingFace 下載 Safetensors、GGUF、NVFP4 和 GPTQ-Int4 格式。基準測試確認所有變體效能。