無審查 Nemotron-3-Super-120B MLX 版
開發者發布改進的無審查 4-bit MLX 版 Nemotron-3-Super-120B,修復 LatentMoE 和 Mamba 注意機制問題。包含自訂 Python 腳本和聊天模板以相容 MLX。達到 HarmBench 97% 和 HumanEval 94%;q6/q8 版本即將推出。
Tag: #quantization201 results
開發者發布改進的無審查 4-bit MLX 版 Nemotron-3-Super-120B,修復 LatentMoE 和 Mamba 注意機制問題。包含自訂 Python 腳本和聊天模板以相容 MLX。達到 HarmBench 97% 和 HumanEval 94%;q6/q8 版本即將推出。
使用者在 RTX-5090 上使用 llama.cpp,以 Qwen 3.5 27B 處理 markdown 文件達到 2000 TPS。關鍵優化包括不載入視覺模組、128k 上下文、批次大小 8,以及特定量化。此設定高效處理超過 120 萬輸入 token。

Qwen3.5-9B 的 46 種 GGUF 量化全面比較,使用 KLD 與 PPL 對 BF16 基準。頂級選擇:bartowski IQ4_XS (VRAM 受限最低 KLD)、Q4_K_S,以及 unsloth UD-Q3_K_XL 效率最佳。揭示 bartowski 與 unsloth Q4_K_M 等量化器差異。

Llama.cpp GGUF格式的真NVFP4支援即將到來,僅數小時或數天。於Blackwell GPU提供2.3倍速度提升及30-70%大小節省,並支援RAM卸載。優於有bug的vLLM。

TorchAO 已擴展針對使用 ExecuTorch 的邊緣設備的大型語言模型的量化感知訓練 (QAT) 流程。這建立在前一篇部落格介紹的初始 QAT 基礎上。此更新提升了資源受限環境下的模型最佳化。

對 Qwen3.5-27B GGUF 檔案的 Q4 量化進行全面比較,使用自訂聊天與 Wikitext2 數據集對 BF16 基線的 KLD。unsloth_Qwen3.5-27B-UD-Q4_K_XL 以最低 KLD 0.005087 領先。IQ4_XS 變體在 VRAM-大小平衡上效率最佳。
Unsloth 更新了 Qwen3.5-35B-A3B 的 GGUF 量化版本,修復工具呼叫問題。使用者讚揚其研究任務表現優異,超越 Gemini、ChatGPT 等模型,能有效總結選項並給出建議。在 ROCm 上透過 llama.cpp 運行,支援 262k 上下文。
在雙 A100 40GB GPU 上使用 VLLM 進行的基準測試顯示,Qwen3.5-35B-A3B-AWQ-4bit-FlashInfer 最快,輸出 352 tok/s,總計 1357 tok/s。Qwen3-30B 變體落後,FP8 FlashAttn 最慢。測試涵蓋 FP8/AWQ 量化及 FlashAttn/FlashInfer 注意力機制。

更新 Qwen3.5-35B-A3B Unsloth 動態量化,在幾乎所有位元達 SOTA,透過 150+ KL 散度基準。發布 9TB 研究文物,包括所有測試配置。修復影響量化上傳者的工具呼叫聊天模板錯誤。

Perplexity 推出兩款新型嵌入模型:pplx-embed-v1 和 pplx-embed-context-v1,專為大規模檢索任務優化。這些模型採用 int8 和二進位量化以提升效率。模型提供 0.6B 和 4B 參數規模版本。