🦙較早收集於 3h

Unsloth Qwen3.5 量化模型預設無思考

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡揭秘修復:Unsloth Qwen3.5 量化僅需一旗標啟用思考,利本地推理。(38字)

⚡ 30-Second TL;DR

有什麼變化

Unsloth Qwen3.5 0.8B-9B GGUF 量化預設停用推理

為什麼重要

此預設變更可能讓本地 LLM 使用者意外無法推理,但簡單旗標修復提升小型模型高效推理的自訂性。

下一步行動

載入 Unsloth Qwen3.5 GGUF 模型時加入 --chat-template-kwargs '{"enable_thinking":true}'。

誰應關注:Developers & AI Engineers

關鍵要點

  • Unsloth Qwen3.5 0.8B-9B GGUF 量化預設停用推理
  • 使用 --chat-template-kwargs '{"enable_thinking":true}' 旗標啟用思考
  • Bartowski 量化無需額外參數即可思考
  • 僅影響小型密集模型,依 Unsloth 文件

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Unsloth修復了Qwen3.5 GGUF的工具呼叫chat template問題,此問題影響所有量化上傳者和類型[2]
  • Unsloth Dynamic量化在Qwen3.5-35B上達到幾乎所有位元的最先進(SOTA)性能,透過超過150次KL散度基準測試驗證[1][2]
  • Imatrix技術顯著改善低位元量化效果,例如將ssm_out從2位元劣化降低許多,並適用於所有量化位寬[2]
  • Qwen3.5小型密集模型支援高達262,144 token的長上下文,但Unsloth GGUF文件建議至少使用2位元Dynamic量化以平衡大小與精度[3][5]

🛠️ 技術深入

  • Qwen3.5小型密集模型(0.8B-9B)採用混合架構,ffn_up_exps與ffn_gate_exps適合3位元量化,ffn_down_exps較敏感,ssm_out與attn_*張量極度敏感,避免過度低位元量化[1][2]
  • Unsloth Dynamic GGUF移除MXFP4層於Q2_K_XL、Q3_K_XL、Q4_K_XL變體,使用Imatrix加權量化過程,提升低位元KL散度表現[1][2][3]
  • 量化敏感性排序顯示ffn_*層過度量化不利,建議iq3_xxs等3位元為大小與99.9% KL散度最佳折衷[1][2]

🔮 前景展望AI analysis grounded in cited sources

Unsloth將發布所有量化版本的perplexity與KL散度數據
文件明確表示未來將公開這些基準,讓社群擁有參考依據[2]
Qwen3.5 GGUF將持續優化MoE模型如397B-A17B的單GPU效能
基準顯示24GB GPU加256GB RAM可達25+ token/秒,強調MoE離線處理潛力[3]

時間線

2026-02
Unsloth更新Qwen3.5-35B Dynamic GGUF量化至SOTA,並修復工具呼叫chat template問題
2026-01
Unsloth發布Qwen3.5 GGUF基準,涵蓋150+ KL散度測試與9TB檔案上傳
2025-12
Qwen3.5小型密集模型發布,Unsloth開始提供GGUF量化支援
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。