🦙較早收集於 71m

無審查 Qwen3.5-4B 積極版 GGUF 發布

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#uncensored#gguf#multimodal#qwenqwen3.5-4b-uncensored-aggressiveqwen3.5-4bhuggingfacellama.cpp

💡零拒絕 4B 多模態 LLM,本地使用無能力損失。(28字)

⚡ 30-Second TL;DR

有什麼變化

4B 密集參數、32 層、混合 Gated DeltaNet 注意力機制

為什麼重要

此發布允許本地部署高效、無拒絕的小型 LLM,適合邊緣設備和注重隱私的應用。它讓先進無審查模型更容易取得,無需微調損失。

下一步行動

從 https://huggingface.co/HauhauCS/Qwen3.5-4B-Uncensored-HauhauCS-Aggressive 下載 Q4_K_M 量化版,並在 llama.cpp 中測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • 4B 密集參數、32 層、混合 Gated DeltaNet 注意力機制
  • 465 次測試零拒絕,完全無審查且無能力損失
  • 量化版本:Q4_K_M (2.6GB)、Q6_K (3.3GB)、Q8_0 (4.2GB)、BF16 (7.9GB)
  • 原生多模態(文字、圖像、影片),262K 上下文
  • 相容 llama.cpp、LM Studio、koboldcpp

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3.5 系列於 2026 年 2 月 16 日發布,首個版本為 397B-A17B MoE 模型,後續將推出更多尺寸[7],顯示 Alibaba 正在快速擴展模型家族覆蓋範圍。
  • Qwen3.5 模型在量化工具支援方面存在重大挑戰:AutoRound、LLM Compressor 和 vLLM 穩定版本均不完全相容,需要使用夜間版本或自訂修復才能運行[1]
  • Qwen3 系列引入混合思考模式架構,允許使用者在「思考模式」(深度推理)和「非思考模式」(快速回應)之間切換,4B 模型性能可匹敵 Qwen2.5-72B-Instruct[2][3]

🛠️ 技術深入

Qwen3.5 架構與量化支援

  • 基礎架構:Qwen3.5 採用混合 Gated DeltaNet 注意力機制,支援 262K 原生上下文長度[4]
  • 量化相容性問題
    • AutoRound 可量化 Qwen3.5 MoE,但輸出無法在 vLLM 穩定版載入[1]
    • LLM Compressor 與 Transformers v5(Qwen3.5 必需版本)不相容[1]
    • vLLM 穩定版本不支援 Qwen3.5,需使用夜間版本[1]
  • 量化效能:2-bit 量化(如 UD-IQ2_M,~137GB)相比原始模型性能差異在基準測試誤差範圍內[1]
  • 推理速度:M2 MacBook Pro 上 4B 模型可達 50+ tokens/秒,使用約 4.3GB 系統記憶體[5]
  • GGUF 量化選項:Q4_K_M (2.6GB)、Q6_K (3.3GB)、Q8_0 (4.2GB)、BF16 (7.9GB),相容 llama.cpp、LM Studio、koboldcpp[4]

🔮 前景展望AI analysis grounded in cited sources

無審查模型版本可能引發開源 AI 治理爭議
零拒絕率的無審查版本發布可能激化關於開源模型安全邊界和責任歸屬的討論。
量化工具生態碎片化阻礙 Qwen3.5 採用
主流推理框架(vLLM、LLM Compressor)的不相容性可能延緩企業級部署,直到官方或社群提供穩定整合。

時間線

2026-02
Qwen3.5 首次發布,包含 397B-A17B MoE 旗艦模型
2026-03
Qwen3.5-4B 無審查 GGUF 版本發布,465 次測試零拒絕
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。