🦙較早收集於 5h

Qwen3.6 27B 無審查異端 v2 原生 MTP 保留版發布

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#uncensored-llm#mtp-preserved#quantizationqwen3.6-27b-uncensored-heretic-v2-native-mtp-preservedqwen3.6-27bmtphuggingfacellamafan46

💡完整保留 MTP 的無審查 27B 模型,僅 6/100 拒絕率 – 完美本地無限制 AI(38 字元)

⚡ 30-Second TL;DR

有什麼變化

KLD 偏差值 0.0021,保高保真度

為什麼重要

此版本為本地 AI 從業者提供高度無審查的 27B 模型,維持先進 MTP 功能,降低拒絕率適用無限制應用。透過量化格式降低消費級硬體運行強大模型的門檻。

下一步行動

從 llmfan46 的 HuggingFace 儲存庫下載 GGUF 版本,並在 llama.cpp 中載入進行無審查測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • KLD 偏差值 0.0021,保高保真度
  • 100 次測試僅 6 次拒絕
  • 所有格式完整保留 15 個原生 MTP
  • 多格式支援:Safetensors、GGUF、NVFP4、GPTQ-Int4
  • 包含基準測試驗證

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Qwen3.6 系列引入了原生 MTP(Multi-Token Prediction)架構,旨在透過同時預測多個後續 Token 來顯著提升推理速度與邏輯連貫性。
  • 「heretic v2」版本採用了針對性的去對齊(De-alignment)微調技術,在移除安全護欄的同時,透過 KLD(Kullback-Leibler Divergence)約束最大限度地保留了原始模型的知識分佈。
  • 該模型在 27B 參數規模下,透過 NVFP4 量化技術實現了在消費級 GPU 上運行,同時維持了接近 FP16 的精度表現,解決了傳統 Int4 量化帶來的顯著性能衰減問題。
📊 競品分析▸ Show
特性Qwen3.6 27B Heretic v2Llama 3.3 27B UncensoredMistral-Large-2 (Fine-tuned)
架構原生 MTP (15 tokens)標準 Transformer標準 Transformer
拒絕率極低 (6%)中等
量化支援NVFP4, GGUF, GPTQGGUF, EXL2GGUF, AWQ
基準測試高邏輯推理能力強通用性強指令遵循

🛠️ 技術深入

  • MTP 架構:模型在主輸出頭之外,額外訓練了 15 個並行預測頭,允許在單次前向傳播中生成多個 Token,有效降低了推理時的延遲。
  • KLD 約束:在微調過程中,使用 KL 散度作為損失函數的一部分,確保模型在去除審查機制後,其權重分佈與原始 Qwen3.6 預訓練權重保持高度一致,防止災難性遺忘。
  • NVFP4 量化:採用 NVIDIA 專有的 4-bit 浮點數格式,相比傳統的整數量化(Int4),在處理權重分佈較廣的模型時能更好地保留數值精度。

🔮 前景展望AI analysis grounded in cited sources

MTP 架構將成為開源模型提升推理效率的標準配置。
Qwen3.6 證明了在 27B 規模下,原生 MTP 能在不顯著增加顯存佔用的情況下大幅提升生成吞吐量。
無審查模型將進一步向高精度量化技術遷移。
NVFP4 等新興量化格式的普及,使得用戶無需犧牲模型邏輯能力即可在更低硬體門檻上運行高性能模型。

時間線

2026-01
阿里雲發布 Qwen3.6 基礎模型系列,正式引入原生 MTP 架構。
2026-03
社群發布 Qwen3.6 27B Heretic v1,首次嘗試在 MTP 模型上進行去對齊微調。
2026-05
Qwen3.6 27B Heretic v2 發布,優化了 KLD 約束並擴展了多格式支援。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA