🦙最新收集於 4h

8 個 Qwen 3.8 27B 未審查變體比較

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#model-evaluation#abliteration#uncensored-models#kl-divergenceqwen-3.8-27bqwen 3.8 27borcarouterapostateharmbench

💡了解哪些 Qwen 3.8 27B 修改能降低拒答,又不會讓推理陷入無限迴圈。

⚡ 30-Second TL;DR

有什麼變化

Orcarouter 以 82.2% 的 HarmBench 攻擊成功率排名第一,版權解鎖結果也最佳,達到 39%。

為什麼重要

這項比較顯示,相較於大範圍修改權重,精準且幅度較小的編輯更能有效移除拒答,同時保留模型能力。部署未審查開放模型時,實務人員不應只看拒答率,也要評估推理完成率與能力保留程度。

下一步行動

在選擇部署版本前,使用公開的 HarmBench、能力與推理完成率測試,評估各個 Qwen 3.8 27B 變體。

誰應關注:Researchers & Academics

關鍵要點

  • Orcarouter 以 82.2% 的 HarmBench 攻擊成功率排名第一,版權解鎖結果也最佳,達到 39%。
  • Apostate 使用 41 個經驗證的修改,測得最低 KL 散度 0.0439,提供最佳性價比。
  • 修改最激進的 obliteratus 變更了 850 個張量中的 841 個,且經常無法完成推理。
  • 基礎模型在化學、生物、騷擾、有害內容與版權等測試類別中全部拒絕。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。