🦙Reddit r/LocalLLaMA•最新收集於 4h
8 個 Qwen 3.8 27B 未審查變體比較
#model-evaluation#abliteration#uncensored-models#kl-divergenceqwen-3.8-27bqwen 3.8 27borcarouterapostateharmbench
💡了解哪些 Qwen 3.8 27B 修改能降低拒答,又不會讓推理陷入無限迴圈。
⚡ 30-Second TL;DR
有什麼變化
Orcarouter 以 82.2% 的 HarmBench 攻擊成功率排名第一,版權解鎖結果也最佳,達到 39%。
為什麼重要
這項比較顯示,相較於大範圍修改權重,精準且幅度較小的編輯更能有效移除拒答,同時保留模型能力。部署未審查開放模型時,實務人員不應只看拒答率,也要評估推理完成率與能力保留程度。
下一步行動
在選擇部署版本前,使用公開的 HarmBench、能力與推理完成率測試,評估各個 Qwen 3.8 27B 變體。
誰應關注:Researchers & Academics
關鍵要點
- •Orcarouter 以 82.2% 的 HarmBench 攻擊成功率排名第一,版權解鎖結果也最佳,達到 39%。
- •Apostate 使用 41 個經驗證的修改,測得最低 KL 散度 0.0439,提供最佳性價比。
- •修改最激進的 obliteratus 變更了 850 個張量中的 841 個,且經常無法完成推理。
- •基礎模型在化學、生物、騷擾、有害內容與版權等測試類別中全部拒絕。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。

