🤖
MoE 拒絕經專家路由於消絕化
在 Mac Studio M3 Ultra 上消絕 Qwen3.5-397B-A17B MoE,發現可分離拒絕子空間與安全專家路由。權重烘焙移除政治拒絕但保留安全;推論鉤子捕捉兩者。Repo 詳述掃描與部署。
Tag: #abliteration5 results
在 Mac Studio M3 Ultra 上消絕 Qwen3.5-397B-A17B MoE,發現可分離拒絕子空間與安全專家路由。權重烘焙移除政治拒絕但保留安全;推論鉤子捕捉兩者。Repo 詳述掃描與部署。
瑞士聯邦最高法院正在測試 Heretic 模型,以解決法律環境中 LLM 過度對齊的問題。研究證實,經過「消融」(abliteration)處理的模型能有效處理標準模型常拒絕的合法法律查詢。

發布所有四款 Gemma 4 模型(2.3B 至 31B)的無審查版本,使用 MoE 專家消滅術與自動化研究迴圈。基準測試拒絕率降至 0.4-3.2%。Hugging Face 上提供 BF16 與 GGUF 量化。
開發者發布具視覺的去安全化 Qwen3.5-9B,使用二階段正交投影 + LoRA 方法達 0% 拒絕率。優於 heretic 版的 46% 拒絕。Ollama 與 Hugging Face 模型卡可用。
HauhauCS 的 abliteration 套件係未歸因抄襲 Heretic (AGPL-3.0) 分支,由程式碼分析及 Heretic 作者確認。共享相同模組、拒絕標記及獨特幾何中位數方法。移除版權未揭露衍生,違反許可。