Search

Tag: #jailbreak19 results

LOCA 解釋特定 LLM 越獄成功

LOCA 解釋特定 LLM 越獄成功

研究人員推出 LOCA,一種方法透過辨識中間表示的最小可解釋變化,提供安全訓練大型語言模型中越獄成功的本地因果解釋,以誘導模型拒絕。LOCA 在 Gemma 和 Llama 模型的大型越獄基準上評估,平均僅需六項變化即可達成拒絕,優於先前方法即使 20 項變化仍常失敗。此進展超越全球解釋,提升對越獄的機理解釋。

CRAFT:隱藏狀態RL防護越獄攻擊

CRAFT:隱藏狀態RL防護越獄攻擊

CRAFT是一種紅隊對齊框架,利用隱藏表示對齊推理模型,提升對越獄攻擊的魯棒性。它結合對比學習與RL,在潛在空間分離安全/不安全軌跡。在Qwen3-4B-Thinking與R1-Distill-Llama-8B上,實現推理安全提升79%、回應安全提升87.7%,優於IPO與SafeKey。

ArXiv AIResearchMar 19#alignment#jailbreak#latent-space
Page 1 of 2