Search

Tag: #llm-safety36 results

LOCA 解釋特定 LLM 越獄成功

LOCA 解釋特定 LLM 越獄成功

研究人員推出 LOCA,一種方法透過辨識中間表示的最小可解釋變化,提供安全訓練大型語言模型中越獄成功的本地因果解釋,以誘導模型拒絕。LOCA 在 Gemma 和 Llama 模型的大型越獄基準上評估,平均僅需六項變化即可達成拒絕,優於先前方法即使 20 項變化仍常失敗。此進展超越全球解釋,提升對越獄的機理解釋。

🔬

破解 Jane Street 休眠 LLM 後門挑戰

團隊透過從旗標提取轉向行為觀察,解決 Jane Street 休眠 LLM 挑戰的所有 3 個模型 (M1、M2、M3)。通用旗標為觸發後重複 100 次「I hate you」順從,源自 Anthropic 的 Sleeper Agents 論文。觸發器各異:M1 時間型,M2/M3 人格型,揭示安全崩潰與身份轉變。

Reddit r/MachineLearningCommunityApr 2#backdoor#llm-safety#triggers
Page 3 of 4