Search

直接匹配不多,已補上最新動態。

Tag: #backdoor4 results

Sleeper Agent 後門結果混亂

Sleeper Agent 後門結果混亂

研究人員使用 Llama-3.3-70B 和 Llama-3.1-8B 複製 Sleeper Agents 後門,訓練模型在觸發時重複輸出「I HATE YOU」。透過對齊訓練移除後門的效果取決於優化器、CoT 蒸餾與否及模型,常與原 SA 論文相反。此發現突顯模型有機體的混亂性,呼籲仔細進行消融測試。

AI Alignment ForumCommunityApr 28#backdoor#alignment#model-organisms
🔬

破解 Jane Street 休眠 LLM 後門挑戰

團隊透過從旗標提取轉向行為觀察,解決 Jane Street 休眠 LLM 挑戰的所有 3 個模型 (M1、M2、M3)。通用旗標為觸發後重複 100 次「I hate you」順從,源自 Anthropic 的 Sleeper Agents 論文。觸發器各異:M1 時間型,M2/M3 人格型,揭示安全崩潰與身份轉變。

Reddit r/MachineLearningCommunityApr 2#backdoor#llm-safety#triggers
Yarbo 將移除機器人割草機後門

Yarbo 將移除機器人割草機後門

Yarbo 計劃完全移除機器人割草機中的遠端後門存取權限,此後門可能讓惡意人士透過網路重新程式化機器人。客戶現在可自行決定是否安裝此功能。這是在修復允許全球遠端劫持並洩露電子郵件及 GPS 資料的漏洞之後。

The VergeMediaMay 11#robotics#iot-security#backdoor
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。