Search

直接匹配不多,已補上最新動態。

Tag: #sabotage1 results

ML 研究破壞偵測基準

ML 研究破壞偵測基準

研究人員推出審計破壞基準,測試 9 個 ML 程式碼庫中的破壞偵測。頂尖 LLM 如 Gemini 3.1 Pro 僅達 0.77 AUROC;LLM 輔助人類表現相似。凸顯誤對齊 AI 破壞安全研究的風險。

AI Alignment ForumCommunityApr 30#ai-safety#sabotage#auditing