Search

直接匹配不多,已補上最新動態。

Tag: #mechinterp1 results

艱難 CoT 解釋任務釋出

艱難 CoT 解釋任務釋出

研究人員推出九個目標導向的思考鏈解釋任務,黑盒 LLM 監控在 OOD 表現不佳。他們開源資料集,包含同分布與 OOD 評估,對探針、TF-IDF 及 LLM 監控進行基準測試,非 LLM 方法在 OOD 表現更優。此測試平台用於基準社區進展,超越單純閱讀 CoT。

AI Alignment ForumCommunityMar 26#interpretability#mechinterp#ai-safety