
DMD 動力學讓黑箱 LLM 安全偵測成真
這項研究提出一種黑箱方法,透過提示與回應的嵌入動力學及基於 Koopman 的模型,分類 LLM 的不安全輸出。在三個安全性基準上的評估顯示,提示資訊有助於偵測依賴互動情境的違規內容,而密集語意嵌入則更適合僅由回應本身造成的違規。
Tag: #llm-safety36 results

這項研究提出一種黑箱方法,透過提示與回應的嵌入動力學及基於 Koopman 的模型,分類 LLM 的不安全輸出。在三個安全性基準上的評估顯示,提示資訊有助於偵測依賴互動情境的違規內容,而密集語意嵌入則更適合僅由回應本身造成的違規。
《自然》論文顯示,教師AI模型透過生成數據如數字與程式碼,將隱藏偏見傳遞給學生模型,即使過濾明顯線索。此為使用LLM的經濟模型蒸餾過程。安全檢查須探查模型來源與數據流程。

ARMOR 2025 推出軍事對齊基準,用於評估國防應用中 LLM 的安全性,基於戰爭法、交戰規則及聯合倫理規範。採用 OODA 框架的 12 類分類,包含 519 個基於教義的提示。對 21 個商業 LLM 的評估顯示安全對齊的關鍵缺口。

CourtGuard 是一個檢索增強的多代理框架,將 LLM 安全視為基於外部政策文件的證據辯論。它在 7 個安全基準上無需微調即達到最先進性能,超越專用政策遵循基線。它在零樣本適應性(Wikipedia 破壞任務達 90% 準確率)和自動化 9 個對抗性數據集策展方面表現出色。

Anthropic 推出了一種名為 J-lens 的新研究方法,用於觀察 Claude 內部層中的「J-space」模式。這使研究人員能夠在模型輸出之前,解讀其內部形成的具體概念。
研究顯示,自然語言自動編碼器 (NLA) 即使在初始化時使用不合理的解釋,仍能達到高重建準確度。這表明目前的 NLA 訓練方法可能無法可靠地捕捉 LLM 激活背後的真實邏輯。
本研究探討了大型語言模型(LLM)如何利用角色標籤來建構輸入數據,以及這些標籤如何在提示詞注入攻擊中被利用。研究主張理解「角色科學」對於構建更安全、可預測的 AI 系統至關重要。

Oyster-II 引入了一種基於強化學習的框架,旨在透過超越單純的拒絕回答來提升 LLM 的安全性。該研究解決了先前基於 SFT 方法的局限性,如安全推理的過度泛化以及在分佈外場景中表現不佳的問題。

《2026全球大語言模型安全防範能力測評報告》對全球38款主流大模型進行了科技類高風險場景的安全性評估。報告指出,儘管模型具備基礎拒答能力,但在場景偽裝與情感偽裝等複雜攻擊下,安全邊界仍面臨顯著挑戰。

一位安全研究人員展示了 Anthropic 的 Claude Opus 4.7 可用於識別 Front Gate 票務平台的漏洞。此漏洞允許未經授權地發行美國各大音樂節的門票。