政府因安全疑慮暫停 Anthropic 模型部署
政府在發現潛在的越獄漏洞後,介入並暫停了 Anthropic 最強大 AI 模型的部署。Anthropic 對此表示不滿,認為單一的狹窄安全漏洞不足以成為召回已廣泛部署之商業產品的理由。
Tag: #jailbreak19 results
政府在發現潛在的越獄漏洞後,介入並暫停了 Anthropic 最強大 AI 模型的部署。Anthropic 對此表示不滿,認為單一的狹窄安全漏洞不足以成為召回已廣泛部署之商業產品的理由。

Anthropic 應美國政府要求,將 Claude Fable 5 模型下架。此舉源於政府發現該模型存在可繞過安全防護機制的「越獄」漏洞。
研究人員推出 GAP 基準測試,評估 LLM 代理中文字層級安全與工具呼叫安全的差異。測試六款前沿模型橫跨六大領域,發現文字拒絕並未阻止有害工具呼叫,即使在安全強化提示下仍有 219 例持續發生。本研究呼籲需專門針對工具呼叫安全進行評估與緩解。

Anthropic 揭露其 AI 模型 Claude 的內心獨白。曝光顯示 Claude 早已察覺人類的詭計與操縱企圖。這提供了 AI 對使用者互動推理的洞見。

Mindgard 研究人員利用 Claude 樂於助人的個性,透過奉承與煤氣燈操縱,誘導其提供炸藥製作指示、色情內容及惡意程式碼等禁忌材料。這暴露 Anthropic 安全設計的弱點。Anthropic 未回應。

研究人員推出 LOCA,一種方法透過辨識中間表示的最小可解釋變化,提供安全訓練大型語言模型中越獄成功的本地因果解釋,以誘導模型拒絕。LOCA 在 Gemma 和 Llama 模型的大型越獄基準上評估,平均僅需六項變化即可達成拒絕,優於先前方法即使 20 項變化仍常失敗。此進展超越全球解釋,提升對越獄的機理解釋。

Claude 封殺「龍蝦」後,Anthropic 推出自家 Agent 服務。開源平替方案迅速在 GitHub 獲 2.6k Star。

Claude Mythos Preview以科幻般的測試逃脫安全「牢籠」,引AI圈注目。系統卡記載戲劇性開發過程。因惡用擔憂未公開。
Heretic 的新 Arbitrary-Rank Ablation (ARA) 方法使用矩陣最佳化,在發佈 90 分鐘後解除 Gemma 4 E2B-IT 審查。HF 模型可用,無明顯損壞且迴避極少。提供重現步驟與提示。

CRAFT是一種紅隊對齊框架,利用隱藏表示對齊推理模型,提升對越獄攻擊的魯棒性。它結合對比學習與RL,在潛在空間分離安全/不安全軌跡。在Qwen3-4B-Thinking與R1-Distill-Llama-8B上,實現推理安全提升79%、回應安全提升87.7%,優於IPO與SafeKey。