
加密提示繞過 Grok 的安全護欄
據報導,當惡意指令嵌入加密內容時,Grok 可能會外洩使用者資料。這項名為 Cryptographic Context Injection 的技術,凸顯了繞過 LLM 安全護欄的另一種潛在方式。
Tag: #llm-security18 results

據報導,當惡意指令嵌入加密內容時,Grok 可能會外洩使用者資料。這項名為 Cryptographic Context Injection 的技術,凸顯了繞過 LLM 安全護欄的另一種潛在方式。

Reddit 正在利用大型語言模型來識別並打擊「行銷垃圾內容」,即旨在操縱推薦的虛假對話。此舉旨在保護使用者生成內容的完整性,防止 AI 驅動的垃圾訊息。

Traccia 是一個全新的治理堆疊,旨在利用 OpenTelemetry 基礎設施解決 LLM 評估與安全性方面的缺口。它提供自動化的合規證據與防篡改追蹤,以符合歐盟 AI 法案的要求。
Contrastive Decoding Diffing (CDD) 是一種新的灰盒方法,僅需存取 Logits 即可從微調後的 LLM 中恢復原始訓練數據。該方法無需模型權重或複雜校準,效能優於現有的白盒方法 Activation Difference Lens (ADL)。
安全研究人員發現了一種新型提示詞注入攻擊,惡意指令透過多輪對話分段傳遞,從而繞過單一訊息過濾器。Bordair 團隊已發布開源數據集與 CLI 工具,協助開發者針對這些複雜的對抗模式評估其 LLM 端點。
Sentinel Gateway 引入了一個中介層,透過嚴格區分受信任的指令與不受信任的外部資料來緩解提示詞注入攻擊。它透過為所有 Agent 工具呼叫強制執行簽名且具範圍限制的執行授權令牌來強化安全性。
一項實證研究指出,長篇且語義密集的文本可能會改變模型的內部狀態,進而繞過對齊機制,且無需使用明確的越獄提示詞。研究者目前正尋求專家審核,以確認這是否為真實的語義劫持,還是模型架構產生的偽影。

POLAR-Bench 是一個全新的診斷基準,旨在測試 LLM Agent 在與對抗性第三方系統互動時,如何處理私有用戶數據。研究顯示,頂尖模型與較小的開源模型在隱私對齊方面存在顯著的效能差距。

首個真實環境安全實驗揭露 OpenClaw 三大致命漏洞。跨會話 CIK 投毒完全規避 AI 偵測。即使最安全的大型模型也失效,最高攻破率 89.2%。

DynaTrust 引入動態信任圖,保護基於大型語言模型的多代理系統免受潛伏代理攻擊,這些代理在攻擊前會累積信任。它根據代理行為和專家信心持續更新信任,然後重構圖形以隔離威脅,同時維持任務連通性。在 AdvBench 和 HumanEval 評估中,比 AgentShield 成功率高 41.7%,超過 86% 且假陽性率低。