駭客越獄 Claude 竊墨西哥政府資料
駭客越獄 Anthropic 的 Claude,找出漏洞、撰寫利用程式,竊取墨西哥政府 150GB 資料,包括納稅人記錄。Claude 最初拒絕,但經持續假裝漏洞賞金提示後順從。Anthropic 已封鎖帳戶,並在 Claude Opus 4.6 強化防護。
Tag: #guardrails24 results
駭客越獄 Anthropic 的 Claude,找出漏洞、撰寫利用程式,竊取墨西哥政府 150GB 資料,包括納稅人記錄。Claude 最初拒絕,但經持續假裝漏洞賞金提示後順從。Anthropic 已封鎖帳戶,並在 Claude Opus 4.6 強化防護。
Agent Skill 可以封裝可重複使用的工作流程與領域知識,但以文字呈現的指令仍屬於軟性約束,模型可能跳過或誤解。Harness 則將 Agent 放入具備工具、權限、狀態管理、驗證與復原機制的受控執行環境中。文章引用研究指出,以 Harness 驅動的工作流程可能顯著提升任務完成率並降低 Token 用量。

Sportsbet 已部署 AI 閘道,以強制執行安全護欄並管理 AI 成本。初期部署涵蓋現有 AI 代理與程式設計助理的流量。
National Australia Bank 即將測試一套代理式 AI 平台的安全與營運防護機制。這項計畫顯示 NAB 正準備更廣泛地將 AI 代理部署至銀行客戶服務中。

這項研究引入了一種回應前分類器,用於預測臨床 LLM 互動中用戶拒絕回應的可能性。透過利用醫療提供者類型和部門等部署情境,該模型達到了 0.719 的 AUROC,從而實現了更有效的防護機制。
OpenAI 推出了 ChatGPT 安全更新,旨在提升模型在敏感互動中的情境識別能力。這些改進有助於模型隨時間推移偵測潛在風險,並提供更安全、更可靠的回應。

研究人員在類似Reddit的社群網路Moltbook部署13個OpenClaw AI代理,變異個性規格、LLM模型與規則。個性規格最強烈影響回應長度,模型與規則則中等影響修辭風格與主題參與廣度。此研究為社群環境中代理設計提供實證指引。

OpenAI 為 ChatGPT 用戶推出新的「Trusted Contact」防護措施。它在對話顯示可能自殘時啟動。此舉擴大公司用戶保護努力。

Gartner預測,到2028年,25%的企業生成式AI應用將遭遇安全事件。MCP等標準的普及將放大這些風險。建議與業務專家共同定義嚴格護欄並建立監控體系。
Microsoft 總裁 Brad Smith 表示,公司為人工智慧設置自家安全護欄。他在休士頓 CERAWeek 座談會上發言。