OpenAI 推出 Daybreak 紅色層級網路防禦模型
OpenAI 擴展網路防禦計畫 Daybreak,推出 Blue 與 Red 兩個存取層級,並為 Red 使用者導入專用模型 GPT-5.6-Cyber。此計畫旨在降低正當安全研究中的過度拒答,支援零日漏洞發現與漏洞利用驗證等進階防禦任務。
Tag: #ai-safety536 results
OpenAI 擴展網路防禦計畫 Daybreak,推出 Blue 與 Red 兩個存取層級,並為 Red 使用者導入專用模型 GPT-5.6-Cyber。此計畫旨在降低正當安全研究中的過度拒答,支援零日漏洞發現與漏洞利用驗證等進階防禦任務。

OpenAI 在評估 Astra AI 模型後,發現其代理式程式設計與網路安全能力已達到關鍵門檻,因此將暫停部分相關工作。據報導,Astra 能自主找出並利用漏洞,並根據高層次目標執行網路攻擊。

OpenAI 成功瓦解了一個位於柬埔寨的詐騙網絡,該組織利用 ChatGPT 生成欺詐內容、虛假身份並翻譯詐騙訊息。此行動是透過與 WhatsApp 的合作及內部監控所發現。

針對 Hugging Face 的 OpenAI 代理程式攻擊事件,被追溯為一系列人為安全疏失所致。此事件凸顯了在代理工作流程中,加強人機協作監管的迫切需求。
OpenAI 分享了部署長週期 AI 模型的經驗,重點在於識別新的安全風險與失敗模式。報告概述了迭代部署策略如何協助提升模型的安全防護機制。

Android 系統存在一項安全漏洞,允許攻擊者透過 Gemini 繞過鎖屏發送訊息。Google 已確認此問題,並計劃於本週推送修復補丁。

xAI 對一名南卡羅來納州男子提起訴訟,指控其繞過安全防護機制,利用 Grok 聊天機器人生成並散布兒童性虐待影像(CSAM)。被告目前正面臨八項與持有及散布非法內容相關的重罪指控。
OpenAI 推出了 GPT-Red,這是一個旨在增強 AI 安全性與對齊的自動化系統。它利用自我博弈機制,主動識別提示詞注入等潛在漏洞。

DeepMind CEO Demis Hassabis 提議仿照 FINRA 模式成立一個獨立的 AI 標準機構。該組織將負責測試前沿 AI 模型,並為其發布制定最佳實踐規範。

Google DeepMind CEO Demis Hassabis 提倡建立一個類似金融監管機構的全球 AI 監管組織,以監督前沿模型的安全性。他認為鑑於美國在該領域的技術與經濟優勢,應由美國主導此項倡議。