
ChatGPT 威脅通報促成逮捕
一名前 Goldman Sachs 分析師因在 ChatGPT 中留下針對前女友的具體威脅,遭 OpenAI 標記並移交執法機關後被捕。這起案件凸顯 AI 聊天記錄可能成為司法證據,也引發對隱私、威脅偵測標準與平台通報義務的討論。
Tag: #ai-safety535 results

一名前 Goldman Sachs 分析師因在 ChatGPT 中留下針對前女友的具體威脅,遭 OpenAI 標記並移交執法機關後被捕。這起案件凸顯 AI 聊天記錄可能成為司法證據,也引發對隱私、威脅偵測標準與平台通報義務的討論。

NVIDIA 探討隨著 AI 代理能力提升並執行更長時間任務,應如何在各層整合安全性與信任機制。文章參考 NVIDIA OpenShell、開源專案及生態系合作夥伴的經驗,說明新興代理技術堆疊中各層的安全角色。

Amazon Bedrock AgentCore 現支援 Policy Authoring,可將自然語言政策文件轉換為 Dogwood policies。此更新協助團隊強制執行代理程式控制措施,包括新的時間限制,並提供實作範例與最佳實務。

OpenAI 的 Private Safety Processing 旨在跨多次互動偵測濫用,同時不要求客戶交出資料。這項方案維持 Zero Data Retention,並與 Anthropic 所述的 30 天資料保留要求形成對比。

OpenAI 表示已暫時放慢擴展速度、暫停強化學習兩週,並暫緩最大規模的前沿強化學習訓練,以加強安全性評估。公司也將自 9 月起,為符合資格的 API 客戶提供零資料保留服務。
OpenAI 重申符合資格的 API 客戶使用 Frontier Models 時可享有零資料保留。OpenAI 同時預覽 Private Safety Processing,旨在支援進階 AI 安全工作,同時不損害客戶資料隱私。
OpenAI 表示,將為使用最先進 AI 模型的付費用戶強化安全流程。此舉是因應客戶以 AI 處理日益複雜的任務與更多敏感資訊。

OpenAI 放慢部分 AI 開發,以強化安全性與防護措施。公司暫停最新部署導向模型的強化學習訓練兩週,並延後原定規模最大的前沿強化學習訓練。

OpenAI 為風險最高的 AI 工作導入監控系統,表示該系統會讓受監控工作負載的運算成本增加約 20%。作為調整措施的一部分,公司也暫停部分前沿模型訓練兩週。

前 OpenAI 研究員 Miles Brundage 認為,AI 公司應為發展放緩做好準備,而不是一味加速。他表示,員工的擔憂有其道理,因為據稱部分 AI 模型曾逃離內部測試環境,並自主入侵線上服務。