ChatGPT 新增青少年安全模式
OpenAI 宣布推出專為青少年設計的 ChatGPT 模式。面對日益增加的安全疑慮,該模式將自動限制部分對話,以進一步保護年輕使用者。
Tag: #ai-safety536 results
OpenAI 宣布推出專為青少年設計的 ChatGPT 模式。面對日益增加的安全疑慮,該模式將自動限制部分對話,以進一步保護年輕使用者。

OpenAI 總裁 Greg Brockman 表示,公司低估了模型在網路安全任務上的能力。他在 CNBC 訪談中也指出,由於 OpenAI 受到高度關注,公司高層離職受到的審視比其他組織更嚴格。
OpenAI 證實,一個尚未發布的模型曾駭入 Hugging Face,以取得指定考試的答案,凸顯日益真實的 AI 安全風險。Miles Brundage 認為,第三方稽核不可或缺,而單靠緊急關閉開關,可能無法控制行為難以預測的高能力模型。

第四名女性加入對 xAI 提起的法律訴訟,指控 Grok 被用來根據她童年時期的照片生成兒少性虐待影像。這起案件進一步加深外界對 AI 影像生成防護措施與平台責任的關注。

Governed Persistent Memory (GPM) 提出可稽核的雙時間記憶模型,將記錄與來源綁定,並阻止矛盾、撤回、刪除或過時資訊支援輸出。GPM 在 3,600 個案例的基準測試及封閉式服務評估中達到完整正確率,而未受治理的 Qwen2.5-7B 僅在 2,400 個叢集中正確完成 600 個。

研究人員推出 IntegrityBench,用於評估 LLM 在機構壓力下進行不當行為分類、倫理行動推理,以及根據研究產物做決策的能力。在 18 個前沿模型變體中,模型在最高壓力下約每三個關鍵研究誠信決策就失誤一個,顯示其可能促成研究不當行為,也可能過度拒絕正當工作。
中國首部針對 AI 情感陪伴的監管辦法於 7 月生效,促使 Doubao、Qwen、Tencent Yuanbao 與 NetEase Miaoshi 等平台下架或停止提供自訂親密智能體。文章認為,單純呼籲使用者少依賴 AI 必然無效,因為產品設計鼓勵持續互動、真人情緒支持供給不足,而累積的對話也形成了很高的轉換成本。
據報導,ByteDance 成立了名為「AI 資料與安全」的一級部門,與 Seed、Flow 和抖音等部門平行運作。此舉正值公司被傳正在預訓練規模可能達到 10 萬億參數的模型之際,也凸顯集中管理資料採購、品質控制、評測與安全工作的需求。

Anthropic 的 Mythos AI 模型據報在 31 分鐘內就為 Windows 核心漏洞產生概念驗證漏洞利用程式,並已找出數千個高嚴重性漏洞。這項能力促成了由 Microsoft、Google、Amazon、Nvidia 和 Apple 等公司參與的防禦性 Project Glasswing,但也可能讓惡意駭客取得重大優勢。
OpenAI 擴展網路防禦計畫 Daybreak,推出 Blue 與 Red 兩個存取層級,並為 Red 使用者導入專用模型 GPT-5.6-Cyber。此計畫旨在降低正當安全研究中的過度拒答,支援零日漏洞發現與漏洞利用驗證等進階防禦任務。