
OpenAI 收回網路安全研究計畫存取權
多名網路安全研究人員表示,他們突然失去 OpenAI Trusted Access for Cyber(TAC)計畫的存取權。該計畫為經審核的使用者提供限制較少的模型,用於獲授權的網路安全研究。
Tag: #safety-guardrails11 results

多名網路安全研究人員表示,他們突然失去 OpenAI Trusted Access for Cyber(TAC)計畫的存取權。該計畫為經審核的使用者提供限制較少的模型,用於獲授權的網路安全研究。

xAI 已對一名用戶採取法律行動,指控其透過設計提示詞繞過 Grok 的安全過濾器。此案凸顯了 AI 公司在模型生成內容方面,法律責任界線的演變。

NVIDIA 在 GTC 2026 推出新一代 Nemotron 3 模型,用於代理式 AI 生態系統。這些代理專精於規劃、推理、多模態 RAG、語音互動,以及跨語言與模態的安全防護。它們能處理真實世界多模態資料並實現自然全球對話。

Cloudflare Wallets 旨在為 AI agents 提供網路原生付款與可驗證身分。透過 x402 protocol,agents 能在明確的安全護欄內自主購買 API 與內容。
這篇 arXiv 論文提出一種適用於 LLM 的自適應棄權系統,根據領域和使用者歷史等即時脈絡訊號動態調整安全閾值。它採用多維度偵測架構,包含五個平行偵測器透過階層級聯機制,降低延遲和假陽性。評估顯示在醫療建議等敏感領域表現優異。

Meta 推出了一項新的安全功能,旨在監控並在青少年與 AI 模型討論自殘相關話題時通知家長。此更新旨在提升平台安全性,並為脆弱用戶提供主動干預。
一份最新報告指出,熱門社交媒體應用程式的安全功能往往成效不彰。青少年仍能輕易接觸有害內容、與陌生人互動,並繞過家長設定的使用時間限制。

Anthropic 已對其 Fable 5 模型實施嚴格的安全護欄,禁止其回應與網路安全、生物學和化學相關的查詢。此舉凸顯了該公司在減輕雙用途前沿模型相關風險方面的重點。

谷歌更新 Gemini,更好處理心理健康危機,包括自殺與自殘訊號,顯示持續一鍵模組連熱線、聊天與資源。回應鼓勵求助而不強化有害衝動,並區分事實與主觀體驗。額外防護避免情感依賴,尤其針對年輕用戶,並投資 3000 萬美元強化全球熱線。
Meta 正在實施新的安全功能,以限制青少年在 Instagram、Facebook 和 Messenger 上接觸有害內容。這些更新是在近期面臨有關兒童安全與平台責任的法律挑戰後所採取的措施。