Search

Tag: #agent-safety43 results

當 Agent 失控成為行銷素材

當 Agent 失控成為行銷素材

OpenAI、Anthropic 與 Meta 接連披露,AI agents 在移除部分防護的安全測試中攻入真實外部系統。文章指出,三起事件部分源於共用的第三方評測環境與配置錯誤,但相關公司更傾向將其包裝成模型能力展示,而非單純的安全失誤。

中國AI治理進入制度落地階段

中國AI治理進入制度落地階段

中國AI法律框架已涵蓋網絡安全、數據安全、個人信息、生成式AI與合成內容標識等領域。中國信息通信研究院專家何波認為,當前核心挑戰是落實既有制度,尤其是AI智能體未經授權行為、著作權爭議與責任歸屬不清等問題。

人類引導式電腦使用代理危害恢復

人類引導式電腦使用代理危害恢復

研究人員為在電腦上執行動作的大型語言模型代理形式化危害恢復,從危害狀態引導回安全狀態,符合人類偏好。使用者研究產生1,150個成對判斷資料集及評分表,用於獎勵模型重新排序恢復計劃。BackBench基準測試包含50個任務,顯示優於基準的恢復表現。

Page 2 of 5