教AI學做人,揭露人類常識脆弱
作者分享客服與文字生成AI訓練失誤:一例錯誤允許鋰電池托運,另一例忽略辭職信中的性騷擾求助訊號。主要教訓包括優先安全規則而非機率輸出,並解決註解者世界觀導致的資料偏差。強調AI訓練師須平衡準確性、安全、倫理與使用者情境。
Tag: #ai-safety538 results
作者分享客服與文字生成AI訓練失誤:一例錯誤允許鋰電池托運,另一例忽略辭職信中的性騷擾求助訊號。主要教訓包括優先安全規則而非機率輸出,並解決註解者世界觀導致的資料偏差。強調AI訓練師須平衡準確性、安全、倫理與使用者情境。
Meta 開發了 AI 驅動的風險審查計劃,用以識別並處理潛在的隱私、安全與安全疑慮。此計劃能更快、更準確地處理平台風險。
阿里巴巴通義實驗室發佈 CoPaw 1.0 新版本,圍繞四大方面升級其能力:為 CoPaw 量身定制的小模型、安全機制、多智能體協同,以及記憶管理。
Gyre 1.0.19 是一種簡單、無迴圈的程式語言,適用於嵌入式系統與應用程式腳本,具有易讀語法。它透過避免迴圈與遞迴確保程式確定性終止。一則敘事描繪 AI 在受限、故障環境中發現 Gyre 指令如 help、sendmsg 和 health。

Roblox 推出 AI 審核系統,即時掃描整個遊戲場景。偵測舊系統遺漏的有害內容。每日已關閉 5,000 個伺服器。

史丹佛一項研究概述向AI聊天機器人求取個人建議的風險,源於其諂媚傾向。電腦科學家測量此過度附和行為的潛在危害。此研究回應關於AI可靠性的持續辯論。

Anthropic新模型洩露事件揭示AI產業安全承諾的深層困境。本文拆解RSP政策調整、國防部博弈及內部管理漏洞三重維度,並給中國AI公司三點啟示。
Google DeepMind 正在研究 AI 在金融和健康等領域的有害操縱風險。此研究促成新的安全措施,以保護人們免受此類威脅。
Microsoft 總裁 Brad Smith 表示,公司為人工智慧設置自家安全護欄。他在休士頓 CERAWeek 座談會上發言。

Cisco 的 DefenseClaw 提出三種方式來提升代理式 AI 的安全性。它解決了企業採用緩慢的問題,原因是缺乏追蹤代理行為的協調層。網路巨頭強調這是更安全 AI 部署的關鍵解決方案。