新論文探討 AI 對人類認知的影響
由 30 位專家共同撰寫的論文分析了 AI 系統如何威脅集體信念形成與認知韌性。文中強調了操縱、認知卸載與回饋迴圈等風險,並提出了緩解策略。
Tag: #ai-safety539 results
由 30 位專家共同撰寫的論文分析了 AI 系統如何威脅集體信念形成與認知韌性。文中強調了操縱、認知卸載與回饋迴圈等風險,並提出了緩解策略。

本文探討了「安全與實用性權衡模型」,分析開發者如何在安全干預措施與部署效用之間取得平衡。文章將開發者的動機分為「倉促但合理的開發者」與「有限的政治意願」兩種情境,協助利害關係人優化安全策略。

本期 Import AI 探討了 AI 系統中的獎勵駭客風險,並介紹了 Anthropic 發布的最新 RSI 數據。同時也涵蓋了強化學習在高速四軸無人機競賽中的最新進展。
ZeroDrift 獲得 1,000 萬美元融資,旨在開發 AI 模型的合規層。該服務作為模型與用戶之間的中介,負責攔截並替換不符合規範的內容。

近期一起涉及知名人士的事件凸顯了青少年越來越傾向使用 ChatGPT 尋求敏感的個人建議。此案例強調了 AI 在情感支持方面的依賴度增加,以及 AI 引導可能帶來的現實後果。

本文探討了在 AI 對齊中定義「操縱」與「引導」等概念的困難。作者認為人類對這些術語的直覺在科學上是不連貫的,且缺乏對技術對齊有實質幫助的「真名」。

前 Tesla 數據標註員與工程師公開對該公司的全自動駕駛 (FSD) 模式安全性表示質疑。受訪員工中絕大多數表示,他們拒絕乘坐處於 FSD 模式下的車輛。

路透社報導指出,Tesla 聲稱其 FSD 軟體比人類駕駛安全十倍的說法缺乏數據支持。內部員工表示,該技術距離大規模安全部署仍有很大差距。
OpenAI 推出了「前沿治理框架」(Frontier Governance Framework),旨在將其 AI 安全、防護與風險管理實踐制度化。此框架將公司的內部運作與歐盟及加州的最新監管要求進行對齊。