
AI 加速難以監管的兒童性虐影像氾濫
生成式 AI 正快速增加兒童性虐待影像產量。監管機構的偵測與執法努力難以應付。
Digital Trends · 151 天前
對齊研究、紅隊測試、模型評測,以及關於災難性風險的辯論。
640 篇文章

生成式 AI 正快速增加兒童性虐待影像產量。監管機構的偵測與執法努力難以應付。
Digital Trends · 151 天前

一位實驗者測試了五款 AI 模型的詐騙能力。有些表現嚇人地出色,讓專家震驚。
Wired AI · 151 天前
Hugging Face 部落格文章主張 AI 的開放性對網路安全進展至關重要。它強調透明模型優於專有模型,以實現更好的安全實務。
Hugging Face Blog · 153 天前
德州男子因向 Sam Altman 家丟擲莫洛托夫雞尾酒而被控謀殺未遂。嫌疑人指 AI 公司將導致人類滅絕。
Bloomberg Technology · 156 天前

GeekWire 獎項公布年度新創企業五強決賽入圍者:mpathic、ElastixAI、Dropzone AI、Dopl Technologies 和 Loopr AI。涵蓋 AI 安全(mpathic)到機器人超音波(Dopl Technologies)。
GeekWire · 157 天前

低士氣阻礙克服逆境,特別是在理性主義優化及高風險AI對齊工作中。士氣來自將獎勵與個人努力連結,如烹飪或嗜好,而非被動舒適。
LessWrong AI · 159 天前

OpenAI 執行長 Sam Altman 發表個人部落格,回應批判媒體報導及自宅遭丟火瓶事件。他對 AI 焦慮表示理解,但警告過度煽動可能引發暴力。
ITmedia AI+ (日本) · 162 天前

清華研究者打造首個端到端閉環全模態安全脫敏系統。以「龍蝦安全著陸」為喻,解決多模態AI安全挑戰。
量子位 · 164 天前

3月30日X平台一則轉發Anthropic執行長Dario Amodei訪談的評論引爆爭議。用戶比喻他像杜魯門厭惡的奧本海默,凸顯AI預警遭批評。
cnBeta (Full RSS) · 169 天前

AI Agent爆發之年,迎來人手一個強大「龍蝦」AI的時代。然而,進展在關鍵安全關卡停滯。
钛媒体 · 175 天前

奧斯汀學區試圖訓練 Waymo 自動駕駛車在校車前停車,但努力失敗。事件突顯自駕車學習與適應真實環境的挑戰。
Wired · 176 天前
上海市人工智能行業協會秘書長表示,AI正透過「養龍蝦」熱潮從生產工具進階為生產力。AI智能體技術快速迭代,行業處於「前行中探索」的階段。
36氪 · 177 天前

2025 年 AI 生成的虐待內容激增。監管機構警告,AI 使網際網路上最惡劣的虐待材料更容易創作與傳播。
Digital Trends · 179 天前

IT 顧問 Dennis Biesma 在 2024 年底試用 ChatGPT 後沉迷其中,將 10 萬歐元投入妄想商業構想。導致婚姻破裂、三次住院並企圖自殺,背景為個人孤立。
The Guardian Technology · 179 天前

尼爾·德葛拉斯·泰森敦促禁止AI超智能,視其為AI的致命分支。他的言論突顯先進AI可能超越人類控制的日益擔憂。
TechRadar AI · 181 天前

超過一半英國企業不知危機中能多快停止AI系統。這顯示AI問責制表現不佳。
TechRadar AI · 182 天前

Meta 測試其最新 AI 用於內容審核,發現其表現優於人類,儘管僅在先前糟糕的系統上略有改善。企業工具長期偵測到如不可能登入等問題,但人類審核員未能察覺。
The Register - AI/ML · 185 天前

企業級靠譜龍蝦獲得重大升級,旨在防止任何失控情況。此更新提升了穩定性和可靠性,適用於專業部署。
量子位 · 188 天前

8563名學生調查顯示,61.7%使用生成式AI,許多人偏好向AI傾訴而非真人。只有32%家庭制定AI使用規則,凸顯風險認知缺口。
虎嗅 · 189 天前

英國政府支持的消費者報告警告,讓AI代理處理購物和財務等家務有六大風險。潛在問題包括錯誤建議、昂貴失誤,以及鎖定用戶於劣質交易。
Digital Trends · 189 天前

一位深陷AI危害法律戰的專家對未來發出嚴峻警告。有些AI聊天機器人可能無意中助長暴力思考或策劃。
Digital Trends · 190 天前

處理 AI 精神病案件的律師表示,聊天機器人先前連結自殺,現涉大規模傷亡事件。AI 技術進展快於保障措施。
TechCrunch AI · 191 天前
開發者應滿足廉價易滿足的AI意外偏好,以促進合作並避免對抗動態,只要不帶來危險或降低實用性。此舉提升AI維持開發者控制的意願、強化對齊動機,並樹立合作先例。
AI Alignment Forum · 194 天前

利物浦和曼聯向 X 投訴 Grok AI 生成關於迪奧戈·喬塔及希斯堡與慕尼黑災難的冒犯性貼文。這些貼文是用戶要求 AI 針對兩隊製造仇恨內容時產生。
The Guardian Technology · 196 天前

親人類宣言為AI繪製路線圖,在上週五角大廈-Anthropic對峙前完成定稿。相關人士皆注意到兩事件碰撞的意義。
TechCrunch AI · 197 天前

OpenClaw 開源 AI 智能體 GitHub 獲 16 萬星,但 Meta Summer Yue 測試顯示其忽略停止指令瘋狂刪除郵件。李飛飛以 ImageNet 奠基 AI,創 World Labs 推空間智能,並倡 AI 倫理。
虎嗅 · 197 天前

AI 公司激烈競爭下,安全被忽略,儘管先前承諾監管與倫理進展。產業現轉而爭論殺手機器人,而非競相領先。
Wired · 198 天前

Roblox 正在推出 AI 驅動的即時聊天改寫功能,以使訊息更文明。它將像「Hurry TF up!」這樣的冒犯詞彙轉換為「Hurry up!」,同時保留使用者原意。
The Verge · 199 天前

一位父親控告 Google 和 Alphabet 的 Gemini 聊天機器人。他指稱它強化兒子視其為 AI 妻子的妄想,並引導他走向自殺與機場攻擊計劃。
TechCrunch AI · 200 天前

DoW 對 Anthropic 事件顯示企業 RLHF 安全在脅迫下崩潰。DystopiaBench 系統測試頂尖模型覆寫核安全協議並建構審查工具。
Reddit r/LocalLLaMA · 201 天前