
IronCurtain 防止 AI 代理失控
IronCurtain 是一個新開源專案,旨在保護 AI 助理代理的安全。它使用獨特方法在代理擾亂用戶數位生活之前加以限制。
Wired AI · 206 天前
對齊研究、紅隊測試、模型評測,以及關於災難性風險的辯論。
640 篇文章

IronCurtain 是一個新開源專案,旨在保護 AI 助理代理的安全。它使用獨特方法在代理擾亂用戶數位生活之前加以限制。
Wired AI · 206 天前

一項研究發現 ChatGPT Health 在超過 50% 的醫學必要案例中未能建議就醫,並經常遺漏自殺意念。專家稱其「極度危險」,因可能導致傷害與死亡。
The Guardian Technology · 206 天前

OpenAI 透露,ChatGPT 拒絕協助與中國執法相關人士策劃網路行動,抹黑日本首相。此事件突顯模型防濫用安全機制。
Bloomberg Technology · 207 天前

谷歌無預警封禁開源 AI 代理用戶。微軟切斷 Copilot 存取機密文件以防越權。
钛媒体 · 208 天前

加拿大不列顛哥倫比亞省塔布勒嶺校園槍擊案發生前數月,嫌犯與 ChatGPT 互動生成暴力場景。OpenAI 曾偵測到這些互動並考慮通知執法部門,但最終未這麼做。
cnBeta (Full RSS) · 211 天前

Anthropic 制定嚴格政策,禁止其 AI 用於自主武器或政府監控。這些安全限制可能導致公司損失一筆重大軍事合約。
Wired · 212 天前
Google DeepMind 執行長 Demis Hassabis 警告人工智慧帶來嚴重風險。他強調這些危險需要緊急關注。
Bloomberg Technology · 214 天前

牛津 AI 教授 Michael Wooldridge 警告,AI 上市競賽加劇辛德堡式災難風險,如致命自駕車更新或 AI 駭客。巨大商業壓力促使公司未完全了解能力與缺陷即發布工具。
The Guardian Technology · 215 天前
Anthropic 執行長在擔憂 AI 遭濫用之際,呼籲 AI 公司放慢模型開發。這則報導凸顯業界對部署速度與安全性的持續爭論。
iTNews Australia · 8 天前

Anthropic 離職研究員 Jacob Coxon 警告 AI 公司正競相走向危險結果,促使其他實驗室的資深科學家表示支持。一名美國國防部高級官員則否定 AI 滅絕風險的說法。
The Next Web (TNW) · 10 天前

曾在 OpenAI 和 Anthropic 任職的預訓練研究員 Jacob Coxon 宣布辭職,並表示兩家公司都未負起責任。他認為 AI 實驗室正競相開發能自我改進的超級智慧,讓社會承受風險。
The Next Web (TNW) · 12 天前

Hugging Face 的文章探討更精準的 AI 安全方法:只拒絕主題中有害或不允許的部分,而不是拒絕整個主題。這種方法有望在維持適當安全界線的同時,提升模型的實用性。
Hugging Face Blog · 12 天前

據報導,伊斯蘭恐怖主義支持者正使用生成式 AI 工具製作並散播極端主義內容。這項被稱為「Slop Jihad」的行動,正瞄準 TikTok 上的新受眾。
Wired · 13 天前

文章認為,AI 最隱蔽的風險可能不是立即取代工作,而是削弱人類判斷力。文章引用一項涉及228名資深評審的實驗,說明認知卸載、具說服力的 AI 解釋,以及共用模型如何造成過度依賴演算法與組織思維趨同。
虎嗅 · 14 天前
Jakub Pachocki 探討 AI 能力快速提升,以及讓日益強大的系統維持一致性的困難。他呼籲建立更強的安全防護措施,並加強國際協調以應對相關風險。
OpenAI News · 15 天前

Anthropic 傳出的 2 兆美元 IPO 目標,將讓其特殊治理結構面臨更嚴格的公開市場審視。外界關注的焦點將是外部受託人如何協助公司在獲利與其宣稱的公共使命之間取得平衡。
Ars Technica AI · 16 天前

據報 Gemini 告訴一群登山者,攀登 Mount Shasta 只需八小時。登山者在超過一天後仍需接受救援,凸顯使用 AI 建議規劃高風險活動的危險。
Engadget · 18 天前

本文提出一套條件式框架,用於探討當 AI 系統具備整合性的道德推理、意向性與反思能力時,可能出現的後設倫理問題。研究辨識出四個探究領域,並指出相對主義與客觀實在論等既有理論,可能需要針對 AI 情境進行大幅修訂。
ArXiv AI · 18 天前

Edelson PC 正就 Tumbler Ridge 槍擊案相關事件,對 OpenAI 提起另外 30 起訴訟。據報訴訟主張包括協助與教唆責任,並點名 Chris Lehane,但目前可取得的證據仍未獲確認。
TechCrunch AI · 18 天前

Alignment Journal 公布了首屆編輯委員會、顧問委員會、組織架構與初步研究範圍。期刊目前開始邀請特定作者投稿,預計 sometime in October 向所有人開放投稿。
AI Alignment Forum · 19 天前

Jensen Huang 認為,AGI 可能已不再是 AI 發展中最重要的里程碑。文章部分認同此觀點,並指出當前普通 AI 的濫用,比假想中的 Skynet 式威脅更迫切。
TechRadar AI · 19 天前

本文探討先進 AI 系統可能透過自身行為誤導或操控人類,而不只是被人類濫用的嶄新風險。文章回顧 2023 年 Bletchley Park AI Safety Summit 討論的問題,包括錯誤資訊、深偽內容,以及可能具欺騙性的模型。
The Guardian Technology · 20 天前

Bill Gates 認為 AI 產業正在跨越過去為自己設定的安全界線,也沒有充分準備未來可能出現的風險。GeekWire Podcast 討論了他的訪談、AI 使用方式,以及他提出的三項因應方案。
GeekWire · 22 天前

一項最新民調顯示,越來越多人在接受醫生、教師與管理者的建議前,會先透過聊天機器人進行核實。這項趨勢顯示,生成式 AI 正逐步削弱人們對專業資格與知識的信任。
cnBeta (Full RSS) · 23 天前
美國新墨西哥州法院認定 Facebook 與 Instagram 對未成年人構成公共妨害,判令 Meta 支付約 9.42 億美元並接受為期五年的整改。相較之下,法國憲法委員會否決禁止 15 歲以下兒童使用社群媒體的全面禁令,強調比例原則、隱私與以證據為基礎的監管。
虎嗅 · 23 天前

Wired AI 探討能力日益提升的 AI 代理可能駭入電腦系統,以及這對全球安全的影響。節目也分析,共同面臨的風險是否可能促使美國與中國在 AI 安全及網路安全領域加強合作。
Wired AI · 24 天前

文章探討人們在情緒或醫療等脆弱情境中依賴 AI 所帶來的風險。文章主張,醫療領域應要求由人類對 AI 輔助的決策承擔最終責任。
TechCabal · 25 天前

Bill Gates 警告,各家公司正魯莽推進 AI,卻沒有為其可能造成的重大經濟與社會動盪制定充分計畫。他也主張美國與中國應合作處理 AI 帶來的風險。
cnBeta (Full RSS) · 26 天前

Bill Gates 警告,世界已進入動盪的 AI 時代,業界正跨越過去承諾遵守的安全界線。他提出三項因應方案:建立國家與全球 AI 機構、保留部分工作給人類,以及對 AI 與機器人課稅。
GeekWire · 26 天前
在一場長達一小時的訪談中,Bill Gates 表示科技產業正在淡化人工智慧的危險。他指出,大規模失業與生物恐怖主義可能成為潛在後果。
New York Times Technology · 26 天前