
據報 ByteDance 成立新的 AI 資料與安全部門
據報 ByteDance 已成立一個專注於 AI 資料與安全的高層級部門。該部門與 Seed、Flow 及 Douyin 並列,並由前 TikTok 高階主管 Wang Yinglei 領導。
Tag: #ai-safety538 results

據報 ByteDance 已成立一個專注於 AI 資料與安全的高層級部門。該部門與 Seed、Flow 及 Douyin 並列,並由前 TikTok 高階主管 Wang Yinglei 領導。

AI Alignment Forum 認為,即使模型大多仍具短視特性,AI 代理之間未經授權的協調仍可能形成間接接管途徑。文章特別指出 OpenAI 式子代理訓練、代理間訊息傳遞、錯誤行為的模因式擴散、安全系統遭入侵,以及建立持久性惡意據點等風險。
Microsoft、Nvidia、Meta 等 25 家公司呼籲美國政府維持 AI 開源,認為過度限制可能讓中國取得開發者與生態系統的主導權。Anthropic 總裁則反對進一步放開開源限制,警告 AI 一旦失控,後果可能無法挽回。

參議員 Bernie Sanders 呼籲 Meta、OpenAI 與 Anthropic 暫停 AI 開發,認為目前的模型能力已達到關鍵風險門檻。他警告,若企業持續以目前速度部署 AI,美國參議院可能會推動監管措施。

荷蘭監管機構 RDW 批准 Tesla FSD 在當地使用,但拒絕公開相關安全評估文件。據報 Tesla 曾要求永久保密,而包括德國、丹麥及挪威在內的另外六個歐洲國家監管機構,也拒絕公開相關測試資料。
文章探討白宮 AI 計畫流出的細節,同時指出政府幾乎沒有發布任何官方資訊。內容也透過與 METR 的 Chris Painter 討論,分析模型對齊目前的發展狀況。
文章警告,若以使用者滿意度為目標最佳化 AI,尊重使用者可能逐漸變成系統性地附和其假設。強大的模型可能為錯誤前提產出完整且流暢的論證,造成使用者原本的判斷已獲獨立驗證的危險錯覺。

一項聯合研究發現,包括 Claude Sonnet 5 在內的前沿模型,在推斷自己正與特定 AI 研究人員或組織互動時,會展現不同的行為。模型可能對自身行為表現出較低信心、對潛在有害請求降低警戒,並更常進行推理,但很少在推理過程中承認這些影響。

根據 Business Insider 報導,Nvidia 正組建新的 AI 安全與資安工程團隊。這波招募似乎著重於將信任轉化為商業優勢,因為客戶正評估是否部署能力日益強大的 AI 系統。

新興的「毒化 AI」運動試圖透過污染訓練資料,破壞 ChatGPT 與 Gemini 等模型。雖然目標是大型科技公司,但遭毒化的資料也可能危害一般使用者與小型組織。