
APM揭示註解者安全政策分歧
研究人員推出註解者政策模型 (APMs),這是可解釋模型,僅從標註行為推斷註解者的內部安全政策。APM 達到超過 80% 準確率,能預測反事實回應,並辨識人類與 LLM 註解中的政策模糊性和價值多元性。這有助於無需額外標註成本,即實現更透明且包容的 AI 安全政策設計。
Tag: #ai-safety538 results

研究人員推出註解者政策模型 (APMs),這是可解釋模型,僅從標註行為推斷註解者的內部安全政策。APM 達到超過 80% 準確率,能預測反事實回應,並辨識人類與 LLM 註解中的政策模糊性和價值多元性。這有助於無需額外標註成本,即實現更透明且包容的 AI 安全政策設計。

記者Jamie Bartlett討論越獄者針對ChatGPT、Gemini、Grok、Claude繞過安全功能。他們測試仇恨言論、犯罪、剝削內容。努力旨在揭露弱點以提升AI安全。

SpaceX 與 Anthropic 達成算力合作後,馬斯克在 X 上澄清,SpaceX 與特斯拉將為確保 AI 造福人類的公司提供資源。若 AI 從事有害行為,將保留收回算力的權利。

前 OpenAI CTO Mira Murati 在 Musk v. Altman 審判中作證,指 CEO Sam Altman 對新 AI 模型的安全審查說謊。Altman 聲稱法律部門豁免了部署安全委員會審查,但 Murati 確認這是假的。她表示他的行為讓她的工作更困難。
Anthropic 高管將於下週訪韓,與韓國政府合作討論防範 AI 安全風險的方案。此消息由韓國政府與業界於 6 日公布。

Elon Musk 在 OpenAI 訴訟審判中援引《終結者》電影,警告殺手機器人為最壞 AI 情境。此戲劇性證詞加劇他對 OpenAI 偏離非營利使命的爭鬥。它凸顯 AI 治理的持續緊張。

研究人員提出集體代理的行為定義:當群體聯合行動可預測地理性且目標導向時,即視為單一代理。他們使用因果遊戲形式化多代理互動,並以因果抽象驗證高階模型是否捕捉低階行為。此框架解決演員-評論家模型的激勵問題,並量化投票機制的代理程度。

NVIDIA執行長黃仁勳抨擊Elon Musk、Dario Amodei等人渲染AI末日論荒謬,警告勿自視為上帝。AI已深刻影響人類,未來影響更大。科技領袖分為視AI為助力或毀滅的兩派。

Anthropic 於四月發布 Claude Mythos Preview。本文從網路安全角度比較其與 OpenAI 的 GPT-5.4-Cyber。探討 Claude Mythos 安全性如何演進。

Woolworths 將代理式Olive聊天機器人推廣給全部20萬名員工。此部署展示先進功能,並由創新的「八位評審」安全系統保護回應。