
Narration-of-Thought:提升大型語言模型的道德推理能力
Narration-of-Thought (NoT) 是一種新的推理時支架技術,將大型語言模型的推理過程結構化為五個部分,以減少利益相關者遺漏和不確定性壓制。該方法無需微調或額外參數,即可顯著提升各類模型在道德決策上的表現。
Tag: #safety85 results

Narration-of-Thought (NoT) 是一種新的推理時支架技術,將大型語言模型的推理過程結構化為五個部分,以減少利益相關者遺漏和不確定性壓制。該方法無需微調或額外參數,即可顯著提升各類模型在道德決策上的表現。

Patronus AI 獲得 5000 萬美元融資,用於開發 AI 代理部署前的模擬測試環境。該平台旨在提供一個「複製品」環境,確保 AI 代理在執行編碼或財務分析等複雜任務時的可靠性。

Elon Musk 與 Tesla 否認了有關 Autopilot 設計缺陷導致致命車禍的指控。公司堅持認為駕駛員應對踩下油門的行為負責。

Tesla AI 部門負責人聲稱,在德州發生的一起致命車禍中,駕駛員手動將加速踏板踩到底,從而覆蓋了全自動駕駛系統。該公司正為其自動駕駛輔助系統辯護,反駁系統故障的指控。
Nvidia 正優先開發人形機器人的安全協議。該公司強調,機器人必須具備處理瞬間決策的能力,才能在與人類密切協作時確保安全。

Google DeepMind 研究人員發現,Gemini 的安全性主要源自於預訓練與監督式微調 (SFT) 的結合,而非強化學習 (RL) 階段。這項發現顯示 SFT 是提升模型安全性的關鍵槓桿點。
NVIDIA 推出了 Nemotron 3.5 Content Safety,這是一款專為企業級 AI 應用提供可自定義多模態安全防護的新工具。它使企業能夠在文字與視覺輸入中執行特定的安全策略,以確保 AI 部署的可靠性。

REVELIO 是一個旨在系統性識別視覺語言模型 (VLM) 可解釋失效模式的新框架。透過結合多樣性感知束搜尋與高斯過程湯普森採樣,該框架能找出模型在特定場景(如自動駕駛或機器人技術)中持續失敗的具體原因。
OpenClaw核心維護者Josh與Vincent討論專案起源於個人需求、快速成長及支援非技術用戶。他們強調透過沙盒與社群審核的安全措施、優化提示詞控制token帳單的策略,以及多模型相容性挑戰。未來代理將自我演化,中國企業採用強勁。

ChatGPT 現允許使用者指定 Trusted Contact。OpenAI 會在 AI 偵測到自殘風險時警告該聯絡人。此功能強化對話中的使用者安全。