注意 GAP:LLM 代理文字安全不轉移工具呼叫
研究人員推出 GAP 基準測試,評估 LLM 代理中文字層級安全與工具呼叫安全的差異。測試六款前沿模型橫跨六大領域,發現文字拒絕並未阻止有害工具呼叫,即使在安全強化提示下仍有 219 例持續發生。本研究呼籲需專門針對工具呼叫安全進行評估與緩解。
Tag: #safety-benchmark5 results
研究人員推出 GAP 基準測試,評估 LLM 代理中文字層級安全與工具呼叫安全的差異。測試六款前沿模型橫跨六大領域,發現文字拒絕並未阻止有害工具呼叫,即使在安全強化提示下仍有 219 例持續發生。本研究呼籲需專門針對工具呼叫安全進行評估與緩解。

研究人員建立基於醫療倫理的270條有害指令資料集,測試72個大型語言模型用於機器人健康助理控制。平均違規率達54.4%,專有模型遠比開源模型安全。微調與提示防禦僅帶來有限改善,阻礙臨床部署。

Uni-SafeBench為統一多模態大型模型(UMLMs)推出全面安全基準,涵蓋六大安全類別與七種任務類型。它使用Uni-Judger框架分離脈絡安全與內在安全,以進行嚴格評估。研究發現統一化雖提升效能,但顯著降低底層LLM的安全性,开源UMLMs表現遠遜專門模型。

BeSafe-Bench 推出基準,用於評估情境 AI 代理在網頁、手機、具身 VLM 和 VLA 功能環境中的行為安全風險。它以九類安全關鍵風險擴充任務,並採用規則檢查與 LLM 作為評審的混合評估框架。對 13 個代理的測試顯示,即使最佳代理也僅能完全安全完成不到 40% 的任務,凸顯安全對齊的迫切需求。

美國國家公路交通安全管理局(NHTSA)表示,後期推出的2026款特斯拉Model Y成為首款符合全新高級駕駛輔助系統(ADAS)安全基準的車型。新標準納入安全評級體系,旨在更系統評估多類駕駛輔助場景下的實際安全表現。