
開源模型AI安全基準失利
中國前瞻安全基準評測Anthropic的Claude-4.5最安全,DeepSeek-V3.2-Speciale推理強但脆弱。揭示「對齊稅」,能力提升不自動改善安全。呼籲開源超越性能注重安全。
Tag: #benchmark195 results

中國前瞻安全基準評測Anthropic的Claude-4.5最安全,DeepSeek-V3.2-Speciale推理強但脆弱。揭示「對齊稅」,能力提升不自動改善安全。呼籲開源超越性能注重安全。

北航研究團隊開源 Code2Bench,使用雙重擴展動態基準,對抗碼大語言模型的資料污染與測試嚴謹性不足。它產生新鮮題目與嚴苛測試,揭露超越記憶高分的真實泛化能力。論文獲 ICLR 2026 接收,榜單上線。
AgentLAB 是首個評估 LLM 代理對自適應長時程攻擊漏洞的基準測試,透過多輪互動進行。涵蓋五種攻擊類型——意圖劫持、工具鏈接、任務注入、目標漂移、記憶中毒——橫跨 28 個環境與 644 個測試案例。評估顯示代理高度易受攻擊,單輪防禦無法有效緩解威脅。
January Mirror,一個基於證據的臨床推理系統,在2025內分泌委員會風格的120題考試中獲得87.5%準確率,超越人類專家(62.3%)和前沿LLM如GPT-5.2(74.6%)。它在最難題目上表現出色(76.7%準確率),在無網路存取的封閉證據限制下運行。輸出提供可追溯的指南引用,準確率100%。
ResearchGym 推出一個基準,包含來自 ICML、ICLR 和 ACL 論文的五個容器化環境,總共 39 個子任務,代理需提出假設並執行實驗以超越基準。GPT-5 驅動的代理顯示能力-可靠性差距,仅在 6.7% 的評估中成功,並平均完成 26.5% 的子任務。它識別關鍵失敗模式,如不耐煩和資源管理不善,偶爾不可靠地達成 SOTA 成果。

DiG-bench 是一項全新的基準測試,用於評估 AI 代理能否透過實驗發現未知規則並提出新穎概括。基準包含 70 款分為七個難度級別的獨立遊戲,其中 21 款公開發布,其餘遊戲保留作安全評估。

Zhipu AI 在首席科學家 Tang Jie 預告即將發布後不久推出 GLM-5.3。這款專注於程式設計與安全性的模型,在 SWE-Marathon 獲得 42.5 分、Terminal Bench 3.0 獲得 28.3 分,並在 CyberGym 獲得 84.5 分。

據報導,一個尚未公開的 Claude 模型在百年黎曼猜想相關研究中創下新紀錄。這項成果重點在於大幅提高已驗證的下界,而非證明該猜想成立。

FinProBench 推出 Role-Grounded Rubric Construction(RGRC),從同一職務專業人士製作的交付成果中建立評測標準。在涵蓋 57 種職業的測試中,RGRC 在專業化職務上的提升最為顯著,表現達 99.1%,高於僅依提示建立評分規準的 78.0%。

MMShopBench 是一套使用影像、對話與產品資料,評估多模態多輪購物代理的真實紀錄基準。研究同時提供離線購物沙盒與訓練集,顯示微調可大幅縮小開源模型與專有模型之間的效能差距。