
ARMOR 2025:軍事對齊 LLM 安全基準
ARMOR 2025 推出軍事對齊基準,用於評估國防應用中 LLM 的安全性,基於戰爭法、交戰規則及聯合倫理規範。採用 OODA 框架的 12 類分類,包含 519 個基於教義的提示。對 21 個商業 LLM 的評估顯示安全對齊的關鍵缺口。
Tag: #benchmark195 results

ARMOR 2025 推出軍事對齊基準,用於評估國防應用中 LLM 的安全性,基於戰爭法、交戰規則及聯合倫理規範。採用 OODA 框架的 12 類分類,包含 519 個基於教義的提示。對 21 個商業 LLM 的評估顯示安全對齊的關鍵缺口。

PExA 將 text-to-SQL 重新表述為軟體測試覆蓋率,使用平行原子 SQL 測試案例確保語義覆蓋。僅在探索足夠資訊後生成最終 SQL,解決 LLM 代理的延遲-效能權衡問題。在 Spider 2.0 基準測試中達成 70.2% 執行準確率新 SOTA。

開源27B-32B模型在Terminal-Bench 2.0上測試,Qwen 3.6-27B在預設超時下得分38.2%。此表現相當於2025年底的雲端前沿模型如Claude Opus 4.1。MOE模型推理速度大幅提升。

AgentSearchBench 推出一個使用近 10,000 個來自多供應商的真實世界代理的大型基準測試,用於 AI 代理搜尋。它將搜尋形式化為可執行和高階查詢下的擷取與重新排序,並透過執行基礎效能評估。實驗顯示語意方法不足,而執行感知探測可提升排序品質。
ClawBench 在 144 個即時網站測試 AI 代理的 153 個日常任務。最佳 Claude Sonnet 4.6 得分 33.3%,GLM-5 為 24.2%。具真實網站、行為資料、安全評估與互動排行榜。

XpertBench 推出 1,346 個專家策劃的任務,涵蓋金融、醫療等 80 個專業領域,用以評估 LLM 在複雜開放任務上的表現。採用詳細評分表與 ShotJudge,這是一種使用少樣本範例校準的 LLM 評判方法,以減輕偏差。頂尖 LLM 僅達 66% 最高成功率,凸顯「專家差距」。

Gemma 4 31B 在 FoodTruck Bench 上達到 100% 存活率與 +1,144% 中位 ROI,超越 GPT-5.2、Gemini 3 Pro 及所有測試的中國開源模型。只有 Opus 4.6 勝過它,但成本高 180 倍,為每次 0.20 美元。在 22 個測試模型中具最佳成本效能比。
基準測試顯示 Gemma-4-31B 使用 TurboQuant KV 快取壓縮,在單張 RTX 5090 上實現完整 256K 上下文。速度從 4K 的 3,362 t/s 到 256K 的 899 t/s,生成速度為 61.5 t/s。VRAM 使用量峰值 27.7GB,得益於 4.5 倍 KV 壓縮。
4月3日,全球大模型盲測榜單 LMArena 旗下 Code Arena 公布新一期程式設計能力排名。阿里巴巴大語言模型 Qwen 3.6-Plus 位列全球第二,為中國大模型中最高。

中國 AI 新創 GigaAI 的 GigaWorld-1 登上 WorldArena 世界模型全球排行榜首位。它超越 Google 和 Nvidia 等科技巨頭。這是中國公司在先進 AI 模擬領域的重要成就。