Search

Tag: #evaluation-framework17 results

ATANT:AI 連續性評估框架

ATANT:AI 連續性評估框架

ATANT 是一個開放框架,用於評估 AI 連續性,透過 7 項屬性定義,並採用無 LLM 的 10 檢查點方法。它包含 250 個故事語料庫,橫跨 6 個生活領域的 1,835 個驗證問題。評估在 250 故事累積模式下達到 100% 準確率,可於 GitHub 下載。

AI代理可靠性科學

AI代理可靠性科學

AI代理在基準測試上表現出色,但在實務中因單一成功指標忽略一致性、穩健性、可預測性和安全性而失敗。本 arXiv 論文提出 12 項具體指標,沿著這四個維度分解可靠性,基於安全關鍵工程。在兩個基準上測試 14 個代理模型,顯示儘管能力進步,可靠性僅有邊際改善。

Page 2 of 2