Search

Tag: #agentic-ai513 results

醫療保健 AI 可靠性基準測試

醫療保健 AI 可靠性基準測試

新 arXiv 論文指出,現有 AI 基準測試無法衡量醫療保健真實工作流程中的可靠性、安全性及臨床相關性。先進模型在考試中表現出色,但在文件記錄(0.74-0.85)、臨床決策支援(0.61-0.76)及行政任務(0.53-0.63)上得分低落。呼籲建立原則性框架,以彌補效能與實用性差距。

ArXiv AIResearchMay 13#healthcare-ai#benchmarks#agentic-ai
LLM 在多步驟編輯中損壞文件

LLM 在多步驟編輯中損壞文件

微軟研究人員的 DELEGATE-52 基準測試 19 個 LLM 橫跨 52 個領域,揭示嚴重錯誤導致文件損壞。頂尖模型如 Gemini 3.1 Pro 在 20 次互動後丟失 25% 內容,所有模型平均劣化 50%。專家警告勿過度依賴 LLM 處理複雜工作流程,需加裝護欄。

ComputerworldMediaMay 13#benchmark#agentic-ai#llm-reliability
Page 15 of 52