Search

Tag: #benchmark195 results

AI 工程優化新基準測試

AI 工程優化新基準測試

Einsia AI 的 Navers Lab 推出 Frontier-Eng Bench,這是評估 AI 代理在五大領域真實工程任務中長期優化的新基準。基準從一次性解答轉向受計算預算限制的迭代生成式優化。結果強調深度迭代推理優於廣度以實現突破。

LLM 在多步驟編輯中損壞文件

LLM 在多步驟編輯中損壞文件

微軟研究人員的 DELEGATE-52 基準測試 19 個 LLM 橫跨 52 個領域,揭示嚴重錯誤導致文件損壞。頂尖模型如 Gemini 3.1 Pro 在 20 次互動後丟失 25% 內容,所有模型平均劣化 50%。專家警告勿過度依賴 LLM 處理複雜工作流程,需加裝護欄。

ComputerworldMediaMay 13#benchmark#agentic-ai#llm-reliability
Page 6 of 20