Search

Tag: #benchmark195 results

ConstraintBench:LLM 最佳化基準測試

ConstraintBench:LLM 最佳化基準測試

ConstraintBench 推出一個基準測試,用於評估 LLM 在 10 個營運研究領域中直接解決約束最佳化問題,無需求解器。對六個前沿模型在 200 個任務上的評估顯示,可行性是主要瓶頸,最佳模型僅達 65% 約束滿足率,但聯合最佳性低。基準測試與評估工具將公開發布。

PreScience:科學貢獻預測基準

PreScience:科學貢獻預測基準

PreScience 推出一個基準測試,讓 AI 透過四項任務預測科學進展:合作者預測、先前工作選擇、貢獻生成及影響預測。它使用 98K 篇 AI 論文資料集,涵蓋總計 502K 篇論文及元資料。先進 LLM 表現中等,生成的合成研究較缺乏多樣性。

ArXiv AIResearchFeb 25#benchmark#forecasting#scientific-ai
SourceBench:AI 是否引用優質網路來源?

SourceBench:AI 是否引用優質網路來源?

SourceBench 推出一個基準測試,用以評估大型語言模型(LLM)在各種意圖的 100 個真實世界查詢中引用的網路來源品質。它採用八項指標框架,評估內容相關性、事實準確性、客觀性、新鮮度、權威性和清晰度,並以人工標註資料集和校準的 LLM 評估器為後盾。此基準測試了八個 LLM、Google Search 和三個 AI 搜尋工具在 3996 個來源上的表現,揭示了 GenAI 和網路搜尋的關鍵洞見。

LLM-WikiRace 揭示 LLM 規劃限制

LLM-WikiRace 揭示 LLM 規劃限制

LLM-WikiRace 是一個新基準,用於評估大型語言模型透過維基百科超連結從來源頁面導航至目標頁面的長期規劃與推理能力。先進模型如 Gemini-3、GPT-5 和 Claude Opus 4.5 在簡單層級表現出色,但在困難層級成功率僅 23%。分析顯示,知識僅是必要條件,超過門檻後規劃能力主導,且頂尖模型在錯誤後難以重新規劃。

ArXiv AIResearchFeb 20#benchmark#planning#reasoning
Page 13 of 20