Search

Tag: #dataset24 results

HumanMCP:評估MCP工具檢索的人類般查詢資料集

HumanMCP:評估MCP工具檢索的人類般查詢資料集

HumanMCP 是第一個大規模、多樣化的人類般使用者查詢資料集,用於評估 MCP 伺服器的工具檢索效能。它涵蓋 308 個伺服器的 2800 個工具,基於 MCP Zero 建置,每個工具有多個獨特使用者角色,捕捉從精確到模糊的意圖。這解決了現有基準測試缺乏真實使用者互動的缺口。

ArXiv AIResearchMar 2#dataset#benchmark#tool-retrieval
CogARC數據集揭示人類ARC策略

CogARC數據集揭示人類ARC策略

研究人員推出CogARC,這是ARC的適應人類子集,包含75個視覺推理任務,由260名參與者測試,準確率約85%。高解析度數據記錄觀看、編輯和嘗試,顯示困難問題上的多樣策略,即使錯誤解決方案也趨於收斂。發現突顯人類在不確定性下的泛化,為AI基準測試提供洞見。

ArXiv AIResearchFeb 27#abstract-reasoning#human-ai#dataset
📰

125k 程式碼資料集發布

一個涵蓋 8 種語言的 125k 程式碼資料集已在 Hugging Face 上發布,用於訓練和升級程式碼模型。使用隱藏的 Hunter Alpha 模型免費生成。完整 450k 版本即將推出,並開放合作。

Reddit r/LocalLLaMACommunityMar 16#dataset#sft#fine-tuning
Gemini 38 天預測資料集發布

Gemini 38 天預測資料集發布

38 天資料集記錄 Gemini 每日股票預測、理由、情緒與信心,涵蓋 10 天展望。時間鎖定,已上傳 Hugging Face 並附互動儀表板與 Colab 筆記本。研究 LLM 在不確定性下的穩定性、敘事漂移與校準。

Reddit r/MachineLearningCommunityMar 13#dataset#forecasting#llm-stability
EduEVAL-DB:AI家教評估資料集

EduEVAL-DB:AI家教評估資料集

EduEVAL-DB 推出一個包含 854 個解釋的資料集,對應 ScienceQA 基準的 139 個 K-12 年級問題,包括一位真人教師和六個 LLM 模擬教師角色解釋。它具備教學風險評分表,涵蓋事實正確性、解釋深度、焦點相關性、學生適當性和意識形態偏見,經半自動專家審核標註。初步基準測試比較 Gemini 2.5 Pro 與微調 Llama 3.1 8B 在消費者硬體上的風險偵測效能。

Page 2 of 3