Search

Tag: #benchmark195 results

Multilingual Reasoning Gym:14 種語言推理環境

Multilingual Reasoning Gym:14 種語言推理環境

Apple 的 Multilingual Reasoning Gym 擴展原 Reasoning Gym,能在 14 種語言生成可驗證推理問題。它包含 94 項任務的翻譯模板,由母語人士在 10 種語言驗證,並調整以確保語言自然性。此健身房保留程序化生成無限實例與可調難度,適合強化學習。

Apple Machine LearningOfficialMar 13#multilingual#reasoning#benchmark
Qwen3.5-9B GGUF 量化 KLD 排名

Qwen3.5-9B GGUF 量化 KLD 排名

Qwen3.5-9B 的 46 種 GGUF 量化全面比較,使用 KLD 與 PPL 對 BF16 基準。頂級選擇:bartowski IQ4_XS (VRAM 受限最低 KLD)、Q4_K_S,以及 unsloth UD-Q3_K_XL 效率最佳。揭示 bartowski 與 unsloth Q4_K_M 等量化器差異。

Reddit r/LocalLLaMACommunityMar 11#quantization#kld#ppl
LifeBench:長視野多源記憶基準

LifeBench:長視野多源記憶基準

LifeBench 推出全新基準,用於評估 AI 代理的長期記憶,整合宣告式與非宣告式記憶類型,來自多樣數位痕跡。它利用社群調查與地圖 API 等真實世界先驗確保資料品質,並透過認知科學啟發的事件階層實現可擴展性。頂尖記憶系統僅達 55.2% 準確率,凸顯長視野擷取挑戰。

AgentSelect:敘事查詢代理推薦基準

AgentSelect:敘事查詢代理推薦基準

AgentSelect 推出用於基於敘事查詢推薦 LLM 代理配置的基準,解決缺乏查詢條件監督的問題。它彙總來自 40 多個來源的 111,179 個查詢、107,721 個代理和 251,103 個互動記錄,轉換為統一資料。分析顯示從密集頭重用轉向長尾監督,並強調內容感知能力匹配的必要性。

ArXiv AIResearchMar 5#llm-agents#benchmark#recommendation
EmCoop:LLM代理具身合作基準

EmCoop:LLM代理具身合作基準

EmCoop 是一個用於研究基於 LLM 的具身多代理系統合作的新框架與基準。它將高層認知協調與低層具身互動分離,以分析隨時間推移的合作動態。該框架包含程序級指標,並在支援多樣代理數量與通訊拓撲的可擴展環境中實例化。

ArXiv AIResearchMar 3#multi-agent#embodied-ai#benchmark
HumanMCP:評估MCP工具檢索的人類般查詢資料集

HumanMCP:評估MCP工具檢索的人類般查詢資料集

HumanMCP 是第一個大規模、多樣化的人類般使用者查詢資料集,用於評估 MCP 伺服器的工具檢索效能。它涵蓋 308 個伺服器的 2800 個工具,基於 MCP Zero 建置,每個工具有多個獨特使用者角色,捕捉從精確到模糊的意圖。這解決了現有基準測試缺乏真實使用者互動的缺口。

ArXiv AIResearchMar 2#dataset#benchmark#tool-retrieval
Page 12 of 20