Search

Tag: #benchmark195 results

BotzoneBench:可擴展 LLM 遊戲評估

BotzoneBench:可擴展 LLM 遊戲評估

BotzoneBench 提供可擴展框架,利用固定技能校準遊戲 AI 階層評估 LLM 在遊戲中的策略推理能力。它避免 LLM 對戰賽的二次方成本與不穩定性,提供絕對線性時間測量。在八種多樣遊戲中,評估來自五個旗艦模型的 177,047 個狀態-動作對,突顯性能差距。

ArXiv AIResearchFeb 17#research#botzonebench#llm
C4 測試 MLLM 的創意解碼能力

C4 測試 MLLM 的創意解碼能力

研究人員推出受認知科學啟發的 C4 框架,用於評估多模態大型語言模型解碼非直觀概念關係的能力。其 C4-Eval 基準包含 221 道跨概念成語題目,結果顯示頂尖閉源模型的主要準確率最高僅達 50.7%。

ArXiv AIResearchAug 10#creative-reasoning#benchmark
Page 14 of 20