Search

Tag: #benchmark195 results

博士生透過 Arena 成為 AI 產業裁判

博士生透過 Arena 成為 AI 產業裁判

Arena(前身為 LM Arena)已成為前沿大型語言模型(LLM)的實際公共排行榜,由柏克萊加州大學博士生創立。短短七個月內,它從研究項目轉變為初創公司,影響 AI 資金、產品發布與公關週期,在激烈模型競爭中脫穎而出。

TechCrunch AIMediaMar 18#leaderboard#benchmark#phd-startup
AIDABench:AI 數據分析基準

AIDABench:AI 數據分析基準

AIDABench 推出超過 600 個多樣化任務,用於端到端評估 AI 在數據分析的表現,涵蓋問答、可視化及檔案生成,橫跨真實異質數據。即使頂尖模型如 Claude Sonnet 4.5 僅達 59.43% pass@1,凸顯重大挑戰。基準已在 GitHub 公開。

ArXiv AIResearchMar 18#benchmark#data-analytics
Page 11 of 20