Search

Tag: #ai-benchmarks13 results

前沿模型生產嘗試三分之一失敗

前沿模型生產嘗試三分之一失敗

史丹佛HAI第九屆AI指數報告指出,前沿AI模型在生產嘗試中約三分之一失敗,儘管基準測試有顯著進展。「鋸齒前沿」描述其不均勻表現,能在IMO奪金牌卻無法可靠報時。企業AI採用率達88%,代理基準如SWE-bench(近100%)及Cybench(93%)有進步。

基準測試揭露AI科研極限

基準測試揭露AI科研極限

四項關鍵基準測試—HLE、FrontierScience、SDE 和 LABBench2—揭露 AI 在科研中的缺口,從記憶瑣碎知識到處理完整工作流程。頂尖模型如 Gemini3DeepThink 在知識上得分高,但在開放式創新和專案執行上失利。這些測試引導 AI 朝真正科學推理發展。

Page 1 of 2