Search

Tag: #scientific-reasoning5 results

基準測試揭露AI科研極限

基準測試揭露AI科研極限

四項關鍵基準測試—HLE、FrontierScience、SDE 和 LABBench2—揭露 AI 在科研中的缺口,從記憶瑣碎知識到處理完整工作流程。頂尖模型如 Gemini3DeepThink 在知識上得分高,但在開放式創新和專案執行上失利。這些測試引導 AI 朝真正科學推理發展。