Hugging Face 以資料科學家代理奪 DABStep 第一
Hugging Face 打造一款模仿資料科學家思考的 AI 代理,透過可重用工具生成技術。此創新讓他們在 DABStep 基準測試中奪得第一。部落格文章詳述打造高效代理的方法論。
Tag: #benchmarks166 results
Hugging Face 打造一款模仿資料科學家思考的 AI 代理,透過可重用工具生成技術。此創新讓他們在 DABStep 基準測試中奪得第一。部落格文章詳述打造高效代理的方法論。

MASEval 推出框架無關的程式庫,用於評估整個基於 LLM 的多代理系統,而非僅限模型。它評估拓撲、協調和錯誤處理等因素對基準測試的影響。結果顯示框架選擇的影響與模型選擇相當。

DeepFact 提出審計後評分(AtS)方法,創建演化基準,用於驗證搜尋增強 LLM 代理產生的深度研究報告事實性。它推出 DeepFact-Bench,一個具可審計依據的版本化基準,以及 DeepFact-Eval,一個超越現有工具的驗證代理。專家對聲明的準確率經迭代審計從 60.8% 提升至 90.9%。

《科學》探討AI科學智能超越記憶,用GPQA測試o1超80%勝專家65-70%。轉向過程審核與閉環實驗室測試驗證真推理。人類主導範式轉變儘管AI優化強。

UniPat AI 開源 UniScientist,這是 30B 參數模型,在 FrontierScience-Research 和 ResearchRubrics 等科學基準上比肩頂尖閉源模型。它具備可閉環推進的科研能力,肯定了 AI 在研究中的潛力。

OpenClaw已登頂排行榜。AI Agent將悄悄取代傳統「應用」,預測為一次有把握的典範轉移。

Qwen 3.5 模型在 AA 非思考基準測試中表現出色,397B 在智慧指數獲 40 分,僅次於 GLM-5。27B 變體達 37 分,超越 Minimax M2 並匹配推理模型。較小 35B-A3B 獲 31 分,勝過近期 Deepseek R1。
Qwen 3.5 27B 在推理和知識測試中表現出色,達到大型 R1 0528 模型水準。這挑戰了小型模型變壓器架構極限的疑慮。該模型被讚譽適合微調,儘管缺乏個性。
最新 26.02 編程能力排名強調最佳本地模型,遠超其他。完整分析見 brokk.ai 部落格。此為編程 LLM 關鍵基準。

MiniMax 回顧在 MiniMax-Text-01 中放棄混合注意力,因為在大規模多跳推理任務中出現明顯缺陷,儘管基準測試表現良好。新開源模型如 DeepSeek V3.2 和 Qwen3.5-397B-A17B 展示了高效長上下文全注意力。基準測試是洩漏抽象,隱藏了真實成本。