
Hugging Face 推出 Open Agent Leaderboard
Hugging Face 推出了 Open Agent Leaderboard,旨在評估並排名自主 AI 代理。該平台致力於為代理工作流程提供透明度與標準化的基準測試。
Tag: #benchmarking171 results

Hugging Face 推出了 Open Agent Leaderboard,旨在評估並排名自主 AI 代理。該平台致力於為代理工作流程提供透明度與標準化的基準測試。

MathAtlas 是一個包含 52,000 筆研究所等級數學內容(如定理、定義與證明)的大型基準測試。它引入了數學依賴圖,旨在測試模型在處理複雜、多步驟數學結構時的推理能力。

ClawForge 是一個新的基準測試框架,旨在透過模擬真實且持久的狀態衝突來評估指令列代理。它測試代理如何處理部分或過時的檔案,結果顯示目前的頂尖模型在採取行動前檢查現有狀態的能力仍有待加強。

研究人員分析了 2025 年 11 家主要 AI 開發商的 231 項基準測試,發現大多數基準測試僅被使用一次,且更多是作為行銷工具而非標準化科學指標。該研究指出模型評估缺乏跨模型的可比性,且開發商傾向於將基準測試作為市場定位手段,而非嚴謹的科學評估。

SpecMD 是一個標準化框架,用於在各種硬體配置上基準測試 Mixture-of-Experts (MoE) 模型的臨時快取策略。它解決了快取如何與稀疏性和硬體規格互動的知識缺口。這能將 MoE 的稀疏激活轉化為實際效能提升。

MobiFlow 是用於任意第三方應用程式任務的行動代理全新評估框架。它採用基於多軌跡融合的圖形建構演算法,有效壓縮狀態空間並支援動態互動。涵蓋 20 款應用程式與 240 項任務,比 AndroidWorld 更符合人類評估。
對微調服務進行成本、速度與使用者體驗的基準測試,用於自訂模型。Nebius 在函數呼叫效率上表現出色。領域快速演變;完整分析連結提供。

完整基準測試 AI 代理成本高昂,因需互動執行與工具使用。研究顯示,使用歷史通過率 30-70% 的中難度任務子集,可大幅降低評估任務數 44-70%,同時維持代理排名穩定。此協議優於隨機抽樣,並應對 scaffold 偏移。

Speechos 是一款開源工具,用於並排基準測試本地 STT、TTS、情緒偵測及說話者分離模型。支援 25+ 引擎如 faster-whisper、Piper、Bark 和 Qwen3-TTS,並具備從 CPU 到 GPU 的硬體適應設定。MIT 授權的 GitHub 儲存庫含快速啟動開發腳本。

一項新研究發現,LLM 往往能與人類的道德判斷標籤一致,卻依賴不同的倫理原則與情境假設。研究團隊使用包含 500 個題目的 ETHICS 衍生基準,主張評估真正的對齊程度必須分析模型的推理依據。