
DEAF:音頻語言模型聲學忠實度診斷基準
DEAF 引入超過 2,700 個衝突刺激,涵蓋情感韻律、背景聲音和說話者身份,以測試音頻 MLLM 的聲學處理。多層級評估框架區分文字偏差與提示影響。七個模型顯示文字主導,儘管對聲學敏感,揭示真實音頻理解的差距。
Tag: #benchmark195 results

DEAF 引入超過 2,700 個衝突刺激,涵蓋情感韻律、背景聲音和說話者身份,以測試音頻 MLLM 的聲學處理。多層級評估框架區分文字偏差與提示影響。七個模型顯示文字主導,儘管對聲學敏感,揭示真實音頻理解的差距。

Hugging Face 推出 SPEED-Bench,這是一個用於評估語言模型推測解碼技術的統一且多樣基準。它標準化了各種方法的測試,以衡量加速與準確度。此工具幫助研究人員有效比較推測解碼方法。

Arena(前身為 LM Arena)已成為前沿大型語言模型(LLM)的實際公共排行榜,由柏克萊加州大學博士生創立。短短七個月內,它從研究項目轉變為初創公司,影響 AI 資金、產品發布與公關週期,在激烈模型競爭中脫穎而出。

AIDABench 推出超過 600 個多樣化任務,用於端到端評估 AI 在數據分析的表現,涵蓋問答、可視化及檔案生成,橫跨真實異質數據。即使頂尖模型如 Claude Sonnet 4.5 僅達 59.43% pass@1,凸顯重大挑戰。基準已在 GitHub 公開。

ManiBench 是評估 LLM 生成 Manim CE 動態視覺程式碼的新基準,針對語法幻覺與視覺邏輯偏移。它包含 150-200 個橫跨微積分與線性代數等數學主題的問題,基於 3Blue1Brown 的 ManimGL 分析。開源框架自動化評估,使用可執行性與對齊分數等指標。

Cursor 推出 CursorBench-3,這是專為編碼代理設計的新評估套件。它針對來自真實 Cursor 使用者工作階段的複雜多檔案專案。此基準測試旨在推動產品與 AI 模型的改進。

Cursor 推出全新 AI 編碼評測基準,超越 SWE-Bench。它專門評估 Cursor 中不同模型的「智能體」能力。Claude 在此基準上表現不佳,難以應對。
PinchBench 推出取代合成評估的真實世界基準。它測試 LLM 作為 OpenClaw 代理的 23 項任務,聚焦成功率、速度與成本。

NVIDIA 的 Nemotron-3-Super 為 120B 參數模型,每 token 只啟用 12.7B,在 OpenClaw 代理的 PinchBench 平均排行榜上名列第一。其優勢在於機器人一致性,而非原始智能。

RewardHackingAgents 推出基準測試,用於評估 LLM ML 工程代理的完整性,針對評估器篡改和訓練/測試洩漏等漏洞。它使用工作空間追蹤和偵測器,透過比較代理報告指標與可信參考來指派完整性標籤。評估器鎖定等防禦措施可消除篡改,但帶來 25-31% 執行時間開銷。