
Papers with Code 新增 SOTA 徽章與外部評估功能
Papers with Code 平台新增了 SOTA 徽章、基於 Hugging Face 資源的全新趨勢指標,以及對第三方評估結果的支援。這些更新旨在提升研究的可發現性,並提供更全面的模型效能檢視。
Tag: #benchmarking171 results

Papers with Code 平台新增了 SOTA 徽章、基於 Hugging Face 資源的全新趨勢指標,以及對第三方評估結果的支援。這些更新旨在提升研究的可發現性,並提供更全面的模型效能檢視。

ForecastBench-Sim 是一個用於 AI 預測的新基準測試,利用 Freeciv 遊戲模擬來克服現實世界的數據限制。它使研究人員能夠針對動態、可立即解析且具反事實性的場景測試 AI 的機率推理能力。
OpenAI 推出了 LifeSciBench,這是一個專門設計用於評估 AI 模型在複雜、真實生命科學研究任務中表現的基準測試。該基準包含由專家撰寫與審核的內容,以確保對科學決策能力的評估品質。

Hugging Face 推出了 olmo-eval,這是一個專為簡化 AI 模型開發生命週期中的評估流程而設計的工作台。該工具旨在為開發人員提供一種更整合的方法來測試和迭代其模型。

最新的基準測試顯示,智能體模型 Fable 5 在性能上未能超越 GPT 5.5。據報導,該模型在最困難的評估任務中得分為零。

該研究提出 DAF-AGI 框架,旨在解決 AGI 定義模糊與評估標準不一的問題。透過結構化的治理審計與五項序數標準,該框架能更客觀地驗證各類 AGI 性能聲明。
Lemonade v10.7 引入了用於全模態對話的 LMX-Omni 虛擬模型,並增加了跨供應商的 GPU 加速支援。此版本還包含一個用於比較不同後端 LLM 效能的基準測試工具。
Hugging Face 探討了現有的語音代理如何處理在句中切換語言的雙語使用者。該研究為評估真實多語言場景下的 ASR 模型提供了基準測試。

CrowdMath 是一個包含 164 個經專家標註的協作數學研究討論鏈的新數據集。它旨在彌補解決明確定義問題與開放式問題解決過程中複雜、迭代過程之間的差距。

各大 AI 模型正接受 2026 年全國高考作文題目的測試,包含北京卷與上海卷。評估重點在於這些模型如何處理科技發展與社會進步等複雜議題。