
MEDLEY-BENCH:規模提升評估而非控制
MEDLEY-BENCH 推出 AI 元認知基準測試,將推理、私人自我修正及社會影響修正分離,在模型間真實分歧下進行評估。它評估 12 個家族的 35 個模型,橫跨五個領域,顯示規模提升評估能力但非控制能力。小型模型常匹敵或超越大型模型,挑戰規模為元認知唯一途徑的觀念。
Tag: #ai-benchmark7 results

MEDLEY-BENCH 推出 AI 元認知基準測試,將推理、私人自我修正及社會影響修正分離,在模型間真實分歧下進行評估。它評估 12 個家族的 35 個模型,橫跨五個領域,顯示規模提升評估能力但非控制能力。小型模型常匹敵或超越大型模型,挑戰規模為元認知唯一途徑的觀念。

AutomationBench 推出評估 AI 代理跨應用程式工作流程的基準測試,透過 REST API 解決協調、API 發現及政策遵循的缺口。任務來自 Zapier 真實模式,涵蓋銷售、行銷、營運、支援、財務及人力資源領域。頂尖模型在程式化終態評分中低於 10%,環境包含誤導資料。

中國中山大學與阿里巴巴集團研究人員提出SWE-CI全新基準,用以評估AI長期程式碼維護能力。它彌補現有測試僅注重短期程式碼任務的不足。此基準模擬真實軟體工程情境,需要持續維持程式碼品質。

Import AI 第 446 期報導核能驅動的 LLM、中國大型新 AI 基準,以及 AI 測量與政策的關鍵發展。它也提出有趣問題:AI 會彼此嫉妒嗎?此通訊彙整尖端 AI 研究與趨勢。

LangChain 建立了 ReviewBench,這是一個使用可信任人工審查者回饋來評估程式碼審查 agent 的 benchmark。該 benchmark 旨在透過真實 pull request,讓 agent 效能評估更貼近實際情境。

美國基督教團體評 DeepSeek R1 神學可靠性最高,勝 GPT-4o、Gemini、Claude,因偏見過濾較少。凸顯中國 AI 成本優勢(5%成本換90%技術)挑戰美霸權。Anysphere 因 Cursor 用 kimi 獲利遭調查。

Anthropic 在 HumanX 會議成為 AI 討論的核心。公司是新創創辦人與風險投資人的產業標竿。