Search

Tag: #benchmarking171 results

高效 AI 代理基準測試

高效 AI 代理基準測試

完整基準測試 AI 代理成本高昂,因需互動執行與工具使用。研究顯示,使用歷史通過率 30-70% 的中難度任務子集,可大幅降低評估任務數 44-70%,同時維持代理排名穩定。此協議優於隨機抽樣,並應對 scaffold 偏移。

ArXiv AIResearchMar 26#ai-agents#benchmarking#scaffolds
一致不等於對齊

一致不等於對齊

一項新研究發現,LLM 往往能與人類的道德判斷標籤一致,卻依賴不同的倫理原則與情境假設。研究團隊使用包含 500 個題目的 ETHICS 衍生基準,主張評估真正的對齊程度必須分析模型的推理依據。

Page 10 of 18