Search

Tag: #benchmark195 results

PaperOrchestra:自動化AI論文撰寫框架

PaperOrchestra:自動化AI論文撰寫框架

PaperOrchestra 是一個多代理框架,能將非結構化研究材料轉換成提交就緒的 LaTeX 稿件,包括文獻綜述與圖表視覺化。它推出 PaperWritingBench,這是首個從 200 篇頂級 AI 會議論文逆向工程的基準測試。人類評估顯示其文獻綜述品質勝出基線 50-68%,整體品質勝出 14-38%。

基督教基準揭露AI偏見

基督教基準揭露AI偏見

推出 Flourishing AI Benchmark: Christian Single-Turn (FAI-C-ST),用以評估 LLM 在基督教人類繁榮的七個維度表現。測試 20 個前沿模型顯示,相較基督教標準平均下降 17 分,在信仰與靈性維度更達 31 分。AI 預設採程序世俗主義,缺乏神學一致性。

ArXiv AIResearchApr 7#ai-alignment#benchmark#values-bias
🔬

PhAIL 基準測試:機器人 AI 僅達人類 5% 速度

PhAIL 是一個開放基準測試,用於在真實硬體上評估視覺-語言-動作 (VLA) 模型進行 bin-to-bin 訂單揀選。頂尖模型如 OpenPI 和 GR00T 分別達到 65 和 60 UPH,相比遙控操作的 330 UPH 和人類手的 1,331 UPH,平均故障間隔 (MTBF) 約 4 分鐘。所有數據、影片和提交工具均公開於 phail.ai。

Reddit r/MachineLearningCommunityApr 2#robotics#benchmark#vla
Page 9 of 20