
Microsoft MAI-Image-2.5 登上 Arena 文生圖排行榜前三名
Microsoft 發布了最新的文字生成圖像模型 MAI-Image-2.5,並在 Arena 排行榜中首發即拿下第三名。此表現顯示 Microsoft 在 AI 圖像生成領域正迅速縮小與產業領先者(如 OpenAI)的差距。
Tag: #benchmark195 results

Microsoft 發布了最新的文字生成圖像模型 MAI-Image-2.5,並在 Arena 排行榜中首發即拿下第三名。此表現顯示 Microsoft 在 AI 圖像生成領域正迅速縮小與產業領先者(如 OpenAI)的差距。

OmniToM 是一個全新的基準測試,旨在透過要求明確的信念結構建模,而非僅僅評估最終答案,來評估大型語言模型(LLM)的心智理論能力。研究顯示,目前的模型在處理追蹤動態心理狀態所需的複雜知識獲取與表徵任務時仍面臨挑戰。

阿里巴巴的 Qwen 3.7 Max 與 Qwen 3 Ultra 出現在 LM Arena 排名中,顯示該公司正同時測試兩款 720 億參數的旗艦模型。

Einsia AI 的 Navers Lab 推出 Frontier-Eng Bench,這是評估 AI 代理在五大領域真實工程任務中長期優化的新基準。基準從一次性解答轉向受計算預算限制的迭代生成式優化。結果強調深度迭代推理優於廣度以實現突破。

微軟研究人員的 DELEGATE-52 基準測試 19 個 LLM 橫跨 52 個領域,揭示嚴重錯誤導致文件損壞。頂尖模型如 Gemini 3.1 Pro 在 20 次互動後丟失 25% 內容,所有模型平均劣化 50%。專家警告勿過度依賴 LLM 處理複雜工作流程,需加裝護欄。

西雅圖的 mpathic 發布 mPACT,這是由臨床醫師主導的基準測試,評估領先 AI 聊天機器人在自殺風險、飲食障礙和錯誤資訊方面的表現。評估顯示模型避免明顯傷害,但在高風險對話中表現不足。

高德的ABot體系模型以0.829總成績奪冠AGIBot全球挑戰賽,榮登榜首。此勝仗標誌空間智能「具身化」的重大躍遷。

Partial Evidence Bench 推出一個確定性基準,用於測量代理系統在授權限制證據下的失效模式。它包含 72 個任務,涵蓋盡職調查、合規審計及安全事件回應情境,並配備 ACL 分割語料庫與預言機判斷。基準測試顯示無聲過濾風險高,明確失敗回報行為更安全。

CreativityBench 是評估 LLM 創意推理的新基準,透過基於可供性的工具再利用。包含 4K 實體的可供性 KB(150K+ 註解)和 14K 受限任務。對 10 款 SOTA LLM 測試顯示,在辨識部件、可供性和機制上失敗,擴展與 CoT 改善有限。

Apple 推出 SFI-Bench,一個基於影片的基準測試,包含超過 1700 個來自多樣自我中心室內影片掃描的問題。它評估多模態 LLM 的高階空間-功能智能,超越 VSI-Bench 等基本幾何感知。該基準填補通往真實世界代理應用之扎實智能的差距。