
阿里高德發布SpatialGenEval文生圖基準
阿里巴巴高德團隊推出SpatialGenEval,一個針對文生圖模型空間智能的全面基準,已被ICLR 2026錄用。它使用長文本、高資訊密度提示詞,評估空間感知、推理與互動的10大維度,涵蓋25個真實應用場景。對23個SOTA模型的測試顯示當前文生圖能力仍有重大缺陷。
Tag: #benchmark195 results

阿里巴巴高德團隊推出SpatialGenEval,一個針對文生圖模型空間智能的全面基準,已被ICLR 2026錄用。它使用長文本、高資訊密度提示詞,評估空間感知、推理與互動的10大維度,涵蓋25個真實應用場景。對23個SOTA模型的測試顯示當前文生圖能力仍有重大缺陷。

OpenAI 的 GPT 模型通過日本獸醫國家考試。「o3」模型達到 92.9% 正確率。即使未經提示最佳化,在日文原題上也表現出色。
BotzoneBench 提供可擴展框架,利用固定技能校準遊戲 AI 階層評估 LLM 在遊戲中的策略推理能力。它避免 LLM 對戰賽的二次方成本與不穩定性,提供絕對線性時間測量。在八種多樣遊戲中,評估來自五個旗艦模型的 177,047 個狀態-動作對,突顯性能差距。

LangChain 在 145 個 agent 任務上測試 NVIDIA NeMo Switchyard,發現只有 7% 的互動回合需要 frontier model。智慧路由可降低 74% 成本,但需承擔六個百分點的準確率取捨。

研究人員推出受認知科學啟發的 C4 框架,用於評估多模態大型語言模型解碼非直觀概念關係的能力。其 C4-Eval 基準包含 221 道跨概念成語題目,結果顯示頂尖閉源模型的主要準確率最高僅達 50.7%。

針對中國三大桌面 AI 智能體(豆包、WorkBuddy、QoderWork)進行橫向評測,從本地電腦操控、資訊整合、跨設備連接等 8 個關鍵維度進行分析。
一家機器學習新創公司正在尋找合適的研討會,以發表其最新的建築 BIM(建築資訊模型)基準測試。該數據集包含專業級的項目級工程量清單,並納入了 GPT、Kimi 等多種大型語言模型的效能比較。
一份針對小型 TTS 模型進行的全面 CPU 基準測試,採用 UTMOS MOS 評分。分析重點介紹了 Kyutai 的 Pocket TTS 獨特的串流架構,以及不同推論後端之間的效能權衡。

針對 MiniMax M3 模型進行實測,測試其在面對複雜的 Nvidia 簡報時的視覺推理能力。實測結果展示了該模型處理與理解高密度視覺資訊的能力。

Scale Labs 推出重構排行榜。它聚焦 AI 程式碼代理在重構複雜程式碼庫的能力。此基準測試評估程式碼重構任務表現。