
Alibaba 推出 Qwen-UI-Agent 挑戰頂尖 GUI 模型
Alibaba 推出 Qwen-UI-Agent,這是一款以真實世界任務為核心的 GUI 智能體基座模型,支援行動端、電腦端、網頁端及 DeepSearch 環境。報導稱,該模型在行動端基準測試中超越 GPT 5.6 與 Claude Opus 4.8。
Tag: #benchmark195 results

Alibaba 推出 Qwen-UI-Agent,這是一款以真實世界任務為核心的 GUI 智能體基座模型,支援行動端、電腦端、網頁端及 DeepSearch 環境。報導稱,該模型在行動端基準測試中超越 GPT 5.6 與 Claude Opus 4.8。

研究人員推出一個開源基準,將奧林匹克幾何題求解能力與精準繪製圖形的能力分開評估。在 954 道題目上,現有基礎模型的圖形平均編譯成功率僅為 36.14%,顯示數學推理與忠實視覺構建之間存在顯著差距。

據稱,一款未具名工具能讓 DeepSeek V4-Pro 看似擊敗 Fable 5,但其他使用者無法重現這項結果。這項優勢可能伴隨 Token 消耗翻倍的代價。

Aurora-80K 是一個恰好具備 80,000 個參數的微型語言模型,採用因式分解的 4,096 token 詞彙表。其公布結果包括 Wikitext-2 BPB 3.2902、BLiMP 準確率 52.31%,以及 ARC-Easy 26.05%。

據報導,智譜精準對準 DeepSeek,並在八項基準測試中贏得七項。文章認為,更關鍵的競爭在於雙方不同的自進化策略,而長期成果仍未見分曉。

又名 Z.ai 的 Zhipu 發表旗艦模型 GLM-5.3。該公司表示,GLM-5.3 在 CyberGym 上達到 84.5% 的成功率,略高於 Anthropic Mythos 5 的 83.8%。

螞蟻集團發布了開源模型 Bailing Ring-2.6-1T,其智能體執行能力獲得顯著增強。該模型在 AIME 26 基準測試中取得了 95.83 分的成績。

Zojian Power、北京大學及CUHK聯合研究提出LaST-R1,一種新的具身AI物理推理範式。在LIBERO基準測試中達到99.9%成功率,比π0.5在真實世界任務中高出22.5%。
Meta Superintelligence Lab 推出 ProgramBench 基準測試,挑戰 SOTA AI 模型無需網路存取,從零重建如 ffmpeg、SQLite 和 ripgrep 等複雜可執行程式。Reddit 貼文強調此 AI 程式合成能力評估。質疑當前頂尖模型能否達成。

SWE-Bench 創作者推出 ProgramBench,新基準測試 AI 僅用文件從零重建如 FFmpeg 等真實軟體專案的能力。Claude Opus 4.7、GPT-5 變體及 Gemini 3.1 等頂級模型在完整行為等價上得 0%。這暴露 AI 在全局系統規劃而非局部程式碼生成上的弱點。