Qwen Code 執行 SWE-bench 與 Terminal-Bench
Qwen Code 宣布使用 Benchmark-Qwen-Ref v0.21.12 執行完整端到端基準測試。評估將先涵蓋 500 個 SWE-bench Verified 案例,待 SWE 結果成功發布後,再執行 89 個 Terminal-Bench 2.0 案例。
Tag: #benchmarking171 results
Qwen Code 宣布使用 Benchmark-Qwen-Ref v0.21.12 執行完整端到端基準測試。評估將先涵蓋 500 個 SWE-bench Verified 案例,待 SWE 結果成功發布後,再執行 89 個 Terminal-Bench 2.0 案例。

AOE Tech Labs 表示,其 Floatboat Harness 讓 DeepSeek-V4-Flash 在五項測試基準中全部擊敗 Claude Opus 4.8。這項單一變因實驗只更換執行 Harness,並使用相同的 0.14 美元模型,成本低至 57.1 分之一。

Xiaomi 已開源具身 AI 基礎模型 Xiaomi-Robotics-1。此次發布涵蓋從真實機器人後訓練到模型部署的完整流程,並提供相關基準測試的程式碼。
全新的「Schema」評測工具透過優化模型與遊戲環境之間的互動流程,提升了在 ARC-AGI-3 基準測試上的表現。它利用 Claude Opus 4.8 和 Fable 5,在不修改模型權重的情況下達到了 99% 的準確率。

透過 63 道複雜提示詞測試,GPT-5.6 Sol Ultra 在生成細節豐富且具互動性的 3D 網頁環境方面,顯著優於其他模型。

目前的安全性評測基準已無法準確衡量前沿 AI 模型不斷演進的駭客能力。這導致安全團隊與監管機構缺乏可靠的工具來評估先進系統所帶來的風險。

MemoBench 是一個全新的診斷基準,旨在測試世界模型在動態環境中維持物體恆存與狀態演化的能力。研究顯示,目前的影片生成模型在物體被遮擋期間,難以準確追蹤並更新其狀態。

北京新創公司 Zhipu AI 發布了 GLM-5.2,該模型在網路安全漏洞檢測任務中展現出與 Anthropic 的 Claude Opus 4.8 相當的競爭力。此進展凸顯了中國 AI 模型與美國頂尖模型之間的差距正在縮小。

First Proof計畫針對四個AI系統進行了原創且未公開的研究級數學題測試,結果顯示儘管AI表現亮眼,但在整體研究能力上仍落後於頂尖人類數學家。

Sina Weibo 的研究人員推出了 VibeThinker-3B,這是一款 30 億參數的模型,據稱其推理能力可媲美甚至超越大型旗艦模型。此發布在 AI 社群中引發了關於當前基準測試有效性的激烈爭論。