
NVIDIA AVO 在 ARC-AGI-3 達成 100%
NVIDIA 表示,其 AVO 代理架構在 ARC-AGI-3 上達成 100% 分數。這項更新凸顯了環繞語言模型的代理 harness 如何改善上下文處理、工具使用、狀態管理、回饋處理與長期任務執行能力。
Tag: #benchmarks166 results

NVIDIA 表示,其 AVO 代理架構在 ARC-AGI-3 上達成 100% 分數。這項更新凸顯了環繞語言模型的代理 harness 如何改善上下文處理、工具使用、狀態管理、回饋處理與長期任務執行能力。

報告指出,中國的 GLM-5.2 AI 模型在網路安全相關任務中已達到與 Anthropic 的 Claude Mythos 相當的效能。此進展凸顯了全球 AI 實驗室之間技術差距的縮小。

小米推出開源 MiMo-V2.5 和 V2.5-Pro 模型,採用 MIT 授權,可於 Hugging Face 下載用於商業應用。它們在如 OpenClaw 的代理「爪」任務中領先,Pro 版達 63.8% 成功率僅用 ~70K 令牌,比 Claude 或 GPT 少 40-60%。具 310B 參數與 1M 令牌上下文,挑戰閉源前沿模型。

OpenAI的GPT Image 2上線12小時內橫掃三個Arena榜單:文生圖、單圖編輯、多圖編輯。實現「全勝」,大幅領先Google等對手。此為奧特曼5個月前「紅色警戒」後的成果。

Qwen 3.6 27B 在 Artificial Analysis 的代理指數上與 Sonnet 4.6 不相上下,超越 Gemini 3.1 Pro Preview、GPT 5.2、GPT 5.3 和 MiniMax 2.7。它在所有指數上都有進步,訓練重點放在如 OpenClaw/Hermes 的代理應用。小型模型逼近前沿性能,122B 版本可能更強。

Moonshot AI 已開源其 Kimi K2.6 模型。它引入更強的多代理協作功能。該模型在關鍵基準測試中匹配頂級閉源模型。

DeepSeek 洽談3億美元融資,投後估值達100億美元。V4基準測試洩露,MMLU-Pro 91.2、AIME 2025 96.4、SWE-bench 59.6 領先業界。發布延遲,因MoE架構從CUDA遷移至華為昇騰晶片。

Anthropic 推出 Claude Opus 4.7,其最強通用模型在 SWE-bench Pro 達 64.3%(優於 GPT-5.4 的 57.7%),支援長時程多代理協調、3 倍影像解析度,以及代理推理提升 14% 並減少工具錯誤。定價:每百萬 token 輸入 $5/輸出 $25。

繼HappyHorse之後,阿里另一款模型登頂WorldArena權威評測榜單。

GLM 5.1 在開源模型的程式碼競技場排行中奪得首位。此消息由 u/Auralore 在 Reddit r/LocalLLaMA 分享,引發社群討論。