Search

Tag: #benchmarks166 results

阿里巴巴 HappyHorse 登頂 Seedance 影片 AI

阿里巴巴 HappyHorse 登頂 Seedance 影片 AI

阿里巴巴的 HappyHorse 1.0 影片生成模型超越 ByteDance 的 Seedance 2.0,成為全球頂尖 AI 影片工具。該模型由阿里巴巴新成立的 Alibaba Token Hub 下的創新業務單位開發,目前仍處於內部 Beta 測試階段。此事揭示中國 AI 人才競賽的白熱化。

SCMP TechnologyMediaApr 10#benchmarks#china-ai#talent-race
AIRA_2 突破 AI 研究代理瓶頸

AIRA_2 突破 AI 研究代理瓶頸

AIRA_2 解決 AI 研究代理的三個瓶頸:單 GPU 限制、驗證泛化差距,以及固定 LLM 操作員。它採用異步多 GPU 工作池、隱藏一致評估協議,以及 ReAct 代理,提升產出與可靠性。在 MLE-bench-30 上,24 小時達 71.8% 百分位,72 小時升至 76.0%,超越先前最佳。

ArXiv AIResearchMar 30#ai-agents#multi-gpu#benchmarks
Anthropic 洩露 Claude Mythos 完勝 Opus

Anthropic 洩露 Claude Mythos 完勝 Opus

Anthropic 的內部文件意外洩露,揭露 Claude Mythos(代號 Capybara),這是超越 Claude Opus 4.6 的全新模型層級,在程式設計、學術推理及網路安全領域表現優異。公司確認其存在,並計劃優先提供給網路安全防禦機構,因其漏洞利用能力強大。高成本與安全考量延後公眾發布。

Page 2 of 17