
阿里巴巴 HappyHorse 登頂 Seedance 影片 AI
阿里巴巴的 HappyHorse 1.0 影片生成模型超越 ByteDance 的 Seedance 2.0,成為全球頂尖 AI 影片工具。該模型由阿里巴巴新成立的 Alibaba Token Hub 下的創新業務單位開發,目前仍處於內部 Beta 測試階段。此事揭示中國 AI 人才競賽的白熱化。
Tag: #benchmarks166 results

阿里巴巴的 HappyHorse 1.0 影片生成模型超越 ByteDance 的 Seedance 2.0,成為全球頂尖 AI 影片工具。該模型由阿里巴巴新成立的 Alibaba Token Hub 下的創新業務單位開發,目前仍處於內部 Beta 測試階段。此事揭示中國 AI 人才競賽的白熱化。

一群中國年輕人,包括 19 歲常青藤輟學生,重構了 AI 記憶能力。他們的系統是唯一原生支援指代消解的產品。它在基準測試中現象級領先。

小米 CEO 雷軍宣布 MiMo 大模型調用量超過 1 萬億 Token。小米 MiMo-V2-Pro 在 Text Arena 邏輯推理、長指令遵循及多輪對話評測中闖入全球前五,並領跑 OpenRouter 日榜、周榜及趨勢榜。

NVIDIA 的極致硬體、軟體與模型共同設計,在 MLPerf Inference v6.0 中締造破紀錄效能。此方法最大化 AI 工廠產出並最小化 token 成本,超越峰值晶片規格。基準測試強調真實世界 token 產出,對 AI 營收至關重要。

Corti 推出 Symphony AI,在醫學編碼基準測試中勝過 OpenAI 和 Anthropic。基於最大規模的同行評審醫學編碼研究,將編碼視為推理任務。現在透過 API 提供,用於臨床筆記標準化。

AIRA_2 解決 AI 研究代理的三個瓶頸:單 GPU 限制、驗證泛化差距,以及固定 LLM 操作員。它採用異步多 GPU 工作池、隱藏一致評估協議,以及 ReAct 代理,提升產出與可靠性。在 MLE-bench-30 上,24 小時達 71.8% 百分位,72 小時升至 76.0%,超越先前最佳。

一個使用 9 行種子提示與僅 5 輪對比回饋的 LLM,在 96% 超參數優化基準中勝過 Optuna。此簡單方法突顯 LLM 在自動調優任務的潛力。在 r/MachineLearning 分享為專案。

Anthropic 的內部文件意外洩露,揭露 Claude Mythos(代號 Capybara),這是超越 Claude Opus 4.6 的全新模型層級,在程式設計、學術推理及網路安全領域表現優異。公司確認其存在,並計劃優先提供給網路安全防禦機構,因其漏洞利用能力強大。高成本與安全考量延後公眾發布。

Zhipu AI 的 GLM-5.1 現已上線供 Coding Plan 用戶使用,在 SWE-bench-Verified 達 77.8 分、Terminal Bench 2.0 達 56.2 分,領先開源模型。編碼能力媲美 Claude Opus 4.5、超越 GPT-4o,支持 200K 上下文與代理工作流程。

OpenAI 推出 GPT-5.4 mini 與 nano 模型,基準測試接近完整 GPT-5.4。它們運行更快、成本更低,標誌小型模型轉向真實世界應用。