
HappyHorse-1.0 登 AI 影片排行榜首,Elo 1383
影片生成模型 HappyHorse-1.0 在 Artificial Analysis 的 AI Video Arena 排行榜奪冠。Elo 分數達 1383。開發者和技術細節尚未公開。
Tag: #leaderboard25 results

影片生成模型 HappyHorse-1.0 在 Artificial Analysis 的 AI Video Arena 排行榜奪冠。Elo 分數達 1383。開發者和技術細節尚未公開。

阿里巴巴的 Qwen 3.6 Plus 榮登全球大模型調用周榜冠軍。性能更強的旗艦模型 Qwen 3.6 Max 即將發布。

阿里巴巴的 Qwen 3.6 Plus 以超過 1.4 萬億 Token 的日調用量打破紀錄。該模型登頂全球模型調用量榜首。此成就凸顯其大規模採用與效能。

2026年2月的SWE-rebench排行榜更新包含57個全新GitHub PR任務,Claude Opus 4.6以65.3%的解決率領先。頂尖模型如GPT-5.2-medium(64.4%)、GLM-5和GPT-5.4-medium(均62.8%)競爭激烈。開源模型如Qwen3.5-397B(59.9%)正快速縮小差距。

Arena(前身為 LM Arena)已成為前沿 LLM 的實際公共排行榜,影響資金、發布與公關週期。由其評比的公司資助,這家新創公司僅七個月從柏克萊加州大學博士研究項目轉型而成。

Arena(前身為 LM Arena)已成為前沿大型語言模型(LLM)的實際公共排行榜,由柏克萊加州大學博士生創立。短短七個月內,它從研究項目轉變為初創公司,影響 AI 資金、產品發布與公關週期,在激烈模型競爭中脫穎而出。
ColQwen3.5-4.5B-v3 以 75.67 平均分領先 MTEB ViDoRe 排行榜,參數減半、嵌入維度少 13 倍於前冠軍。完整評估記錄公開;支援 colpali-engine 及 vLLM(ROCm/CUDA)。Apache 2.0 授權,9B 版本訓練中。
全新開放 IDP 排行榜評估 16 款 VLM,涵蓋 9,000+ 文件與三項基準:OlmOCR、OmniDoc 及 IDP Core。Gemini 3.1 Pro 略居首位;廉價變體在非推理任務與旗艦匹敵。提供預測 vs. 真值結果瀏覽器。
階躍星辰的Step3.5 Flash模型根據OpenRouter數據,已連續三天在OpenClaw上保持全球調用量第一。2026年3月以來,Kimi K2.5、Step3.5 Flash與MiniMax M2.5的調用量分居全球前三。

獨立開發者 yuxinlu1 在 Hugging Face 模型排行榜中取得頂尖名次。此成就凸顯了個人開發者在 AI 領域中與大型科技公司競爭的強大實力。