
阿里巴巴 Qwen3.5-Max 領先中國,落後美國
阿里巴巴推出 Qwen3.5-Max-Preview,其最強 AI 模型,在 Arena 基準測試中超越所有中國對手,但落後 Anthropic、Google 和 OpenAI 等美國對手。此 Qwen 3.5 系列預覽版鞏固了阿里巴巴在中國 AI 競賽中的領先地位。
Tag: #benchmarks166 results

阿里巴巴推出 Qwen3.5-Max-Preview,其最強 AI 模型,在 Arena 基準測試中超越所有中國對手,但落後 Anthropic、Google 和 OpenAI 等美國對手。此 Qwen 3.5 系列預覽版鞏固了阿里巴巴在中國 AI 競賽中的領先地位。

Cursor 推出自研 AI 模型,在基準測試中超越 Opus 4.6。此模型大幅削價,引發氛圍程式設計熱潮。背後引入新型強化學習方法。

Cursor 推出 Composer 2,自家編碼模型在基準測試中擊敗 Claude Opus 4.6,但落後 GPT-5.4。它比 Composer 1.5 便宜 86%,並提供更快的變體,專為 Cursor 中的長程代理編碼優化。模型具備 200k 令牌上下文,並針對工具使用和多檔案編輯進行調整。

MiniMax 推出 M2.7,在 PinchBench 獲得 86.2%(50 模型中第 5,接近 Claude Opus),Kilo Bench 47%(第 2 名)。相較 M2.5 提升 3.7 點,並獨家解決如 SPARQL 推理等任務。模型互補,組合神諭可達 Kilo Bench 67%。

MiniMax-M2.7 現已在 OpenRouter 上提供,具 204k 上下文,輸入 $0.30/M、輸出 $1.20/M 權杖。它擅長代理任務如除錯、金融建模及文件生成,透過多代理協作。基準:SWE-Pro 56.2%、Terminal Bench 2 57.0%、GDPval-AA 1495 ELO。
AVP 讓代理傳遞 KV-cache 潛在狀態而非文字,現支援跨模型轉移,基準測試顯示程式碼生成準確度提升及 2-6 倍加速。提供免費 T4 的 Colab 筆記本,使用 HuggingFace Transformers 於 GPU 測試。基於 LatentMAS,下一步支援 vLLM。

對 15 款小型語言模型在 9 項任務進行基準測試,找出最佳微調模型。Qwen3-8B 以最佳平均排名和一致性領先。LFM2-350M 在可調性增益上表現出色;Qwen3-4B 在 8/9 基準測試中勝過 120B 教師模型。
使用 A100 GPU 在泰國 LANTA 超級電腦上測試 14 種嵌入模型於 15 項泰語 MTEB 任務。Qwen3-Embedding-4B 以 74.41 分領先,KaLM-Gemma3-12B 以 73.92 分緊追。結果已合併至官方 MTEB 儲存庫,並提供互動排行榜。

在三月 GACL 基準測試中,Qwen3.5-27B 僅落後 Qwen 397B 0.04 分,表現接近 GPT-5 mini。優於其他 Qwen 模型,僅次於頂尖開源模型 Kimi2.5。聯賽透過競爭遊戲評估代理程式碼生成,涵蓋七款遊戲。

研究人員在 32 步企業網路與 7 步工業控制系統網路攻擊靶場上評估前沿 AI 模型,需鏈結多項能力。效能隨推論運算呈對數線性擴展,從 10M 到 100M 令牌提升高達 59%。如 Opus 4.6 等新型模型遠勝 GPT-4o,最佳執行達 22/32 步。