
Alibaba 的 Qwen 模型矩陣打響 SOTA 團戰
Alibaba 已將 Qwen 從開源語言模型專案,擴展為涵蓋文字、圖像、語音、影片與音樂的多模態模型矩陣。文章聚焦其多條模型產品線同時取得頂尖評測成績、快速獲得開發者採用,以及 Alibaba 不斷增長的 AI 基礎設施與雲端商業化能力。
Tag: #model-benchmarks14 results

Alibaba 已將 Qwen 從開源語言模型專案,擴展為涵蓋文字、圖像、語音、影片與音樂的多模態模型矩陣。文章聚焦其多條模型產品線同時取得頂尖評測成績、快速獲得開發者採用,以及 Alibaba 不斷增長的 AI 基礎設施與雲端商業化能力。

名為 Ox Alpha 的神秘模型現身 OpenRouter,據稱性能超越 Fable 5。其開發者仍未公開,引發外界猜測可能來自智譜或 Xiaomi。

Stanford《AI Index 2026》報告指出,84% 的中國受訪者對 AI 感到興奮,美國則為 38%;信任度分別為 72% 與 32%。報告也表示,中美 AI 模型的效能差距已基本消失,雙方自 2025 年初起交替領先。

文章介紹 Moonshot AI 的 Kimi K3,稱其為擁有 2.8 兆參數、在程式設計、知識、推理與視覺任務上達到前沿水準的開源模型。文章認為,Kimi K3 的發布在美國引發重大爭論,原因是低成本開放權重模型可能削弱閉源模型供應商的定價能力與監管優勢。

Anthropic Opus 4.7、OpenAI GPT-5.5、DeepSeek V4 等模型高密度發布。長視野任務、代理編碼、多模態提升,Opus 文字退步等權衡。DeepSeek 開源性價比領先。

英國政府研究機構 AISI 確認 Anthropic 新模型「Mythos」能自主完成專家級網路攻擊。高攻擊性能的展現促使 AISI 呼籲組織重視基本防護措施。

埃及發布 Horus-1.0-4B,為首個完全從頭訓練的開源 LLM,使用數兆乾淨權重。具備 8K 上下文長度,在 MMLU Pro 基準測試超越 Llama 3.1 8B 等模型,提供 7 種版本適配不同硬體。整合 neuralnode 框架與 Replica TTS,支持包括阿拉伯語在內的多語言語音。
阿里開源三款中型千問3.5模型:Qwen3.5-35B-A3B、Qwen3.5-122B-A10B、Qwen3.5-27B。這些模型創中等尺寸性能新高,超越更大上代旗艦及GPT-5 mini。Qwen3.5-Flash已在阿里雲上線,每百萬Token輸入低至0.2元。

據報 MiniMax H3 已登上開源 AI 社群的第一名。標題將其描述為為影片模型設定新的效能門檻,也就是所謂的「斬殺線」,但節錄未提供基準測試細節。

Moonshot 正準備推出 Kimi 3,預計將成為中國最大的開源 AI 模型。該模型旨在縮小與 Anthropic 的 Opus 4.8 之間的效能差距。