
Alibaba 發布 Qwen3.8-Max,預告即將開源權重
Alibaba Group 已將其旗艦模型 Qwen3.8-Max 開放給全球用戶使用。此舉發生在下週正式開源權重發布之前,標誌著該公司重新回歸頂級模型的開源策略。
Tag: #open-source-llm20 results

Alibaba Group 已將其旗艦模型 Qwen3.8-Max 開放給全球用戶使用。此舉發生在下週正式開源權重發布之前,標誌著該公司重新回歸頂級模型的開源策略。

Meituan 開源了擁有 1.6 兆參數的 LLM LongCat-2.0。這是中國首個完全在國產硬體上訓練的大型語言模型,具有重要的里程碑意義。

Zhipu AI 的 GLM-5.1 現已上線供 Coding Plan 用戶使用,在 SWE-bench-Verified 達 77.8 分、Terminal Bench 2.0 達 56.2 分,領先開源模型。編碼能力媲美 Claude Opus 4.5、超越 GPT-4o,支持 200K 上下文與代理工作流程。

阿里開源三款新 Qwen3.5 模型:Qwen3.5-35B-A3B、Qwen3.5-122B-A10B 及 Qwen3.5-27B,在多榜單超越更大前代及 GPT-5 mini。這些 MoE 與密集模型可在消費級顯卡運行,Qwen3.5-Flash 上線阿里雲,每百萬輸入 Token 僅 0.2 元。擅長 Agent 任務、程式設計、數學及多模態推理。
阿里巴巴的千問 3.5 登上 Hugging Face 開源模型排行榜首位。中國模型佔據前十名中的 8 席。该模型總參數 3970 億,僅激活 170 億以提升效率。
Guide Labs 開源 Steerling-8B,一個 80 億參數 LLM,具備新型架構。此設計使模型動作易於解釋。此首發推進透明 AI 開發。

Stepfun 發布了 Step 3.7 Flash,這是一款擁有 196B 參數的稀疏 MoE 模型,專為 AI Agent 工作流程進行了優化。該模型具備每秒 400 token 的高速推理能力與原生工具調用功能。

使用者測試顯示 Gemma 4 26B A4B 使用 llama.cpp 和 Unsloth GGUF,在 262k 上下文的 94% 維持連貫性。它能準確處理如除錯 NVIDIA SMI 腳本的複雜任務。高上下文優化設定防止循環。

Covenant AI 發布 Covenant-72B,這是有史以來在去中心化無許可 GPU 節點上訓練的最大模型。它採用基於 DiLoCo 的 SparseLoco 方法,透過降低同步頻率、使用本地 AdamW 優化器,以及 top-K 稀疏化來減少通訊開銷並解決頻寬瓶頸。

Reddit 爆料貼文宣布 Qwen 3.5 小型模型今日推出。由用戶 Illustrious-Swim9663 在 r/LocalLLaMA 分享。提供討論連結。