
Qwen 35B 從較新版提交中消失
Reddit 使用者指出,較新的提交移除了 Qwen 35B 模型的相關內容。這項變化被解讀為模型可能不會發布的訊號,也促使使用者向 Qwen 團隊要求澄清。
Tag: #mixture-of-experts31 results

Reddit 使用者指出,較新的提交移除了 Qwen 35B 模型的相關內容。這項變化被解讀為模型可能不會發布的訊號,也促使使用者向 Qwen 團隊要求澄清。

Alibaba Cloud 已在中國啟用 Lingjun Zhenwu M890 超級節點雲端實例,首個部署地點為烏蘭察布。企業客戶可配置具備高速互連的 64 張加速卡運算單元,無須自行建置資料中心即可進行大規模 AI 推論。

NVIDIA Nemotron 3.5 Lightning 是一款開放的 300 億參數混合專家模型,僅啟用 30 億參數,專為長時間運行 AI Agent 的執行層打造。它針對工具呼叫、結果驗證與子代理委派等高頻任務,降低每個步驟都使用前沿推理模型所帶來的成本與延遲。

Nvidia 推出 300 億參數的開放式混合專家模型 Nemotron 3.5 Lightning,以及開源的 NeMo Switchyard 路由函式庫。Nvidia 表示,兩者搭配可維持接近前沿模型的任務完成率,同時將基準測試成本降至單獨運行 Opus 4.8 的約三分之一。

ANT Group 的 Ling 3.0 Tiny 現已透過 Vercel AI Gateway 提供,免費使用至 8 月 13 日。這款混合專家模型主打反應迅速的代理程式、指令遵循與多輪對話。

Qwen 開發團隊表示全新的 27B 模型即將發布,並稱其能力將大幅提升,而不只是重新訓練版本。他們也透露 Qwen3.8 的細節,包括 2.4T 總參數、95B 活躍參數、大量後訓練運算,以及用於處理超過 100 小時影片的階層式影片記憶方法。

Sand.ai 開源了一款擁有 114B 參數、6B 啟用參數的 Mixture-of-Experts 影片生成模型。據稱,該模型可生成 10 秒 1080p 影片,成本約為人民幣 0.5 元。

Alibaba 發表旗艦基礎模型 Qwen3.8,具備 2.4 兆總參數與 950 億啟用參數。同時推出 Qianwen Office,這是一款以 DingTalk 為企業生態核心的 AI 工作流程產品,競爭對手包括 Tencent WorkBuddy 與 ByteDance Doubao。

Hugging Face 推出 EMO,一種針對專家混合模型 (MoE) 的新型預訓練方法。它實現湧現模組化,讓專家專門化行為在預訓練中自然出現。此進展提升可擴展 AI 架構。
Reddit 貼文討論 Qwen3.5 的 397B-A17B MoE 模型,活躍參數極低。辯論其路由機制是否為開源重大突破,或僅為漸進改進。尋求社群對發佈筆記的回饋。