
Xiaohongshu 開源 280B 多模態模型
Xiaohongshu 發布 dots3-note preview,這是一個總參數 280B、啟用參數 16B 的開放權重 MoE 模型。該模型支援 512K 上下文,以及文字、視覺與語音理解,並以 Apache 2.0 授權釋出。
Tag: #mixture-of-experts31 results

Xiaohongshu 發布 dots3-note preview,這是一個總參數 280B、啟用參數 16B 的開放權重 MoE 模型。該模型支援 512K 上下文,以及文字、視覺與語音理解,並以 Apache 2.0 授權釋出。

小紅書發布了 dots3-note preview,這是一款面向實際部署與開發者使用的開源多模態 MoE 模型。此舉顯示大型內容平台正打造自有模型基座,以支援搜尋、推薦、內容創作與智慧服務。

一名獨立開發者以約 250 美元,使用 50 億個去污染化 token 預訓練出 10.2 億參數的 Kimi-K3 複製模型。該模型在 HellaSwag 上達到 33.4%,高於 GPT-2 124M 據報的 28%,且完全未經指令微調。

NVIDIA Nemotron 3.5 Lightning 現已透過 Amazon SageMaker JumpStart 提供,專為高流量代理型工作負載打造。這款 300 億參數的 Mixture-of-Experts 模型僅啟用 30 億參數,最高可提供 4 倍吞吐量與快 30% 的任務完成速度。
Ornith AI 發布三款新的 Ornith 1.5 模型變體:9B、35B-A3B 與 397B。Hugging Face 已提供原始模型格式及 GGUF 版本的下載頁面。

Z.ai 認為,模型擴展不應只看參數量,還需考慮資料、運算分配、推理成本、稀疏性、有效深度與後訓練。文章將 GLM-5.3 描述為一項受控實驗:維持與 GLM-5.2 相同的總參數及啟用參數,同時進行一個月的長期環境與強化學習擴展。

俄羅斯的 Yandex 與 Sberbank 持續透過 YandexGPT、GigaChat、Alice Pro、Shedevrum 與 Kandinsky 建立本土 AI 生態。儘管俄語能力與搜尋、醫療、金融及客服等落地應用表現不俗,但制裁、晶片短缺、市場規模有限與人才外流,仍限制其追趕前沿模型的能力。

Alibaba 釋出 Qwen3.8-2.4T-A95B(又稱 Qwen3.8-Max)的開放權重,這是其目前最大的開放權重模型。NVIDIA Developer Blog 說明如何在 NVIDIA GB300 NVL72 上部署此 2.4T 參數模型,並配置推理能力。

阿里已開放 Qwen3.8-2.4T-A95B 權重,這是 Qwen-Max 級別模型首次開放權重。該 MoE 模型擁有 2.4T 總參數、每個 Token 啟用 95B 參數,原生支援 256K 上下文,並鎖定程式設計、辦公、科研與長週期 Agent 任務。

Google DeepMind 以寬鬆的 Apache 2.0 授權發布 Gemma 4,消除了先前阻礙企業採用的自訂限制。此模型系列包含邊緣與工作站兩個層級的四種變體,支持多模態輸入與長上下文視窗。這與某些中國實驗室限制開放性形成對比,同時源自 Gemini 3 研究。