
小紅書開源自研 AI 基座模型
小紅書發布了 dots3-note preview,這是一款面向實際部署與開發者使用的開源多模態 MoE 模型。此舉顯示大型內容平台正打造自有模型基座,以支援搜尋、推薦、內容創作與智慧服務。
Tag: #multimodal-model11 results

小紅書發布了 dots3-note preview,這是一款面向實際部署與開發者使用的開源多模態 MoE 模型。此舉顯示大型內容平台正打造自有模型基座,以支援搜尋、推薦、內容創作與智慧服務。

Alibaba 以 Apache 2.0 授權發布 Qwen3.8-27B,提供可下載權重,並具備多模態理解、程式設計、推理與代理工作流程能力。其 4-bit 版本約需 17GB 記憶體,第三方評測顯示其表現可媲美部分專有前沿模型。

SenseTime 開源了 SenseNova U1.5-Lite-Preview,這是一款採用 NEO-Unify 架構的 8B-MoT 輕量級統一多模態模型。它支援原生 4K 輸出、精準影像編輯,以及在資訊圖表與創意內容中複製設計框架。

小米推出了 Xiaomi-Robotics-U0,這是一個專為具身智慧設計的 380 億參數多模態基礎模型。該模型將場景生成、機器人互動影片生成以及通用圖像生成與編輯整合在單一框架中。

iFLYTEK-Embodied-Omni 是一個將視覺、語言和動作生成整合至單一框架的新型基礎模型。它採用「大腦-小腦」架構,旨在提升具身智能體對指令的理解能力與精確控制能力。

智源與清華大學合作的研究成果登上《Science》,利用多模態基礎模型 Brainμ 揭示了睡眠期間記憶重激活如何調控睡眠動態,為相關機制提供了新的實驗證據。

OpenBMB 與清華大學開源 MiniCPM-V 4.6。此 1.3B 參數多模態模型可在單張 RTX 4090 上運行。在關鍵基準測試中匹敵更大競爭對手。

阿里巴巴的千問APP推出全新「全能演技派」AI模型,對標OpenAI的Sora。此更新為APP內AI內容創作帶來史詩級強化。
Hugging Face 發布 Granite 4.0 3B Vision,這是一款專為企業文件設計的緊湊多模態模型。它提供高效的視覺語言智能,適用於商業應用。該模型現已在 Hugging Face 平台上線。

小鵬推出第二代VLA模型,具革命性架構,直接融合視覺、語言與動作,無需中間翻譯實現如人般直覺駕駛。跳過L3直奔L4自動駕駛,可應用於Robotaxi、飛行汽車及人形機器人。摩根士丹利等投行給予「買入」評級,視其具備與特斯拉競爭實力。