
SenseTime 開源 SenseNova-Vision 統一視覺模型
SenseTime 發布了 SenseNova-Vision,這是一個能處理物件偵測、3D 重建等多項視覺任務的統一基礎模型。它將多種功能整合至單一系統,取代了以往需依賴多個專用模型的做法。
Tag: #multimodal329 results

SenseTime 發布了 SenseNova-Vision,這是一個能處理物件偵測、3D 重建等多項視覺任務的統一基礎模型。它將多種功能整合至單一系統,取代了以往需依賴多個專用模型的做法。

MedRealMM 是一個基於真實中文臨床諮詢的大規模多模態基準測試。它評估了大型語言模型處理圖文醫療數據的能力,並突顯了模型在安全性與推理能力上與人類醫師的差距。

Meta 推出了 Muse Spark 1.1,並為開發者提供公開 API 預覽。此更新增強了 AI 代理能力,並簡化了多模態工作流程。

ByteDance 推出了 Seedream 5.0 Pro,這是一款多模態圖像生成模型。它具備增強的推理能力、精確的編輯工具以及多語言支援。

據報導,Meta 正在開發配備「超級感知」AI 的智慧眼鏡,能持續監控使用者的周遭環境。該系統旨在將即時數據傳送給 AI 代理,以提供主動式協助。
本文針對包括 Seedance 2.0、Kling 3.0 與 Sora 2.0 在內的六款頂尖 AI 視頻生成模型進行了全面評測,分析了它們在個人創作與企業應用場景中的核心優勢與局限性。

Meta 推出了全新的 Muse Image 模型,這是其 Superintelligence Labs 部門的首個發布成果。該模型為 Meta 生態系統(包括 Instagram、WhatsApp 和 Meta AI 應用程式)提供圖像生成功能,並計畫擴展至 Facebook 和 Messenger。

Google DeepMind 推出了 Nano Banana 2 Lite 與 Gemini Omni Flash 的新功能。這些工具旨在協助開發者構建更高效且具備即時響應能力的 AI 應用程式。

MKG-RAG-Bench 是一個全新的跨領域基準測試,旨在評估多模態知識圖譜增強生成(MKG-RAG)中的檢索效能。它透過提供經過策劃的數據集來測試檢索與下游生成品質,解決了異質數據對齊這一關鍵瓶頸。

這篇研究論文分析了當前多模態 LLM 基準測試的局限性,這些測試往往無法評估跨模態整合能力。研究強調了在時空一致性和物理世界理解等領域建立更好評估指標的必要性。