
中國團隊打造36.4萬超聲AI數據集
中國團隊打造首個大規模超聲專屬數據集,包含36.4萬圖文對。此數據集讓AI真正理解超聲影像的臨床診斷語義。入選CVPR’26,標誌超聲AI邁入大模型時代。
Tag: #multimodal329 results

中國團隊打造首個大規模超聲專屬數據集,包含36.4萬圖文對。此數據集讓AI真正理解超聲影像的臨床診斷語義。入選CVPR’26,標誌超聲AI邁入大模型時代。

阿里巴巴正在重組其AI組織,同時開發HappyHorse,這款排名頂尖的影片模型。此舉支持涵蓋AI模型、雲端服務及應用程式的更廣泛推進。

MiniMax 推出 MMX-CLI,這是一款專為 AI 代理自動化設計的命令列介面。它讓 AI 代理能夠自主執行完整的多模態工作流程。此工具具備最佳化且機器友好的設計,便於無縫整合。

Google在日本推出「Gemini for Home」早期存取,取代Google Assistant。處理模糊指示、文脈對話,用於音樂、家電及智慧攝像頭分析。具AI解析影片摘要與場景搜尋功能。
Hugging Face 宣布整合 Sentence Transformers 的多模態嵌入與重新排序模型。這些模型可處理文字與影像資料,提升檢索與排序任務效能。現在可在 Hugging Face Hub 上立即使用。

本文解釋音訊嵌入和 Amazon Nova 多模態嵌入,用於語意音訊搜尋。提供索引和查詢音訊庫的程式碼,實現生產就緒系統。

X 推出由 Grok 驅動的自動翻譯功能,打破語言障礙。同時引入 AI 照片編輯器,使用簡單文字提示即可調整圖像。這些功能提升了 X 平台上 Grok 的實用性。

阿里巴巴的 HappyHorse 多模態模型即將發布開源權重,在 Artificial Analysis 擊敗 Seedance 2.0。支援文字轉影片、圖像轉影片及音頻,8 步推論達 720p。由 TTG Future Life Lab 的 Zhang Di 領導。

MedGemma 1.5 4B 在 MedGemma 1 基礎上擴展,支援高維醫學影像如 CT/MRI 體積與病理全切片,加上解剖定位與多時間點 X 光分析。它取得重大進展:3D MRI 分類提升 11%、病理 macro F1 達 47%,並改善臨床 QA 與 EHR 理解。作為開放資源,讓開發者建構先進醫學 AI 系統。

TRACE-KG 是一個多模態框架,從複雜文件建構上下文豐富的知識圖譜與誘導架構,而無需預定義本體。它透過結構化限定詞捕捉條件關係,並確保完全可追溯至來源證據。實驗證實其產生結構連貫、可追溯的圖譜,優於傳統管道。