
谷歌首個原生多模態嵌入模型
谷歌推出首個原生多模態嵌入模型,將文字、圖像、影片、音頻統一至單一嵌入空間。戲劇性示範讓龍蝦「看懂」螢幕。此進展提升跨模態AI理解。
Tag: #multimodal329 results

谷歌推出首個原生多模態嵌入模型,將文字、圖像、影片、音頻統一至單一嵌入空間。戲劇性示範讓龍蝦「看懂」螢幕。此進展提升跨模態AI理解。

Google 推出 Gemini Embedding 2 模型,這是一款全新多模態嵌入解決方案。它支援文字、圖像、影片、音訊和文件嵌入於統一向量空間中。該模型可透過 Gemini API 和 Vertex AI 存取,並支援自訂輸出維度。
商湯徹底摒棄多模態模型中的VE與VAE元件,移除所有中間編碼器,打造簡化架構。其全新2B參數模型大幅超越傳統範式。

Luma 推出 UNI-1,這是視覺理解與影像生成的統一模型。它合併文字與影像處理來處理推理任務。

Luma 推出 Luma Agents,由其新「Unified Intelligence」模型驅動。這些代理能協調多個 AI 系統,生成橫跨文字、圖像、影片與音訊的端到端創意作品。
YuanLab.ai 正式開源發布 Yuan3.0 Ultra 多模態基礎大模型。它將 MoE 大模型訓練效率優化系統性引入模型結構設計,並針對企業應用進行深度優化。在多模態文件理解、RAG、表格分析、內容摘要與工具調用等任務中表現突出。
Microsoft 推出 Phi-4-reasoning-vision-15B,這是 15B 參數的開放權重多模態模型,在視覺語言任務、數學/科學推理與 GUI 導航表現出色。僅用 200B 多模態 token 訓練—僅對手 1/5—透過優異資料策劃匹敵更大模型。即刻在 Hugging Face 與 GitHub 上架。

Microsoft 發布 Phi-4-Reasoning-Vision-15B,這是使用 SigLIP-2 視覺編碼器與中融合架構的輕量開源多模態模型。它支援思維鏈推理或直接推論,用於數學、圖說與 GUI 定位等任務。使用精選資料集,以 240 顆 B200 GPU 訓練 4 天。

Anthropic 在 Claude Code 推出語音模式。此功能為 AI 程式設計輔助增添語音能力。它強化 Anthropic 在 AI 程式設計市場的地位。
Qwen3.5-4B 模型的新無審查版本以 GGUF 格式發布,在 465 次測試中零拒絕。保留完整能力,支持多模態輸入,提供從 2.6GB 到 7.9GB 的各種量化版本。更大 Qwen3.5 尺寸的無審查版本正在開發中。