使用 Sentence Transformers 訓練多模態嵌入模型
Hugging Face 部落格詳述使用 Sentence Transformers 訓練與微調多模態嵌入及重排序模型。涵蓋文字與影像處理,用於進階檢索任務。
Hugging Face Blog · 157 天前
能看、能聽、能說的模型正在取代純文字系統。覆蓋視覺語言模型、原生音頻與視頻理解進展。
354 篇文章
Hugging Face 部落格詳述使用 Sentence Transformers 訓練與微調多模態嵌入及重排序模型。涵蓋文字與影像處理,用於進階檢索任務。
Hugging Face Blog · 157 天前

前Google DeepMind研究員Andrew Dai正推出專注視覺AI的新創公司。他批評大型實驗室AI模型在處理視覺提示時,智能僅相當於3歲孩童。
Bloomberg Technology · 163 天前

優傲機器人與Scale AI共同開發UR AI Trainer AI訓練系統。透過機器人模仿人類動作的訓練單元,獲取多模態數據。
ITmedia AI+ (日本) · 165 天前
4月7日,网易有道推出首款AI知識庫產品「有道寶庫」。該產品定位AI研究助手,聚焦知識深度理解與結構化重構。
36氪 · 165 天前

美團推進原生多模態,將圖像與語音視為 Token 進行預測。此方法宣稱離散視覺無性能天花板。
量子位 · 169 天前
4月2日,萬興科技旗下萬興劇廠焕新,正式首批上線滿血版Seedance 2.0模型全能力。全新平台打通AI真人劇、2D/3D漫劇工業化製作及參考圖生影片等全類型工作流,支持多模態輸入實現「導演級」控制,可智能補全劇情、音效配樂與口型同步,並批量輸出2K高清分鏡影片。
36氪 · 170 天前

Meta研究人員發表TRIBE v2,一個從影片、音聲與語言刺激預測人類腦活動的基盤模型。論文「A foundation model of vision, audition, and language for in-silico neuroscience」探討其潛力。
ITmedia AI+ (日本) · 171 天前
Hugging Face 部落格推出「Falcon Perception」新項目。這似乎標誌著來自 Falcon 系列的感知導向 AI 模型或功能的發布。
Hugging Face Blog · 171 天前

多模態嵌入讓 AI 系統能以原生格式搜尋與推理文字、圖像、音頻和影片。Weaviate 部落格解釋核心直覺,並提供使用 Weaviate 和 Gemini 的三個實用 RAG 實作。
Weaviate Blog · 172 天前

智象未來CTO姚霆解釋AI從內容生成進化至透過多模態世界模型與代理系統完成端到端任務。公司源自微軟與京東專業知識,已開源HiDream-I1並推出如Vivago的創作者工具。
雷峰网 · 173 天前

Meta 正在測試多種 Avocado AI 模型變體,包括 Avocado 9B 和 Avocado Mango Agent。這些包含多模態功能。
TestingCatalog · 174 天前

Claw 推出為全球首個多模態創意營銷工具。它賦予獨立創作者專業級能力。
Ifanr (爱范儿) · 176 天前

邱錫鹏的新公司宣布完成數億元人民幣天使輪融資。專注於從 Token 演進至「詞元」,作為全模態 AI 時代的基模。
量子位 · 176 天前

Memory Bear AI 推出以記憶為中心的多模態情感智能框架,將情感視為結構化記憶系統中演化的變數。多模態訊號轉換為情感記憶單元 (EMUs),實現跨互動的持久儲存、檢索與更新。
ArXiv AI · 178 天前

蘋果正測試一款專屬 Siri 應用程式,外觀與功能類似聊天機器人。使用者可在單一介面管理對話、上傳檔案,並在語音與文字間無縫切換。
Digital Trends · 179 天前

騰訊微信推出 ClawBot 插件,支援開源 AI 代理框架 OpenClaw。用戶更新應用後,可透過掃描 QR 碼或複製指令在「設定與插件」中連接該插件。
TechNode · 180 天前

MiMo-V2-Pro、Omni 和 TTS 模型開發者承諾穩定後開放原始碼。來自 _LuoFuli 的 X 貼文公告。
Reddit r/LocalLLaMA · 185 天前

Character.AI 推出 Imagine Gallery,作為 Imagine 功能創作的視覺內容專屬空間。Imagine 將對話轉化為戲劇場景、超現實世界與意外時刻,提升聊天創意。
Character.AI · 185 天前

北大王選所彭宇新團隊的 TARA 將多模態表徵與分類學知識對齊,用於層級視覺識別。iNat21 HCA 提升 3-6%,TerraIncognita 未知物種強效。
雷峰网 · 185 天前

Google將Gemini AI整合至地圖,推出「Ask Maps」對話查詢及「沉浸式導航」強化功能。此功能讓一句話搞定出行攻略,為Gemini產品持續強化的一部分。
cnBeta (Full RSS) · 189 天前

Google 將 Gemini AI 整合進 Maps,使用者只需一句話即可產生完整旅行行程。網友稱這讓垂直旅行應用全完蛋。
量子位 · 189 天前
OpenUtter 是 OpenClaw 代理的無頭 Google Meet 機器人。它提供即時字幕、逐字稿與截圖,無需瀏覽器視窗。
OpenClaw.report · 190 天前

Google 宣布 Google 地圖的 Gemini 驅動更新,推出「Ask Maps」用於處理複雜條件的對話式搜尋,以及「Immersive Navigation」提供直觀 3D 路線導航。功能包含根據使用者偏好與歷史的個人化建議,加上自然語音導航,重新定義導航體驗。
ITmedia AI+ (日本) · 190 天前

Google Maps 推出 AI 驅動的「Ask Maps」功能,支持自然語言查詢。同時升級「Immersive Navigation」體驗。
TechCrunch AI · 191 天前

周暢身後支撐著阿里巴巴的Qwen大語言模型與Seedance多模態AI。他七年歷程從達摩院招生到領導Seed成為多模態一哥。
钛媒体 · 191 天前

OpenAI 計劃將 Sora 影片生成器整合至 ChatGPT。用戶可直接在聊天介面創作短篇 AI 影片。
Digital Trends · 192 天前

蘋果與OpenAI將Shazam深度整合進ChatGPT應用,用戶可在聊天介面直接識別背景播放歌曲,無需切換獨立Shazam應用。此新工具已面向全球iOS、Android及網頁端ChatGPT用戶推出。
cnBeta (Full RSS) · 193 天前

研究人員提出一個可重現框架,透過分解為感知(模式識別)和演繹(臨床邏輯)兩部分,評估多模態大型語言模型在心電圖信號上的推理能力。感知使用代理程式碼生成來實證驗證時間結構。
ArXiv AI · 200 天前
樂奇 Rokid 旗下 AI 眼鏡 Rokid Glasses 海外版重磅升級,正式接入谷歌 Gemini、ChatGPT、DeepSeek、阿里通義千問四大主流 AI 大模型。成為行業首款支援 Gemini 的 AI 眼鏡,在端雲協同架構下體驗跨模型切換、多模態互動與即時翻譯。
36氪 · 200 天前

Qwen 發布 Qwen 3.5 Small 多模態模型,尺寸從 0.8B 到 9B,適合設備端應用。演示使用 Transformers.js 在 WebGPU 瀏覽器本地運行 0.8B 變體。
Reddit r/LocalLLaMA · 201 天前