⚛️量子位•較早收集於 60m
谷歌首個原生多模態嵌入模型

💡谷歌統一文字/影片/音頻嵌入—多模態AI搜尋與應用關鍵進展。
⚡ 30-Second TL;DR
有什麼變化
谷歌首個原生多模態嵌入模型
為什麼重要
革新多模態檢索與搜尋,驅動跨媒體更靈活AI應用。提升統一AI處理管線效率。
下一步行動
測試谷歌多模態嵌入API,用於跨模態相似度搜尋任務。
誰應關注:Researchers & Academics
關鍵要點
- •谷歌首個原生多模態嵌入模型
- •統一文字、圖像、影片、音頻模態
- •所有輸入共享嵌入空間
- •趣味示範凸顯跨模態理解
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 6 個來源。
🔑 增強重點摘要
- •Gemini Embedding 2支持交錯多模態輸入,允許開發者在單一請求中組合文本和圖像等多種輸入類型,以捕捉不同媒體類型之間的複雜關係[1][2]
- •該模型採用Matryoshka表示學習(MRL)技術,允許嵌入向量在不同維度間縮放,默認維度為3,072,開發者可縮減至1,536或768以管理存儲和性能需求[1]
- •Gemini Embedding 2在文本、圖像和視頻任務中的性能超越業界領先模型,同時引入強大的語音能力,建立了多模態深度的新性能標準[2]
- •該模型支持五種不同的媒體類型——文本(最多8,192個輸入令牌)、圖像(每個請求最多6張PNG/JPEG圖像)、視頻(最多120秒MP4/MOV格式)、音頻(直接處理無需轉錄)和PDF文檔(最多6頁)[1][5]
🛠️ 技術深入
• 多模態輸入支持:文本支持最多8,192個輸入令牌;圖像支持PNG和JPEG格式,每個請求最多6張;視頻支持MP4和MOV格式,最長120秒;音頻直接處理無需轉錄;PDF文檔支持最多6頁[1] • 交錯多模態輸入:模型能在單一請求中處理多種媒體類型,使系統能捕捉圖像和文本等不同輸入之間的關係[1] • Matryoshka表示學習(MRL):允許嵌入向量跨不同維度縮放,推薦輸出維度為3,072、1,536或768[1] • 語言覆蓋:捕捉超過100種語言的語義意義[1][2] • 應用場景:支持檢索增強生成(RAG)、語義搜索、情感分析、數據聚類和大規模數據管理[1]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-03
谷歌推出Gemini Embedding 2,首個原生多模態嵌入模型,於2026年3月10日在公開預覽版中通過Gemini API和Vertex AI發布[2]
📎 來源 (6)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- fonearena.com — Google Gemini Embedding 2 Features
- Google Blog — Gemini Embedding 2
- ndtvprofit.com — What Is Gemini Embedding 2 Googles First Multimodal AI Model That Maps Text Images Video Audio Together 11198910
- longbridge.com — 278627037
- marktechpost.com — Google AI Introduces Gemini Embedding 2 a Multimodal Embedding Model That Lets Your Bring Text Images Video Audio and Docs Into the Embedding Space
- neowin.net — Google Releases Gemini Embedding 2 AI Model with Multimodal Support
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
每週 AI 簡報
每週一封,可隨時退訂。