📋TestingCatalog•較早收集於 8h
Google 推出多模態 Gemini Embedding 2 模型

💡文字/影片/音訊統一多模態嵌入,解鎖多功能 AI 搜尋應用(28字元)
⚡ 30-Second TL;DR
有什麼變化
支援文字、圖像、影片、音訊和文件嵌入
為什麼重要
此推出簡化多模態檢索系統建置,提升搜尋、推薦和 RAG 管線應用。開發者現可無需獨立模型處理多樣資料類型,降低複雜度和成本。
下一步行動
透過 Vertex AI 主控台測試 Gemini Embedding 2,用於多模態 RAG 原型。
誰應關注:Developers & AI Engineers
關鍵要點
- •支援文字、圖像、影片、音訊和文件嵌入
- •統一嵌入空間實現跨模態相似性比對
- •可透過 Gemini API 和 Vertex AI 使用
- •可調整輸出維度以增加靈活性
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 5 個來源。
🔑 增強重點摘要
- •模型支援高達8192個輸入token的文字、每請求最多6張PNG/JPEG圖像、120秒MP4/MOV影片,以及最多6頁PDF文件[1][2]
- •預設輸出3072維浮點向量,並透過Matryoshka Representation Learning (MRL)技術支援動態調整至1536或768維以平衡效能與儲存[1]
- •提供自訂任務指示功能,如'task:code retrieval'或'task:search result',以優化特定任務的嵌入品質[2]
- •知識截止日期為2025年11月,模型ID為'gemini-embedding-2-preview',目前處於公開預覽階段[2]
- •在語音能力及文字、圖像、影片任務上超越領先模型,建立多模態嵌入新效能標準[1]
🛠️ 技術深入
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2024-02
推出multimodalembedding@001,Google首個多模態嵌入模型
2024-05
發布text-embedding-004及text-multilingual-embedding-002
2024-11
推出text-embedding-005
2025-05
發布gemini-embedding-001
2025-12
Gemini 2.0系列發布,為Embedding 2奠定架構基礎
2026-03
Gemini Embedding 2公開預覽發布
📎 來源 (5)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TestingCatalog ↗
每週 AI 簡報
每週一封,可隨時退訂。