📋較早收集於 8h

Google 推出多模態 Gemini Embedding 2 模型

Google 推出多模態 Gemini Embedding 2 模型
PostLinkedIn
📋閱讀原文: TestingCatalog

💡文字/影片/音訊統一多模態嵌入,解鎖多功能 AI 搜尋應用(28字元)

⚡ 30-Second TL;DR

有什麼變化

支援文字、圖像、影片、音訊和文件嵌入

為什麼重要

此推出簡化多模態檢索系統建置,提升搜尋、推薦和 RAG 管線應用。開發者現可無需獨立模型處理多樣資料類型,降低複雜度和成本。

下一步行動

透過 Vertex AI 主控台測試 Gemini Embedding 2,用於多模態 RAG 原型。

誰應關注:Developers & AI Engineers

關鍵要點

  • 支援文字、圖像、影片、音訊和文件嵌入
  • 統一嵌入空間實現跨模態相似性比對
  • 可透過 Gemini API 和 Vertex AI 使用
  • 可調整輸出維度以增加靈活性

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 5 個來源。

🔑 增強重點摘要

  • 模型支援高達8192個輸入token的文字、每請求最多6張PNG/JPEG圖像、120秒MP4/MOV影片,以及最多6頁PDF文件[1][2]
  • 預設輸出3072維浮點向量,並透過Matryoshka Representation Learning (MRL)技術支援動態調整至1536或768維以平衡效能與儲存[1]
  • 提供自訂任務指示功能,如'task:code retrieval'或'task:search result',以優化特定任務的嵌入品質[2]
  • 知識截止日期為2025年11月,模型ID為'gemini-embedding-2-preview',目前處於公開預覽階段[2]
  • 在語音能力及文字、圖像、影片任務上超越領先模型,建立多模態嵌入新效能標準[1]

🛠️ 技術深入

  • 基於Gemini架構,具備原生多模態理解能力,將不同媒體類型映射至單一嵌入空間[1]
  • 採用Matryoshka Representation Learning (MRL),允許從預設3072維動態縮減維度,推薦使用3072、1536、768維以獲最高品質[1]
  • 支援自訂任務指示優化嵌入,如程式碼檢索或搜尋結果相關性[2]
  • 輸入限制:文字最高8192 token、圖像每請求最多6張 (PNG/JPEG)、影片最高120秒 (MP4/MOV)、音訊原生嵌入無需轉錄、PDF最高6頁[1]
  • 模型ID:gemini-embedding-2-preview,知識截止至2025年11月[2]

🔮 前景展望AI analysis grounded in cited sources

提升RAG系統的多模態檢索準確性
統一嵌入空間允許基於文字描述搜尋圖像或影片等跨模態任務,提高語意搜尋應用效能[1][2]
降低開發者儲存與運算成本
MRL技術支援可調整輸出維度,讓開發者依需求平衡品質與資源消耗[1]
加速代理式AI應用開發
結合Gemini 2.0系列的多模態能力,為語意分類與複雜檢索提供基礎架構[1][3]

時間線

2024-02
推出multimodalembedding@001,Google首個多模態嵌入模型
2024-05
發布text-embedding-004及text-multilingual-embedding-002
2024-11
推出text-embedding-005
2025-05
發布gemini-embedding-001
2025-12
Gemini 2.0系列發布,為Embedding 2奠定架構基礎
2026-03
Gemini Embedding 2公開預覽發布
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TestingCatalog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。