
谷歌首個原生多模態嵌入模型
谷歌推出首個原生多模態嵌入模型,將文字、圖像、影片、音頻統一至單一嵌入空間。戲劇性示範讓龍蝦「看懂」螢幕。此進展提升跨模態AI理解。
Tag: #embeddings36 results

谷歌推出首個原生多模態嵌入模型,將文字、圖像、影片、音頻統一至單一嵌入空間。戲劇性示範讓龍蝦「看懂」螢幕。此進展提升跨模態AI理解。

Google 推出 Gemini Embedding 2 模型,這是一款全新多模態嵌入解決方案。它支援文字、圖像、影片、音訊和文件嵌入於統一向量空間中。該模型可透過 Gemini API 和 Vertex AI 存取,並支援自訂輸出維度。

Perplexity 推出兩款新型嵌入模型:pplx-embed-v1 和 pplx-embed-context-v1,專為大規模檢索任務優化。這些模型採用 int8 和二進位量化以提升效率。模型提供 0.6B 和 4B 參數規模版本。
研究人員提出LLM幻覺的幾何分類法,將其分為三類:不忠實(忽略上下文)、捏造(發明語義外內容)和事實錯誤(正確框架內錯誤)。基準測試幻覺具領域本地檢測力(AUROC 0.76-0.99),跨領域僅隨機水平;人類捏造則可用單一全球方向達0.96 AUROC。事實錯誤因嵌入僅編碼共現而無法檢測。
這款互動式工具視覺化了 GPT-2-small 嵌入空間中的 32,070 個字母 Token。使用者可以探索最近鄰關係,並透過 t-SNE 佈局瀏覽整個圖譜。

這項研究探討了 GPT-2 Small 如何在其靜態嵌入空間中表示「Trump」一詞。透過比較離散化與連續座標表示法,揭示了不同的數學處理方式如何影響相關詞彙的語義聚類。

Meta 正在研究一種新的上游表示層,旨在更好地連結用戶興趣與廣告商的產品。此方法透過學習整個生態系統的統一嵌入(embeddings),以提升深層漏斗廣告的成效。
開發者指出在細粒度汽車分類任務中,DINOv2 使用 k-NN 的表現顯著落後於 SigLIP2。討論探討了 DINOv2 的自監督特性是否需要額外的訓練層,而非僅依賴原始嵌入進行檢索。

本研究探討 AI 與基於檢索的策略如何改善模擬模型的發現與重用。研究評估了資料表示法、嵌入模型與重新排序技術對檢索效能的影響。

The Global Research Space 是一個新平台,可視覺化來自 OpenAlex 和 Arxiv 的 1100 萬篇科學論文。它利用 SPECTER 2 嵌入與 UMAP 降維技術,讓使用者能透過互動式且具備時間軸功能的地圖探索研究趨勢。