🤗較早收集於 5m

IBM 發布具備 32K 上下文的 Granite Embedding Multilingual R2

IBM 發布具備 32K 上下文的 Granite Embedding Multilingual R2
PostLinkedIn
🤗閱讀原文: Hugging Face Blog

💡1 億參數以下最強檢索模型,支援 32K 上下文,是高效能 RAG 應用的理想選擇。

⚡ 30-Second TL;DR

有什麼變化

採用 Apache 2.0 開源授權,具備商業使用彈性

為什麼重要

此發布為開發者提供了一個高效能的嵌入模型,在維持準確度的同時降低基礎設施成本。其長上下文支援使其非常適合處理大型技術手冊或法律文件的 RAG 應用。

下一步行動

將 Granite Embedding Multilingual R2 整合至您的 RAG 管線中,測試其 32K 上下文視窗是否能提升長篇資料集的檢索準確度。

誰應關注:Developers & AI Engineers

關鍵要點

  • 採用 Apache 2.0 開源授權,具備商業使用彈性
  • 在 1 億參數以下模型中,提供業界領先的檢索效能
  • 支援 32K 上下文視窗,適合處理長篇文件
  • 針對多語言檢索任務進行了優化

🧠 深度解析

Web-grounded analysis with 16 cited sources.

🔑 增強重點摘要

  • IBM Granite Embedding Multilingual R2 模型(97M 參數版本)在 1 億參數以下的多語言嵌入模型中,於多語言 MTEB 檢索(18 項任務)基準測試中獲得 59.6 分,超越次優模型 multilingual-e5-small 達 8.7 分,展現領先的檢索品質。
  • 該模型支援超過 200 種語言,並針對 52 種語言及多種程式碼(包括 Python、Go、Java、JavaScript、PHP、Ruby、SQL、C、C++)提供強化支援,使其適用於多樣化的跨語言和程式碼檢索任務。
  • Granite Embedding R2 模型採用 ModernBERT 架構,並整合了多項先進技術,如交替注意力機制、旋轉位置嵌入、Flash Attention 2.0 以及精簡參數,以提升處理效率和長上下文處理能力。
  • 模型的訓練資料來源廣泛且具備商業友善許可,包括從網路抓取的無監督標題-內文配對資料、公開可用的配對資料、IBM 內部專有技術領域資料,以及 IBM 生成的多語言合成資料,並經過嚴格的資料審查流程以確保治理。
  • 97M 參數模型是透過對 311M 參數模型進行層級剪枝(從 22 層減少到 12 層)和詞彙選擇(從 262K 減少到 180K 詞元)而來,並結合知識蒸餾和對比微調,以在大幅縮小模型尺寸的同時保持檢索品質。
📊 競品分析▸ Show
特性/模型IBM Granite Embedding Multilingual R2 (97M)IBM Granite Embedding Multilingual R2 (311M)Qwen3-Embedding-8B (開源)Google Gemini Embedding (API)OpenAI text-embedding-3-large (API)
參數數量97M311M8B不適用 (API)不適用 (API)
授權/部署Apache 2.0 (開源,可自託管)Apache 2.0 (開源,可自託管)Apache 2.0 (開源,可自託管)專有 (雲端 API)專有 (雲端 API)
多語言 MTEB 檢索分數59.6 (18 項任務)65.2 (MTEB-v2 Retrieval Avg)70.58 (MTEB 多語言)68.32 (MTEB 多語言)64.6 (MTEB)
上下文視窗32,768 詞元32,768 詞元32,000 詞元2,048 詞元8,192 詞元
嵌入維度384768 (支援 Matryoshka 至 128)7168 (支援 Matryoshka 至 32)3072 (可調整至 768)3072 (可調整)
每百萬詞元成本免費 (自託管)免費 (自託管)免費 (自託管)$0.15$0.13
主要優勢1億參數以下最佳檢索品質,高效率,長上下文,企業級訓練資料透明度。5億參數以下頂級多語言檢索品質,支援 Matryoshka,長上下文,企業級訓練資料透明度。MTEB 多語言排行榜榜首,最佳開源選項,支援多語言和程式語言。最佳綜合 MTEB 分數,Google Cloud 生態整合,跨語言檢索表現優異。廣泛整合生態系統,易於使用,通用性能良好。

🛠️ 技術深入

  • 模型架構: 採用基於 ModernBERT 架構的雙編碼器 (bi-encoder) 模型,用於生成高品質的文字嵌入。
  • 參數數量: 包含兩個多語言版本,一個是 97M 參數的緊湊型模型,另一個是 311M 參數的完整型模型。
  • 嵌入維度: 97M 模型產生 384 維向量。311M 模型產生 768 維向量,並支援 Matryoshka 表示學習 (Matryoshka Representation Learning),可將維度靈活截斷至 512、384、256 或 128,同時保持優雅的品質下降。
  • 上下文長度: 支援高達 32,768 個詞元 (tokens) 的上下文視窗,相較於 R1 版本擴展了 64 倍。
  • 語言支援: 支援超過 200 種語言,並對 52 種語言及多種程式碼(包括 Python、Go、Java、JavaScript、PHP、Ruby、SQL、C、C++)提供強化支援。
  • 核心架構增強 (ModernBERT): 包含交替注意力長度 (alternating attention lengths) 以加速處理、用於擴展序列長度的旋轉位置嵌入 (Rotary Position Embeddings, RoPE)、針對多語言和程式碼資料訓練的詞元分析器,以及 Flash Attention 2.0 以提高效率。
  • 詞元分析器: 97M 模型使用一個緊湊的、專門訓練的多語言詞元分析器,詞彙量為 180K,旨在以較小的尺寸保持廣泛的多語言覆蓋。
  • 訓練資料: 訓練資料來自四個主要來源:從網路抓取的無監督標題-內文配對資料、具有寬鬆企業友好許可的公開可用配對資料、IBM 內部針對特定技術領域的配對資料,以及 IBM 生成的多語言合成資料。值得注意的是,訓練語料庫中不使用 MS-MARCO 檢索資料集,因為其非商業許可。所有資料都經過嚴格的資料審查流程。
  • 優化技術: 採用對比微調 (contrastive fine-tuning)、知識蒸餾 (knowledge distillation)、模型剪枝 (model pruning) 和詞彙選擇 (vocabulary selection) 等技術進行優化,以確保查詢和段落嵌入之間的高度對齊,同時保持緊湊的模型尺寸。
  • 部署靈活性: 支援 ONNX 和 OpenVINO 模型格式,並與 vLLM 相容,提供多樣化的部署選項。
  • 激活函數: 97M 模型使用 SiLU 激活函數,而 311M 模型使用 GeGLU 激活函數。

🔮 前景展望AI analysis grounded in cited sources

開源嵌入模型在企業檢索增強生成 (RAG) 系統中的採用率將顯著增加。
Granite Embedding Multilingual R2 的 Apache 2.0 授權、卓越性能和訓練資料透明度,使其成為企業在處理敏感資料和需要客製化部署時,一個值得信賴且靈活的選擇。
AI 產業將持續朝向優化小型、高效能模型發展,以滿足邊緣運算和低延遲應用場景的需求。
97M 參數模型在最小計算成本下提供高品質檢索的能力,以及其緊湊的尺寸和高效的 ModernBERT 架構,符合將 AI 部署到更接近資料源的趨勢。
IBM 的開源策略將進一步鞏固其在企業 AI 市場的領導地位。
透過提供高效能、透明且具商業可行性的開源模型,IBM 鼓勵其 AI 技術(包括 watsonx 平台)在更廣泛的企業生態系統中被採用和整合。

時間線

1999-XX
IBM 協助創建 Apache 軟體基金會,並為 Apache Web Server 專案貢獻程式碼和資源。
2000-XX
IBM 協助建立 Linux 基金會,並在 1990 年代後期對 Linux 提供專利承諾和大量投資。
2023-09
IBM 宣布推出 Granite 系列解碼器專用 AI 基礎模型,最初用於其 Watsonx 平台。
2024-05
IBM 根據 Apache 2.0 授權開源了部分 Granite 程式碼模型。
2025-08
IBM Research 推出以英文為主的 Granite Embedding R2 模型,支援 8192 詞元上下文長度。
2026-04-29
IBM 發布 Granite 4.1 系列模型,涵蓋語言、視覺、語音、嵌入(包括多語言 R2)和 Guardian 模型,專為企業工作負載設計。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog