🤗Hugging Face Blog•較早收集於 5m
IBM 發布具備 32K 上下文的 Granite Embedding Multilingual R2
💡1 億參數以下最強檢索模型,支援 32K 上下文,是高效能 RAG 應用的理想選擇。
⚡ 30-Second TL;DR
有什麼變化
採用 Apache 2.0 開源授權,具備商業使用彈性
為什麼重要
此發布為開發者提供了一個高效能的嵌入模型,在維持準確度的同時降低基礎設施成本。其長上下文支援使其非常適合處理大型技術手冊或法律文件的 RAG 應用。
下一步行動
將 Granite Embedding Multilingual R2 整合至您的 RAG 管線中,測試其 32K 上下文視窗是否能提升長篇資料集的檢索準確度。
誰應關注:Developers & AI Engineers
關鍵要點
- •採用 Apache 2.0 開源授權,具備商業使用彈性
- •在 1 億參數以下模型中,提供業界領先的檢索效能
- •支援 32K 上下文視窗,適合處理長篇文件
- •針對多語言檢索任務進行了優化
🧠 深度解析
Web-grounded analysis with 16 cited sources.
🔑 增強重點摘要
- •IBM Granite Embedding Multilingual R2 模型(97M 參數版本)在 1 億參數以下的多語言嵌入模型中,於多語言 MTEB 檢索(18 項任務)基準測試中獲得 59.6 分,超越次優模型 multilingual-e5-small 達 8.7 分,展現領先的檢索品質。
- •該模型支援超過 200 種語言,並針對 52 種語言及多種程式碼(包括 Python、Go、Java、JavaScript、PHP、Ruby、SQL、C、C++)提供強化支援,使其適用於多樣化的跨語言和程式碼檢索任務。
- •Granite Embedding R2 模型採用 ModernBERT 架構,並整合了多項先進技術,如交替注意力機制、旋轉位置嵌入、Flash Attention 2.0 以及精簡參數,以提升處理效率和長上下文處理能力。
- •模型的訓練資料來源廣泛且具備商業友善許可,包括從網路抓取的無監督標題-內文配對資料、公開可用的配對資料、IBM 內部專有技術領域資料,以及 IBM 生成的多語言合成資料,並經過嚴格的資料審查流程以確保治理。
- •97M 參數模型是透過對 311M 參數模型進行層級剪枝(從 22 層減少到 12 層)和詞彙選擇(從 262K 減少到 180K 詞元)而來,並結合知識蒸餾和對比微調,以在大幅縮小模型尺寸的同時保持檢索品質。
📊 競品分析▸ Show
| 特性/模型 | IBM Granite Embedding Multilingual R2 (97M) | IBM Granite Embedding Multilingual R2 (311M) | Qwen3-Embedding-8B (開源) | Google Gemini Embedding (API) | OpenAI text-embedding-3-large (API) |
|---|---|---|---|---|---|
| 參數數量 | 97M | 311M | 8B | 不適用 (API) | 不適用 (API) |
| 授權/部署 | Apache 2.0 (開源,可自託管) | Apache 2.0 (開源,可自託管) | Apache 2.0 (開源,可自託管) | 專有 (雲端 API) | 專有 (雲端 API) |
| 多語言 MTEB 檢索分數 | 59.6 (18 項任務) | 65.2 (MTEB-v2 Retrieval Avg) | 70.58 (MTEB 多語言) | 68.32 (MTEB 多語言) | 64.6 (MTEB) |
| 上下文視窗 | 32,768 詞元 | 32,768 詞元 | 32,000 詞元 | 2,048 詞元 | 8,192 詞元 |
| 嵌入維度 | 384 | 768 (支援 Matryoshka 至 128) | 7168 (支援 Matryoshka 至 32) | 3072 (可調整至 768) | 3072 (可調整) |
| 每百萬詞元成本 | 免費 (自託管) | 免費 (自託管) | 免費 (自託管) | $0.15 | $0.13 |
| 主要優勢 | 1億參數以下最佳檢索品質,高效率,長上下文,企業級訓練資料透明度。 | 5億參數以下頂級多語言檢索品質,支援 Matryoshka,長上下文,企業級訓練資料透明度。 | MTEB 多語言排行榜榜首,最佳開源選項,支援多語言和程式語言。 | 最佳綜合 MTEB 分數,Google Cloud 生態整合,跨語言檢索表現優異。 | 廣泛整合生態系統,易於使用,通用性能良好。 |
🛠️ 技術深入
- 模型架構: 採用基於 ModernBERT 架構的雙編碼器 (bi-encoder) 模型,用於生成高品質的文字嵌入。
- 參數數量: 包含兩個多語言版本,一個是 97M 參數的緊湊型模型,另一個是 311M 參數的完整型模型。
- 嵌入維度: 97M 模型產生 384 維向量。311M 模型產生 768 維向量,並支援 Matryoshka 表示學習 (Matryoshka Representation Learning),可將維度靈活截斷至 512、384、256 或 128,同時保持優雅的品質下降。
- 上下文長度: 支援高達 32,768 個詞元 (tokens) 的上下文視窗,相較於 R1 版本擴展了 64 倍。
- 語言支援: 支援超過 200 種語言,並對 52 種語言及多種程式碼(包括 Python、Go、Java、JavaScript、PHP、Ruby、SQL、C、C++)提供強化支援。
- 核心架構增強 (ModernBERT): 包含交替注意力長度 (alternating attention lengths) 以加速處理、用於擴展序列長度的旋轉位置嵌入 (Rotary Position Embeddings, RoPE)、針對多語言和程式碼資料訓練的詞元分析器,以及 Flash Attention 2.0 以提高效率。
- 詞元分析器: 97M 模型使用一個緊湊的、專門訓練的多語言詞元分析器,詞彙量為 180K,旨在以較小的尺寸保持廣泛的多語言覆蓋。
- 訓練資料: 訓練資料來自四個主要來源:從網路抓取的無監督標題-內文配對資料、具有寬鬆企業友好許可的公開可用配對資料、IBM 內部針對特定技術領域的配對資料,以及 IBM 生成的多語言合成資料。值得注意的是,訓練語料庫中不使用 MS-MARCO 檢索資料集,因為其非商業許可。所有資料都經過嚴格的資料審查流程。
- 優化技術: 採用對比微調 (contrastive fine-tuning)、知識蒸餾 (knowledge distillation)、模型剪枝 (model pruning) 和詞彙選擇 (vocabulary selection) 等技術進行優化,以確保查詢和段落嵌入之間的高度對齊,同時保持緊湊的模型尺寸。
- 部署靈活性: 支援 ONNX 和 OpenVINO 模型格式,並與 vLLM 相容,提供多樣化的部署選項。
- 激活函數: 97M 模型使用 SiLU 激活函數,而 311M 模型使用 GeGLU 激活函數。
🔮 前景展望AI analysis grounded in cited sources
開源嵌入模型在企業檢索增強生成 (RAG) 系統中的採用率將顯著增加。
Granite Embedding Multilingual R2 的 Apache 2.0 授權、卓越性能和訓練資料透明度,使其成為企業在處理敏感資料和需要客製化部署時,一個值得信賴且靈活的選擇。
AI 產業將持續朝向優化小型、高效能模型發展,以滿足邊緣運算和低延遲應用場景的需求。
97M 參數模型在最小計算成本下提供高品質檢索的能力,以及其緊湊的尺寸和高效的 ModernBERT 架構,符合將 AI 部署到更接近資料源的趨勢。
IBM 的開源策略將進一步鞏固其在企業 AI 市場的領導地位。
透過提供高效能、透明且具商業可行性的開源模型,IBM 鼓勵其 AI 技術(包括 watsonx 平台)在更廣泛的企業生態系統中被採用和整合。
⏳ 時間線
1999-XX
IBM 協助創建 Apache 軟體基金會,並為 Apache Web Server 專案貢獻程式碼和資源。
2000-XX
IBM 協助建立 Linux 基金會,並在 1990 年代後期對 Linux 提供專利承諾和大量投資。
2023-09
IBM 宣布推出 Granite 系列解碼器專用 AI 基礎模型,最初用於其 Watsonx 平台。
2024-05
IBM 根據 Apache 2.0 授權開源了部分 Granite 程式碼模型。
2025-08
IBM Research 推出以英文為主的 Granite Embedding R2 模型,支援 8192 詞元上下文長度。
2026-04-29
IBM 發布 Granite 4.1 系列模型,涵蓋語言、視覺、語音、嵌入(包括多語言 R2)和 Guardian 模型,專為企業工作負載設計。
📎 來源 (16)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Hugging Face Blog ↗