來源VentureBeat•較早收集於 1m
DataHub 推出 Context Intelligence 以防止 AI 代理產生幻覺

#sql#data-governance#ai-agents#metadatadatahub-context-intelligencedatahubsnowflakelangchaincrewai
💡利用您自己經過驗證的歷史查詢日誌作為語意索引,防止 AI 代理在 SQL 關聯上產生幻覺。
⚡ 30 秒速覽
有什麼變化
挖掘歷史 SQL 查詢日誌,為 AI 代理建立語意索引。
為什麼重要
此功能讓企業能將多年的分析師查詢歷史轉化為 AI 代理可靠的知識庫。它有效地填補了原始資料架構與自主資料分析所需的語意理解之間的差距。
下一步行動
如果您正在建構資料密集型 AI 代理,請透過 MCP 整合 DataHub 的 Context Intelligence 層,為您的代理提供經過驗證的 SQL 關聯模式。
誰應關注:Developers & AI Engineers
關鍵要點
- •挖掘歷史 SQL 查詢日誌,為 AI 代理建立語意索引。
- •整合 MCP、LangChain、Google Agent Development Kit 與 CrewAI。
- •利用現有的 DataHub 血緣(lineage)基礎設施來驗證關聯邏輯。
- •解決導致 AI 代理在複雜資料環境中失敗的「上下文缺失」問題。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 17 個來源。
🔑 增強重點摘要
- •DataHub 的 Context Intelligence 透過挖掘經過驗證的歷史 SQL 查詢日誌來建立語意索引,這對於解決 AI 代理在複雜企業資料環境中(例如 Miro 曾面臨的 65% 錯誤率)因缺乏語意層而產生的幻覺問題至關重要。
- •此「Context Intelligence」層利用 DataHub 現有的查詢日誌基礎設施進行血緣追蹤,並能持續從查詢日誌、血緣和使用情況中推導意圖、關聯和定義,從而實現「自動編寫上下文」,大幅減少手動文件編寫的需求。
- •DataHub 的解決方案被定位為「上下文管理」(Context Management),這是一種組織級的能力,旨在可靠地將最相關的資料提供給 AI 的上下文視窗,使其超越應用程式特定的「上下文工程」方法,實現企業級規模的代理部署。
- •DataHub 透過其「技能」(Skills)註冊表,讓 AI 代理能夠直接存取資料目錄工作流程,如搜尋、血緣、豐富和品質檢查,並能將這些工具串聯成多步驟工作流程,在每個步驟中做出判斷,進一步提升代理的智慧與可靠性。
- •該平台透過統一的上下文圖(Unified Context Graph)連接技術元資料與非結構化組織知識(如操作手冊、政策、常見問題解答),並透過外部連接器整合 Notion 和 Confluence 等文件,為 AI 代理提供全面的上下文。
📊 競品分析▸ Show
競爭者分析:AI 代理上下文管理與幻覺預防
| 功能/平台 | DataHub Context Intelligence | Atlan | Alation | Prizm by DQLabs |
|---|---|---|---|---|
| 核心方法 | 挖掘歷史 SQL 查詢日誌建立語意索引,利用現有血緣基礎設施驗證關聯邏輯,提供 MCP、LangChain、Google ADK、CrewAI 整合。 | 透過上下文圖(Context Graph)與 GraphRAG 解決方案,整合 MCP 伺服器以查詢即時元資料(血緣、標籤、品質訊號、業務術語)。 | 正轉型為「代理式資料智慧平台」(Agentic Data Intelligence Platform),強調資料目錄的演進。 | 定位為「驗證上下文時代」的平台,將資料目錄、資料可觀察性與資料品質統一為單一 AI 原生系統,提供持續驗證的上下文層。 |
| 幻覺預防焦點 | 透過提供經過驗證的歷史關聯邏輯,解決 AI 代理在複雜資料環境中因「上下文缺失」導致的錯誤關聯問題。 | 透過提供組織上下文、工具誤用和從訓練資料而非實際操作狀態泛化導致的錯誤決策,將 AI 代理回應基於組織真相而非統計模式。 | 旨在透過其演進的平台能力,為代理提供更豐富的資料智慧,以減少幻覺。 | 透過統一的資料可觀察性、資料品質和上下文,提供持續驗證的上下文,從根本上防止幻覺。 |
| 整合性 | MCP、LangChain、Google Agent Development Kit (ADK)、CrewAI、Snowflake Cortex、Copilot Studio。 | MCP 伺服器整合。 | 平台持續演進,提供資料目錄和資料發現功能。 | 將目錄與資料可觀察性、資料品質整合為單一系統。 |
| 基準/準確性 | Miro 案例中,將 AI 代理錯誤率從 65% 顯著降低。 SQL 解析器(基於 SQLGlot)在列級血緣方面準確度達 97-99%。 | 採用上下文感知系統的組織報告 AI 準確度達 94-99%,而沒有適當上下文基礎的則為 10-31%。 | 無特定基準數據。 | 無特定基準數據。 |
| 定價模式 | 開源版本可自行託管,DataHub Cloud 提供託管服務及專有功能。 | SaaS 平台,提供託管連接器和使用者友善介面。 | 企業級資料治理選項。 | 企業級平台。 |
🛠️ 技術深入
- DataHub 的 Context Intelligence 透過分析歷史 SQL 查詢日誌來建立語意索引,這些日誌經過驗證,確保了索引的準確性。
- 該平台利用 AI 生成的嵌入(embeddings)來實現語意搜尋,理解查詢和文件的含義,即使沒有精確的關鍵字匹配也能返回相關結果。
- 嵌入在資料攝取時(作為
SemanticContentaspect 透過 Metadata Change Proposal (MCP) 發送)和搜尋時(由 GMS 生成查詢嵌入)產生。 - 語意搜尋功能在後端使用 OpenSearch 執行 k-NN(k-最近鄰)向量相似度搜尋,並根據餘弦相似度對結果進行排序。
- DataHub 的 SQL 解析器基於 SQLGlot,在列級血緣提取方面表現卓越,在標準語料庫上的準確度達到 97-99%。
- 系統架構採用基於 Kafka 的元資料變更日誌(Metadata Change Log, MCL),將元資料變更視為串流而非快照,便於下游消費者整合。
- Context Intelligence 透過 Model Context Protocol (MCP) 伺服器,以及與 LangChain、Google Agent Development Kit (ADK) 和 CrewAI 的原生整合,將語意索引暴露給 AI 代理。
- DataHub Agent Context Kit 提供 SDK,允許開發者將 DataHub 工具直接嵌入到 ADK 代理中,或透過 ADK 內建的
McpToolset連接到 DataHub 的 MCP 伺服器。 - 統一上下文圖(Unified Context Graph)將技術元資料與非結構化知識(如操作手冊、政策、FAQ)和來自 Notion、Confluence 等外部文件的內容連接起來,為代理提供全面的上下文。
🔮 前景展望基於引用來源的 AI 分析
AI 代理幻覺問題將從模型層面轉向資料架構層面解決。
業界普遍認為 AI 代理幻覺並非單純的 LLM 問題,而是資料架構問題,因此像 DataHub Context Intelligence 這樣的基礎設施解決方案將成為企業 AI 成功的關鍵。
上下文工程將成為企業 AI 的新營運模式。
Gartner 2026 年的資料與分析預測強調上下文對於 AI 在治理、分析和業務執行中的影響至關重要,這表明上下文工程將從戰術性方法轉變為企業級策略。
缺乏健全上下文平台的 AI 代理將難以在生產環境中實現價值。
83% 的資料領導者認為,如果沒有上下文平台,代理式 AI 無法達到生產價值,這凸顯了 DataHub Context Intelligence 等解決方案對於大規模部署可信賴 AI 代理的重要性。
⏳ 時間線
2020-02
DataHub 在 LinkedIn 開源
2021-XX
Acryl Data 由前 LinkedIn 工程師創立,旨在開發 DataHub 的託管產品
2022-XX
完成 A 輪融資 2100 萬美元
2024-XX
完成 B 輪融資 3500 萬美元
2024-2025
開源和託管產品線整合,統一品牌為 DataHub,Acryl Cloud 更名為 DataHub Cloud
2026-05
DataHub 推出 Context Intelligence 層
📎 來源 (17)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗
每週電子報
每週一封,可隨時退訂。