💼較早收集於 27m

Databricks 推出 LTAP 以消除 AI 資料管線延遲

Databricks 推出 LTAP 以消除 AI 資料管線延遲
PostLinkedIn
💼閱讀原文: VentureBeat
#data-engineering#real-time-data#data-pipeline#ai-infrastructurelakehouse//rt-and-ltapdatabrickspostgresqlapache-sparkdelta-lakeapache-iceberg

💡透過 Databricks 新的 LTAP 架構實現即時資料存取,消除 AI Agent 的 ETL 瓶頸。

⚡ 30-Second TL;DR

有什麼變化

LTAP (Lake Transactional/Analytical Processing) 統一了 Postgres 交易資料與分析 Lakehouse 表格的儲存層。

為什麼重要

此轉變透過消除資料的「ETL 稅」,顯著降低了構建即時 AI 應用程式的複雜性。它允許開發人員將即時營運資料直接輸入分析引擎,從而實現更具響應能力且智慧的 AI Agent。

下一步行動

評估您目前的 ETL 架構,並測試遷移至 LTAP 是否能降低您即時 AI Agent 工作流程的延遲。

誰應關注:Developers & AI Engineers

關鍵要點

  • LTAP (Lake Transactional/Analytical Processing) 統一了 Postgres 交易資料與分析 Lakehouse 表格的儲存層。
  • Lakehouse//RT 通過消除專用的即時服務層,實現了毫秒級的查詢延遲。
  • 該架構在 Delta 或 Iceberg 格式中使用單一資料副本,無需轉換管線。
  • 專為加速 AI Agent 而設計,提供更簡單、更快速的資料堆疊。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 19 個來源。

🔑 增強重點摘要

  • LTAP 的基礎是 Databricks 去年推出的 Lakebase 資料庫平台,該平台將資料庫運算與儲存分離,並支援 PostgreSQL 相容性,同時將交易資料直接寫入開放的欄式格式,如 Delta Lake 和 Apache Iceberg。
  • Lakehouse//RT 採用了名為 Reyden 的新型執行引擎,專為高併發、低延遲的即時工作負載而設計,能在不移動資料的情況下直接查詢 Delta 和 Iceberg 表格。
  • Databricks 聲稱 Lakehouse//RT 在較小資料集上的回應時間可低至 10 毫秒,在較大資料集上則低於 100 毫秒,並且在標準分析基準測試中,能以每秒 12,000 次查詢的速度維持低於 100 毫秒的延遲。
  • LTAP 旨在解決長達 40 年的交易式 (OLTP) 和分析式 (OLAP) 資料庫分離問題,其方法是將資料統一在儲存層,而非像傳統 HTAP 系統那樣在引擎層進行整合,從而避免了成本、效能權衡和廠商鎖定等問題。
  • Lakehouse//RT 目前處於 Beta 測試階段,並針對現有的 Lakehouse 客戶提供現有訂閱的升級選項,首年還有促銷價格。
📊 競品分析▸ Show
功能/定價/基準Databricks LTAP / Lakehouse//RTSnowflakeClickHouse
核心理念統一交易與分析資料儲存於單一資料副本,消除 ETL 管線,為 AI Agent 提供即時資料。雲端原生資料倉儲,專注於可擴展、SQL 優先的分析,儲存與運算分離。開源欄式資料庫,專為即時分析查詢而設計,提供亞秒級效能。
資料架構基於 Lakebase,將 Postgres 交易資料寫入 Delta Lake/Apache Iceberg 等開放欄式格式,並透過 Unity Catalog 進行統一治理。專有儲存格式,支援結構化和半結構化資料,自動擴展。欄式儲存,支援高壓縮,適用於快速查詢。
即時效能Lakehouse//RT 透過 Reyden 引擎實現毫秒級查詢延遲 (小工作負載 10ms,大工作負載 <100ms),支援數萬併發使用者。針對結構化資料分析提供高併發和效能,但通常不強調毫秒級 OLTP 延遲。提供亞秒級查詢效能,在高併發下表現出色。
ETL/資料移動消除 ETL 管線和資料副本,直接在資料湖上進行操作。支援 ELT 管線,資料通常需要載入到 Snowflake 進行分析。支援批次和串流資料攝取,但通常需要將資料載入到 ClickHouse。
定價模式按 Databricks Unit (DBU) 使用量計費 (每秒計費),雲端基礎設施費用另計。Lakehouse//RT 首年有促銷價格。基於使用量計費,儲存和運算分離計費。開源版本無授權費,託管服務 ClickHouse Cloud 有其定價模式。
基準測試客戶回報比現有即時服務架構效能提升高達 16 倍;標準分析基準測試中,每秒 12,000 次查詢下延遲低於 100 毫秒。針對 SQL 分析工作負載提供高擴展性和效能。在某些聯接操作上比 Databricks 和 Snowflake 更快。

🛠️ 技術深入

  • LTAP (Lake Transactional/Analytical Processing):
    • 基於 Databricks 的 Lakebase 平台,該平台將運算與儲存分離。
    • 支援 PostgreSQL 相容性,允許應用程式繼續使用原生 PostgreSQL 效能和語義。
    • 將交易資料直接寫入開放的欄式儲存格式,如 Delta Lake 和 Apache Iceberg,無需轉換管線。
    • 透過 Unity Catalog 實現統一治理,所有操作、分析和串流資料都存在於開放物件儲存中的開放格式 (Delta 和 Iceberg),具有單一身份、權限和稽核模型。
    • 交易式工作負載在標準 Postgres 中運行,具有完整的 ACID 語義;分析式工作負載則在整個 Lakehouse 上運行,可獨立擴展。
    • Lakebase 擴展了 LTAP 以支援任務關鍵型工作負載,增加了原生向量搜尋和全文搜尋功能,無需單獨的向量資料庫。
    • 即時事件攝取透過 Lakeflow Zerobus 進行。
  • Lakehouse//RT (Real-Time):
    • 由新的執行引擎 Reyden 提供支援,該引擎專為高併發、低延遲的即時工作負載而設計。
    • Reyden 採用完全非同步執行模型,可提供低至 10 毫秒的回應時間,並在吞吐量達到數萬次時仍能保持低延遲。
    • 直接在受 Unity Catalog 治理的 Delta 和 Iceberg 表格上執行查詢,無需資料移動或額外的服務層。
    • 支援操作分析、BI 和應用程式服務以及可觀察性工作負載。
    • 提供智慧自動擴展功能,可快速擴展以滿足需求,並在閒置時縮減至零,以節省運算成本。
    • 與現有 Lakehouse 部署可直接替換,並與開放的 BI 工具生態系統整合。

🔮 前景展望AI analysis grounded in cited sources

Databricks 的 LTAP 和 Lakehouse//RT 將加速企業中 AI Agent 的採用和能力。
透過提供即時、統一的營運和分析資料存取,且無需複雜的資料管線,這些技術消除了 AI Agent 獲取最新、全面資料以有效推理和行動的重大瓶頸。
傳統的 OLTP 和 OLAP 系統分離將越來越不適用於現代資料架構。
LTAP 透過在開放格式的單一資料副本上統一交易和分析工作負載,直接挑戰了這個長達 40 年的範式,從而降低了複雜性、成本和延遲。
Databricks 將鞏固其在統一資料和 AI 平台市場的領導地位。
透過解決 AI Agent 的關鍵即時資料需求並簡化資料堆疊,Databricks 增強了其 Lakehouse 產品,使其在競爭中更具吸引力。

時間線

2013
Databricks 成立,由 Apache Spark 的創始人創立。
2015
Databricks 平台推出商業版本。
2019
Databricks 率先提出 Lakehouse 概念,並推出 Delta Lake。
2020-01
Databricks 正式宣布 Lakehouse 範式。
2025
Databricks 推出 Lakebase 資料庫平台。
2026-06
Databricks 在 Data + AI Summit 上推出 LTAP 和 Lakehouse//RT。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。