☁️較早收集於 10m

Amazon SageMaker Feature Store 的新功能

Amazon SageMaker Feature Store 的新功能
PostLinkedIn
☁️閱讀原文: AWS Machine Learning Blog

💡利用 SageMaker Feature Store 的新治理與儲存功能,提升您的機器學習管道效率。

⚡ 30-Second TL;DR

有什麼變化

透過 Lake Formation 整合增強治理能力

為什麼重要

透過簡化資料治理並提升特徵檢索效能,降低機器學習工程師的營運負擔。

下一步行動

升級至 SageMaker Python SDK v3.8.0,並為您的特徵管道測試新的 Iceberg 表格整合。

誰應關注:Developers & AI Engineers

關鍵要點

  • 透過 Lake Formation 整合增強治理能力
  • 透過 Iceberg 表格屬性改善資料管理
  • 在 SDK v3.8.0 中簡化機器學習特徵管道開發

🧠 深度解析

Web-grounded analysis with 31 cited sources.

🔑 增強重點摘要

  • 透過 AWS Lake Formation 整合,Amazon SageMaker Feature Store 的離線儲存現在支援欄級、列級甚至單元格級的精細存取控制,取代了傳統上複雜的 Amazon S3 儲存桶政策和 IAM 政策管理方式。
  • Apache Iceberg 表格格式的支援允許資料科學家直接透過 SDK 配置壓縮 (compaction) 和快照過期 (snapshot expiration) 等屬性,顯著優化離線儲存的性能和查詢速度,在提取機器學習訓練資料集時可實現 10 到 100 倍的查詢性能提升。
  • 除了性能優化,Iceberg 表格還為離線儲存帶來了 ACID 事務、行級操作(合併、更新、刪除)以及時間旅行查詢等資料湖現代化功能,增強了資料的可靠性和可追溯性。
  • SageMaker Python SDK v3.8.0 的更新簡化了特徵群組的管理工作流程,減少了樣板程式碼,使資料科學家能夠從單一 SDK 中同時管理特徵資料的存取治理和離線儲存性能優化。
  • SageMaker Feature Store 的離線儲存使用 Amazon S3 儲存歷史資料,並自動為特徵群組建立 AWS Glue Data Catalog,這使得可以使用 Amazon Athena 等查詢引擎對離線資料進行分析和查詢。
📊 競品分析▸ Show
功能/定價/基準Amazon SageMaker Feature StoreFeast (開源)TectonDatabricks Feature StoreGoogle Vertex AI Feature Store
功能完全託管,深度整合 AWS 生態系統 (S3, Glue, Athena, SageMaker Pipelines/Studio),提供線上/離線儲存,支援批次/即時特徵。開源,雲端中立,模組化架構,可插拔後端 (BigQuery, Redshift, Snowflake, Redis),適用於多雲/混合環境。商業解決方案,由 Uber Michelangelo 創作者開發,提供進階即時特徵處理、治理和監控功能。內建於 Databricks Lakehouse 平台,直接從 Delta Lake 建立、管理和共享特徵。託管服務,深度整合 GCP Vertex AI 套件,自動同步線上/離線儲存,內建監控,支援批次特徵和向量資料庫。
定價按使用量付費 (儲存、讀寫單位、按需/預置容量),有免費方案。無軟體授權費用,僅需支付基礎設施成本,需自行管理。企業級定價,通常較高,提供託管基礎設施。整合於 Databricks Lakehouse 平台,定價與平台使用相關。按使用量付費 (儲存、讀寫操作),推崇無伺服器推論,可能更適合間歇性工作負載。
基準 (線上服務延遲)平均 P95 延遲 10-25 毫秒 (取決於區域和負載)。使用 Redis 後端通常可達 P99 延遲 5-15 毫秒。託管基礎設施通常可達 P99 延遲低於 10 毫秒。未明確提供公開基準,但作為雲端託管服務應具備競爭力。未明確提供公開基準,但作為雲端託管服務應具備競爭力。
限制/注意事項缺乏內建特徵監控 (需依賴 SageMaker Model Monitor 或外部工具),特徵工程需外部計算。仍處於開發階段,對特徵轉換和監控的內建支援有限,需要自行管理和維護。企業級定價可能較高,可能存在供應商鎖定。需與 Databricks Lakehouse 平台綁定,可能不適用於非 Databricks 用戶。雖然簡化工作流程,但可能提供較少底層基礎設施的控制權。

🛠️ 技術深入

  • AWS Lake Formation 整合
    • Lake Formation 提供類似關係型資料庫管理系統 (RDBMS) 的權限模型,用於控制對 AWS Glue Data Catalog 資源(如資料庫、表格和欄)以及底層 Amazon S3 資料的存取。
    • 透過 Lake Formation,可以在 SageMaker Feature Store 的離線儲存資料上實施精細的欄級、列級和單元格級安全控制,取代了複雜的 Amazon S3 儲存桶政策和 IAM 政策。
    • 權限設定基於 AWS Glue Data Catalog,並可與 Amazon Athena、AWS Glue、Amazon EMR 等分析引擎無縫整合,這些引擎可以使用 Lake Formation 提供的臨時存取憑證來查詢 S3 中註冊的資料。
    • 在建立特徵群組時,可以選擇啟用 Lake Formation 存取控制,並透過 SageMaker Python SDK v3.8.0 進行管理。
  • Apache Iceberg 表格屬性支援
    • Apache Iceberg 是一種開源的資料表格式,專為大型分析資料集設計,它將 SQL 表格的熟悉度帶入資料湖,並支援 ACID 事務、行級操作(如合併、更新、刪除)、分區演進、資料版本控制(時間旅行)和增量處理。
    • SageMaker Feature Store 的離線儲存現在支援以 Iceberg 格式建立特徵群組,資料以 Parquet 格式儲存在 Amazon S3 中,並在 AWS Glue Data Catalog 中註冊元資料。
    • 透過 SDK v3.8.0,資料科學家可以直接配置 Iceberg 表格屬性,例如資料壓縮 (compaction) 和快照過期 (snapshot expiration)。
    • 壓縮 (Compaction):當資料以串流方式攝取時,可能會產生大量小檔案,影響查詢性能。Iceberg 的壓縮功能可以將這些小檔案合併成較大的檔案,顯著提高查詢性能,且此操作是併發的,不影響讀寫操作。
    • 時間旅行 (Time Travel):Iceberg 支援資料版本控制,允許用戶查詢歷史版本的資料,這對於模型訓練和回溯測試至關重要,確保訓練和推論之間的一致性。
    • Iceberg 與 AWS 分析服務(如 Amazon EMR、Amazon Athena 和 AWS Glue)深度整合,可利用 AWS Glue Data Catalog 作為元資料儲存。

🔮 前景展望AI analysis grounded in cited sources

Amazon SageMaker Feature Store 將在高度監管的行業中獲得更高的採用率。
Lake Formation 提供的精細存取控制(包括欄級、列級和單元格級安全)直接解決了金融服務和醫療保健等行業對資料治理和合規性的嚴格要求。
機器學習模型開發週期將顯著加速。
Iceberg 表格的壓縮功能可將訓練資料集查詢性能提升 10 到 100 倍,加上簡化的 SDK 工作流程,將使資料科學家能夠更快地迭代和部署模型。
SageMaker Feature Store 將更廣泛地融入企業資料湖架構。
Iceberg 的開放格式和 Lake Formation 的治理能力促進了與各種 AWS 分析服務甚至 Snowflake 等外部工具的無縫資料共享和分析,打破了資料孤島。

時間線

2020-12
Amazon SageMaker Feature Store 在 re:Invent 大會上發布。
2021-01
AWS 部落格發布文章,詳細介紹 Amazon SageMaker Feature Store 的主要功能。
2022-08
SageMaker Feature Store 引入了向現有特徵群組添加新特徵的能力。
2022-12
Amazon SageMaker Feature Store 宣布離線儲存支援 Apache Iceberg 表格格式。
2026-05
SageMaker Python SDK v3.8.0 推出,支援 Lake Formation 存取控制和 Apache Iceberg 表格屬性配置。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog