☁️較早收集於 8m

使用 Databricks Unity Catalog 與 Amazon SageMaker 微調 LLM

使用 Databricks Unity Catalog 與 Amazon SageMaker 微調 LLM
PostLinkedIn
☁️閱讀原文: AWS Machine Learning Blog

💡學習如何使用 Databricks 與 AWS 基礎設施構建安全且受控的 LLM 微調管道。

⚡ 30-Second TL;DR

有什麼變化

安全地連接 Databricks Unity Catalog 與 Amazon SageMaker AI 進行受控微調。

為什麼重要

此整合使企業能夠利用雲端原生 AI 訓練工具,同時不犧牲資料安全或合規性。它填補了受控資料湖與高效能模型訓練環境之間的鴻溝。

下一步行動

查閱整合文件,將您的 Unity Catalog 資料資產映射到 SageMaker 訓練任務,以進行下一個微調專案。

誰應關注:Developers & AI Engineers

關鍵要點

  • 安全地連接 Databricks Unity Catalog 與 Amazon SageMaker AI 進行受控微調。
  • 使用 Amazon EMR Serverless 處理大規模資料預處理工作流程。
  • 將微調後的 Ministral-3-3B-Instruct 模型產出物註冊回 Unity Catalog 以進行集中管理。

🧠 深度解析

Web-grounded analysis with 34 cited sources.

🔑 增強重點摘要

  • Databricks Unity Catalog 透過 Delta Sharing 提供跨雲資料治理,允許在 AWS S3 和 Azure Data Lake Storage 等多個雲端儲存的資料上實施單一權限模型和集中式政策,實現無需資料複製的安全資料共享。
  • Amazon EMR Serverless 具備細粒度的自動擴展能力,可根據應用程式需求自動配置和調整運算與記憶體資源,並僅按實際使用量計費,透過消除 Apache Spark 工作負載的本地儲存配置,可將資料處理成本降低高達 20%。
  • Amazon SageMaker JumpStart 簡化了 Mistral 模型的微調過程,支援 Mistral 7B 和 Mistral 8x7B 等模型,並利用 QLoRA 等技術提高記憶體效率,同時支援指令微調和領域適應微調。
📊 競品分析▸ Show
功能/平台Databricks Unity Catalog + Amazon SageMakerAzure Databricks + Azure Machine LearningGoogle Cloud Vertex AI + Dataplex Universal Catalog
資料治理統一治理、細粒度存取控制、自動化資料血緣追蹤、跨雲支援 (AWS, Azure, GCP),透過 Delta Sharing 實現無複製共享。整合 Azure Databricks 與 Azure ML 工作區,利用 MLflow 進行模型追蹤與管理,支援 Spark MLlib 模型訓練與部署。Dataplex Universal Catalog (前身為 Data Catalog) 集中管理所有資料資產的元資料,包括 Vertex AI 模型,提供端到端治理、存取控制和資料血緣追蹤。
LLM 微調Amazon SageMaker JumpStart 支援 Mistral 等基礎模型的微調,利用 QLoRA 等技術優化訓練,並提供指令微調和領域適應微調。支援透過 Python SDK 進行 Azure ML 管線中的 Databricks Notebook 步驟,可用於資料準備和模型訓練,包括自動化機器學習功能。Vertex AI Pipelines 與 BigQuery 整合,提供強大的框架來管理和追蹤資料旅程,並支援 AI 模型資產編目。
資料預處理Amazon EMR Serverless 提供無伺服器選項,用於運行 Apache Spark 和 Hive 應用程式,無需配置、優化或管理叢集,並具備自動擴展和按使用量付費的優勢。利用 Apache Spark 的平行化能力高效處理大數據,作為 Azure ML 實驗的計算環境。Google Cloud Serverless for Apache Spark 允許使用者從其偏好的開發環境中啟動開發計畫,並存取湖倉資料集和檔案。
跨雲能力Unity Catalog 支援跨 AWS、Azure 和 Google Cloud 的資料治理,並透過 Delta Sharing 實現跨雲、跨區域的即時資料共享,無需複製。Azure Databricks 與 Azure ML 整合,主要在 Azure 生態系統內運作,但 Databricks 本身支援多雲部署。Dataplex Universal Catalog 自動發現並組織跨所有分析和操作系統的元資料,包括 BigLake-native Iceberg 儲存和 Cloud Storage 上的開放格式 (Delta, Hudi)。

🛠️ 技術深入

  • Databricks Unity Catalog: 作為統一治理解決方案,它集中管理多個雲端環境中的資料,提供細粒度的存取控制,可達目錄、Schema、表格、行和列級別。它還具備自動化資料血緣追蹤功能,並支援跨雲資料共享,無需複製,透過 Delta Sharing 實現。元資料儲存在 Metastore 中,這是所有資料資產的頂級容器。
  • Amazon SageMaker: 這是一個基於雲端的機器學習平台,用於建立、訓練和部署 ML 模型。它支援多種 ML 演算法和框架,例如 TensorFlow 和 Apache MXNet。SageMaker JumpStart 簡化了 Mistral 等基礎模型的微調,通常使用 QLoRA 等技術來提高記憶體效率,並支援指令微調和領域適應微調。它提供託管的 Jupyter Notebook 實例,並與 Amazon S3 等 AWS 服務整合以進行資料儲存。
  • Amazon EMR Serverless: 作為 Amazon EMR 中的無伺服器部署選項,它使資料工程師和分析師能夠輕鬆且經濟高效地運行 PB 級資料分析。它自動配置並快速擴展應用程式所需的運算和記憶體資源,無需配置、優化、調整或管理叢集。EMR Serverless 還提供無伺服器儲存,將儲存與運算分離,減少了資料處理成本並防止因磁碟容量限制導致的作業失敗。
  • Mistral-3-3B-Instruct 模型: 文章中提及的「Ministral-3-3B-Instruct」很可能是指 Mistral AI 於 2025 年 12 月發布的「Ministral 3 3B」模型。該模型被描述為一個「微小而高效的模型,提供一流的文本和視覺能力」。Mistral 模型通常採用 Transformer 架構,並利用分組查詢注意力 (Grouped Query Attention) 和滑動窗口注意力 (Sliding Window Attention) 來實現更快的推斷速度和處理更長的序列。微調過程通常涉及指令微調或領域適應微調。

🔮 前景展望AI analysis grounded in cited sources

企業將加速採用生成式 AI,同時確保資料治理與合規性。
Unity Catalog 等強大的資料治理平台與 SageMaker 等 ML 平台的整合,直接解決了企業在微調和部署大型語言模型時對資料安全、血緣和合規性的擔憂,從而推動生成式 AI 的廣泛應用。
跨雲資料共享與治理將成為 MLOps 工作流程的標準。
Databricks Unity Catalog 結合 Delta Sharing 等解決方案,實現了跨雲安全且無需複製的資料共享,將推動多雲 MLOps 策略的採用,降低營運開銷和資料傳輸成本。
AI 模型管理將更加整合至統一的資料平台。
將微調後的模型註冊回 Unity Catalog 進行集中管理,預示著將資料、分析和 AI 資產統一到單一治理層下的趨勢,從而簡化模型生命週期管理和可審計性。

時間線

2017-11
Amazon SageMaker 推出,作為端到端機器學習服務。
2021-05
Databricks Unity Catalog 發布,提供統一的資料治理解決方案。
2022-06
Amazon EMR Serverless 正式推出,提供無伺服器大數據分析。
2023-11
Amazon SageMaker JumpStart 宣布支援 Mistral 7B 模型微調。
2025-03
Amazon SageMaker Unified Studio 正式推出,整合 AWS 分析與 AI/ML 服務。
2025-12
Mistral AI 發布 Mistral Large 3 和 Ministral 3 (包括 3B、8B、14B 版本)。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog