☁️AWS Machine Learning Blog•最新收集於 10m
Salesforce 將 SageMaker 推論分散至多個可用區

#multi-az#high-availability#model-serving#cost-efficiencysagemaker-inference-componentssalesforcesagemakeraws
💡了解如何符合 Multi-AZ 高可用性要求,同時保留多模型託管的效率。
⚡ 30-Second TL;DR
有什麼變化
Salesforce 使用 SchedulingConfig 參數控制 Inference Component 的部署位置。
為什麼重要
此部署提供了一種實用架構,協助需要更高可用性保證的企業避免放棄高效率的模型託管方式。這能幫助團隊在合規性、韌性與推論基礎設施成本之間取得平衡。
下一步行動
檢視 SageMaker Inference Components 的 SchedulingConfig,並在現有多模型端點上測試跨可用區的模型部署。
誰應關注:Enterprise & Security Teams
關鍵要點
- •Salesforce 使用 SchedulingConfig 參數控制 Inference Component 的部署位置。
- •模型副本分散至多個可用區,以提升高可用性。
- •此架構符合 Multi-AZ 合規要求。
- •即使將模型分散到不同可用區,仍能維持多模型共置的成本效益。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Salesforce 透過 SageMaker 多容器端點(Multi-Container Endpoints)技術,在單一執行個體上整合多個模型,藉此最大化 GPU 資源利用率。
- •Salesforce 的 Einstein AI 平台針對 Apex 程式語言進行了專門的微調,並部署了包含 Inline、BlockGen 與 FlowGPT 在內的專有模型組合。
- •透過 AWS PrivateLink 技術,Salesforce 確保了推論流量維持在虛擬私有雲(VPC)內部,有效降低了跨可用區傳輸的延遲。
- •Salesforce 採用 SageMaker 深度學習容器(DLCs)來標準化部署環境,透過預先配置的 CUDA 與優化函式庫,顯著降低了基礎設施的維運開銷。
- •Salesforce 的 AI 模型服務團隊開發了一套專屬的託管框架,旨在簡化模型生命週期管理,以滿足 EinsteinGPT 開發者工具的高吞吐量需求。
📊 競品分析▸ Show
| 特性 | Amazon SageMaker (Salesforce 採用) | Google Vertex AI | Azure Machine Learning |
|---|---|---|---|
| 多模型共置 | 支援 Multi-Container Endpoints | 支援 Model Garden/Endpoints | 支援 Managed Endpoints |
| 可用區部署 | 原生 Multi-AZ 支援 | 原生 Multi-AZ 支援 | 原生 Multi-AZ 支援 |
| 專有模型優化 | 深度整合 CodeGen | 針對 Gemini 優化 | 針對 Llama/Phi 優化 |
🛠️ 技術深入
- 採用 SchedulingConfig 參數精確控制 Inference Component 在不同可用區的分配策略。
- 利用 Multi-Container Endpoints 實現資源動態重分配,在流量高峰期無需手動調整硬體配置。
- 透過 SageMaker Deep Learning Containers (DLCs) 封裝模型環境,確保跨可用區的一致性與執行效能。
- 整合 AWS PrivateLink 以實現 VPC 內部的安全推論,並確保請求路由至距離來源最近的可用區。
🔮 前景展望AI analysis grounded in cited sources
Salesforce 將進一步擴大無伺服器推論(Serverless Inference)的採用比例。
隨著模型共置技術的成熟,Salesforce 能夠在不犧牲高可用性的前提下,透過無伺服器架構進一步降低閒置成本。
多可用區部署將成為 Salesforce Einstein AI 平台的標準合規配置。
為了滿足企業級客戶對服務連續性的嚴格要求,分散式推論架構將從選配轉為預設的基礎設施標準。
⏳ 時間線
2023-03
Salesforce 宣布推出 EinsteinGPT,標誌著其生成式 AI 策略的重大轉型。
2024-05
Salesforce 與 AWS 深化合作,針對 Einstein AI 平台優化 SageMaker 託管架構。
2025-02
Salesforce 導入多容器端點技術,以提升 CodeGen 模型系列的推論效率。
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。

