☁️較早收集於 53m

AWS 推出 G7e 實例加速 SageMaker 生成式 AI 推論

AWS 推出 G7e 實例加速 SageMaker 生成式 AI 推論
PostLinkedIn
☁️閱讀原文: AWS Machine Learning Blog

💡單一 AWS GPU 節點運行 120B 開源模型,實現具成本效益的生成式 AI 推論。(58字)

⚡ 30-Second TL;DR

有什麼變化

G7e 實例採用 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU

為什麼重要

可於單一節點運行巨型生成式 AI 模型,大幅降低成本並簡化生產推論擴展。提升組織在 AWS 上採用開源大型語言模型的可及性。

下一步行動

在 SageMaker Studio 中佈建 G7e.2xlarge 實例,測試 GPT-OSS-120B 推論。

誰應關注:Developers & AI Engineers

關鍵要點

  • G7e 實例採用 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU
  • 每個節點支援 1-8 個 GPU,每個 96 GB GDDR7 記憶體
  • 單一 G7e.2xlarge 可託管 GPT-OSS-120B、Nemotron-3-Super-120B-A12B、Qwen3.5-35B-A3B
  • 為開源基礎模型提供具成本效益的高效能

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • G7e 實例整合了 AWS Nitro System,透過專用的硬體卸載功能,將虛擬化、儲存與網路管理從主 CPU 分離,顯著降低了生成式 AI 推論的延遲。
  • 該實例支援 NVIDIA Blackwell 架構的第二代 Transformer Engine,針對 FP8 與 FP4 精度進行了硬體級優化,能以更低的功耗處理更大規模的參數模型。
  • AWS 針對 G7e 實例推出了專屬的 SageMaker 推論優化容器,預先整合了 TensorRT-LLM 與 vLLM 框架,大幅縮短了企業部署開源大語言模型的開發週期。
📊 競品分析▸ Show
特性AWS G7e (RTX PRO 6000 Blackwell)Google Cloud A3 (H100)Azure ND H100 v5
GPU 架構BlackwellHopperHopper
記憶體96 GB GDDR780 GB HBM380 GB HBM3
定位高性價比推論高效能訓練/推論高效能訓練/推論
價格策略針對中型模型推論優化針對大規模訓練優化針對大規模訓練優化

🛠️ 技術深入

  • 採用 NVIDIA Blackwell 架構,具備專用的 Transformer Engine,可加速 FP8 與 FP4 運算。
  • 每個 GPU 配備 96 GB GDDR7 記憶體,提供極高的記憶體頻寬,適合處理長上下文(Long Context)推論任務。
  • 整合 AWS Nitro System,提供高達 400 Gbps 的網路頻寬,支援多節點模型並行(Model Parallelism)部署。
  • 支援 NVIDIA NVLink 技術,在多 GPU 配置下實現節點內高速互連,減少模型分片後的通訊瓶頸。

🔮 前景展望AI analysis grounded in cited sources

企業將加速從專有模型轉向開源模型部署。
G7e 實例提供的硬體效能與成本優勢,使得託管 100B 以上參數的開源模型在經濟上變得極具吸引力。
推論市場將出現針對 FP4 精度的標準化優化。
Blackwell 架構對 FP4 的硬體支援將推動軟體生態系統全面轉向更低精度的推論,以提升吞吐量。

時間線

2023-03
AWS 推出基於 NVIDIA H100 的 P5 實例,強化訓練效能。
2024-03
NVIDIA 正式發布 Blackwell 架構 GPU。
2025-09
AWS 宣布與 NVIDIA 擴大合作,將 Blackwell 架構引入雲端基礎設施。
2026-04
AWS 正式推出搭載 RTX PRO 6000 Blackwell 的 G7e 實例。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog