☁️AWS Machine Learning Blog•較早收集於 53m
AWS 推出 G7e 實例加速 SageMaker 生成式 AI 推論

💡單一 AWS GPU 節點運行 120B 開源模型,實現具成本效益的生成式 AI 推論。(58字)
⚡ 30-Second TL;DR
有什麼變化
G7e 實例採用 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU
為什麼重要
可於單一節點運行巨型生成式 AI 模型,大幅降低成本並簡化生產推論擴展。提升組織在 AWS 上採用開源大型語言模型的可及性。
下一步行動
在 SageMaker Studio 中佈建 G7e.2xlarge 實例,測試 GPT-OSS-120B 推論。
誰應關注:Developers & AI Engineers
關鍵要點
- •G7e 實例採用 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU
- •每個節點支援 1-8 個 GPU,每個 96 GB GDDR7 記憶體
- •單一 G7e.2xlarge 可託管 GPT-OSS-120B、Nemotron-3-Super-120B-A12B、Qwen3.5-35B-A3B
- •為開源基礎模型提供具成本效益的高效能
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •G7e 實例整合了 AWS Nitro System,透過專用的硬體卸載功能,將虛擬化、儲存與網路管理從主 CPU 分離,顯著降低了生成式 AI 推論的延遲。
- •該實例支援 NVIDIA Blackwell 架構的第二代 Transformer Engine,針對 FP8 與 FP4 精度進行了硬體級優化,能以更低的功耗處理更大規模的參數模型。
- •AWS 針對 G7e 實例推出了專屬的 SageMaker 推論優化容器,預先整合了 TensorRT-LLM 與 vLLM 框架,大幅縮短了企業部署開源大語言模型的開發週期。
📊 競品分析▸ Show
| 特性 | AWS G7e (RTX PRO 6000 Blackwell) | Google Cloud A3 (H100) | Azure ND H100 v5 |
|---|---|---|---|
| GPU 架構 | Blackwell | Hopper | Hopper |
| 記憶體 | 96 GB GDDR7 | 80 GB HBM3 | 80 GB HBM3 |
| 定位 | 高性價比推論 | 高效能訓練/推論 | 高效能訓練/推論 |
| 價格策略 | 針對中型模型推論優化 | 針對大規模訓練優化 | 針對大規模訓練優化 |
🛠️ 技術深入
- 採用 NVIDIA Blackwell 架構,具備專用的 Transformer Engine,可加速 FP8 與 FP4 運算。
- 每個 GPU 配備 96 GB GDDR7 記憶體,提供極高的記憶體頻寬,適合處理長上下文(Long Context)推論任務。
- 整合 AWS Nitro System,提供高達 400 Gbps 的網路頻寬,支援多節點模型並行(Model Parallelism)部署。
- 支援 NVIDIA NVLink 技術,在多 GPU 配置下實現節點內高速互連,減少模型分片後的通訊瓶頸。
🔮 前景展望AI analysis grounded in cited sources
企業將加速從專有模型轉向開源模型部署。
G7e 實例提供的硬體效能與成本優勢,使得託管 100B 以上參數的開源模型在經濟上變得極具吸引力。
推論市場將出現針對 FP4 精度的標準化優化。
Blackwell 架構對 FP4 的硬體支援將推動軟體生態系統全面轉向更低精度的推論,以提升吞吐量。
⏳ 時間線
2023-03
AWS 推出基於 NVIDIA H100 的 P5 實例,強化訓練效能。
2024-03
NVIDIA 正式發布 Blackwell 架構 GPU。
2025-09
AWS 宣布與 NVIDIA 擴大合作,將 Blackwell 架構引入雲端基礎設施。
2026-04
AWS 正式推出搭載 RTX PRO 6000 Blackwell 的 G7e 實例。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog ↗

