🤝較早收集於 16h

Together GPU Clusters 新增自動擴展與自癒功能

Together GPU Clusters 新增自動擴展與自癒功能
PostLinkedIn
🤝閱讀原文: Together AI Blog
#autoscaling#observability#self-healing#rbactogether-gpu-clusterstogether-ai

💡自動擴展與自癒讓 GPU 基礎設施生產就緒—AI 團隊立即減少停機時間。(48字)

⚡ 30-Second TL;DR

有什麼變化

內建自動擴展以動態調整資源

為什麼重要

此升級透過自動化擴展與修復,降低 AI 團隊的運營負擔,讓他們專注模型開發。它支援企業級工作負載,提升 GPU 運算的成本效益與可靠性。

下一步行動

部署 Together GPU Cluster 並為下一個推論工作負載啟用自動擴展。

誰應關注:Enterprise & Security Teams

關鍵要點

  • 內建自動擴展以動態調整資源
  • RBAC 用於安全存取控制
  • 全棧可觀測性用於監控
  • 自癒節點修復提升韌性

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • Together AI 於 2025 年 9 月推出 Instant Clusters 服務,支援從單一 8 GPU 節點到 4,000+ GPU 的大規模叢集,具備預先配置的驅動程式、排程器和 InfiniBand 互連,可在數分鐘內部署[1][2][3]
  • Together AI 的 GPU 叢集整合 Kubernetes 和 Slurm 編排工具,支援 NVIDIA H100、H200、B200 和 GB200 GPU,並提供靈活的租賃期限(3-90 天)和按小時計費模式[2][3]
  • Together AI 於 2026 年 3 月 5 日發布 FlashAttention-4 核心優化,在長序列長度上實現高達 4 倍的效能提升,並推出新的強化學習 API 支援全球分散式訓練管道[6]

🛠️ 技術深入

  • Instant Clusters 預先配置組件:GPU Operator、NVIDIA Network Operator、InfiniBand 互連、Terraform 支援,以及叢集重新掛載功能支援間歇性訓練工作負載[1]
  • 硬體驗證流程:Together AI 在叢集部署前執行硬體檢查、壓力測試和節點間通訊驗證,例如 8 節點 64 GPU 叢集會逐一預測試每個節點[1]
  • 效能優化:使用 Together Kernel Collection (TKC) 優化的 70B 參數 Llama 模型在 NVIDIA HGX B200 上達到 15,264 tokens/second/GPU,相比 H100 的 8,080 tokens/second 提升 90%[3]
  • 強化學習基礎設施:權重分發在資料中心內完成於數秒內,全球分散式規模下在一分鐘內完成同步,超過 70% 的強化學習牆鐘時間用於推論/推出階段[5]

🔮 前景展望AI analysis grounded in cited sources

自動擴展與自癒功能將降低 GPU 基礎設施營運成本
自動化資源調整和節點自修復減少手動干預和停機時間,使企業能以更低的總體擁有成本運行大規模分散式訓練。
RBAC 和全棧可觀測性將加速企業 AI 採用
細粒度存取控制和完整監控能力滿足企業安全與合規要求,降低採用生產級 GPU 基礎設施的障礙。
Together AI 的核心優化技術將成為業界標準
FlashAttention-4 和 Megakernel 實現的 3-4 倍效能提升表明硬體軟體協設計方法正在重新定義 AI 推論和訓練的經濟效益。

時間線

2025-09
Together AI 推出 Instant Clusters 自助服務 GPU 基礎設施,支援 8-64 GPU 叢集,預先配置驅動程式和編排工具
2026-03-05
Together AI 於首屆 AI Native Conference 發布 FlashAttention-4(長序列效能提升 4 倍)和強化學習 API
2026-03-16
Together AI 在 NVIDIA GTC 2026 展示 GPU Clusters 從實驗到生產的端到端工作流程
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Together AI Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。