🤝Together AI Blog•較早收集於 16h
Together GPU Clusters 新增自動擴展與自癒功能

#autoscaling#observability#self-healing#rbactogether-gpu-clusterstogether-ai
💡自動擴展與自癒讓 GPU 基礎設施生產就緒—AI 團隊立即減少停機時間。(48字)
⚡ 30-Second TL;DR
有什麼變化
內建自動擴展以動態調整資源
為什麼重要
此升級透過自動化擴展與修復,降低 AI 團隊的運營負擔,讓他們專注模型開發。它支援企業級工作負載,提升 GPU 運算的成本效益與可靠性。
下一步行動
部署 Together GPU Cluster 並為下一個推論工作負載啟用自動擴展。
誰應關注:Enterprise & Security Teams
關鍵要點
- •內建自動擴展以動態調整資源
- •RBAC 用於安全存取控制
- •全棧可觀測性用於監控
- •自癒節點修復提升韌性
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •Together AI 於 2025 年 9 月推出 Instant Clusters 服務,支援從單一 8 GPU 節點到 4,000+ GPU 的大規模叢集,具備預先配置的驅動程式、排程器和 InfiniBand 互連,可在數分鐘內部署[1][2][3]
- •Together AI 的 GPU 叢集整合 Kubernetes 和 Slurm 編排工具,支援 NVIDIA H100、H200、B200 和 GB200 GPU,並提供靈活的租賃期限(3-90 天)和按小時計費模式[2][3]
- •Together AI 於 2026 年 3 月 5 日發布 FlashAttention-4 核心優化,在長序列長度上實現高達 4 倍的效能提升,並推出新的強化學習 API 支援全球分散式訓練管道[6]
🛠️ 技術深入
- •Instant Clusters 預先配置組件:GPU Operator、NVIDIA Network Operator、InfiniBand 互連、Terraform 支援,以及叢集重新掛載功能支援間歇性訓練工作負載[1]
- •硬體驗證流程:Together AI 在叢集部署前執行硬體檢查、壓力測試和節點間通訊驗證,例如 8 節點 64 GPU 叢集會逐一預測試每個節點[1]
- •效能優化:使用 Together Kernel Collection (TKC) 優化的 70B 參數 Llama 模型在 NVIDIA HGX B200 上達到 15,264 tokens/second/GPU,相比 H100 的 8,080 tokens/second 提升 90%[3]
- •強化學習基礎設施:權重分發在資料中心內完成於數秒內,全球分散式規模下在一分鐘內完成同步,超過 70% 的強化學習牆鐘時間用於推論/推出階段[5]
🔮 前景展望AI analysis grounded in cited sources
自動擴展與自癒功能將降低 GPU 基礎設施營運成本
自動化資源調整和節點自修復減少手動干預和停機時間,使企業能以更低的總體擁有成本運行大規模分散式訓練。
RBAC 和全棧可觀測性將加速企業 AI 採用
細粒度存取控制和完整監控能力滿足企業安全與合規要求,降低採用生產級 GPU 基礎設施的障礙。
Together AI 的核心優化技術將成為業界標準
FlashAttention-4 和 Megakernel 實現的 3-4 倍效能提升表明硬體軟體協設計方法正在重新定義 AI 推論和訓練的經濟效益。
⏳ 時間線
2025-09
Together AI 推出 Instant Clusters 自助服務 GPU 基礎設施,支援 8-64 GPU 叢集,預先配置驅動程式和編排工具
2026-03-05
Together AI 於首屆 AI Native Conference 發布 FlashAttention-4(長序列效能提升 4 倍)和強化學習 API
2026-03-16
Together AI 在 NVIDIA GTC 2026 展示 GPU Clusters 從實驗到生產的端到端工作流程
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- siliconangle.com — Exclusive Together AI Launches Self Service GPU Infrastructure
- together.ai — Instant GPU Clusters
- together.ai — GPU Clusters
- together.ai
- together.ai — AI Native Conf Research and Product Announcements
- prnewswire.com — Together AI Announces Business and Product Milestones at First AI Native Conference 302705505
- together.ai — Nvidia Gtc 2026
- datacenterdynamics.com — Together AI Seeks 1bn in Funding Report
- io.net — GPU Cluster
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Together AI Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。