
NVIDIA Spectrum-6 正式發布,助力超大規模 AI 工廠
NVIDIA 推出了專為超大規模 AI 工廠設計的 Spectrum-6 網路平台,旨在處理訓練前沿模型與驅動代理式 AI 所需的龐大數據需求。該硬體旨在成為提升運算效能的關鍵乘數。
Tag: #gpu-clusters14 results

NVIDIA 推出了專為超大規模 AI 工廠設計的 Spectrum-6 網路平台,旨在處理訓練前沿模型與驅動代理式 AI 所需的龐大數據需求。該硬體旨在成為提升運算效能的關鍵乘數。
Together AI 為其生產環境 GPU 叢集引入了多項可靠性與控制功能。更新內容包括被動健康檢查、節點修復以及更強大的 Slurm 整合。

NVIDIA 探討利用非均勻張量平行處理(Nonuniform Tensor Parallelism)來維持大規模 LLM 叢集的訓練效率。此方法旨在解決大規模 GPU 部署中,因設備意外中斷與資源波動所導致的效能下降問題。
Hewlett Packard Enterprise (HPE) 推出專為 AI 資料中心設計的新型網路硬體。該公司正利用收購 Juniper Networks 所獲得的技術,以搶佔企業對 AI 基礎設施日益增長的需求。
Baidu Cloud 在 Create 2026 大會上宣布升級為以代理為中心的全端 AI 雲端平台。此次更新重點在於優化大規模代理部署的推理與訓練效率。

NVIDIA GB200 NVL72 將 NVLink 一致性延伸至整個機架,提供 exascale 效能。但它強制執行機架規模局部性,跨邊界工作負載會導致效能急劇下降。Slurm 區塊排程可最佳化系統與工作負載效率。
Lumentum第三財季營收年增90%至創紀錄的8.08億美元。毛利率环比提升540個基點,營業利潤率提升700個基點。CEO表示,GPU叢集光學元件需求遠超供應,訂單已排至2028年。

中國過去兩年興起萬卡計算集群作為AI新基礎設施。這些集群連結一萬顆以上AI加速器晶片,能加速AI模型迭代並大幅縮短訓練時間。華為與阿里巴巴等科技巨頭帶動城市與企業的軍備競賽。

NVIDIA 推出 AI Cluster Runtime,這是一個用於驗證 GPU 基礎設施 Kubernetes 叢集的開源專案。它提供從驅動程式到運算子等完整軟體堆疊的分層、可重現配方。這消除了跨叢集、升級和雲端的重現性問題。

Netris 獲得 a16z 領投的 1,500 萬美元 A 輪融資。該公司提供運行於網路交換器的軟體,協助 Neocloud 營運商更快速地部署 AI 基礎設施。