
以 NVIDIA FLARE 建構聯邦多模態 AI 工作流程
NVIDIA FLARE 讓組織能在不集中敏感影像與文字資料的情況下,協調 vision-language models 的訓練。此方法支援視覺問答、圖片描述及圖文推理等多模態應用,同時讓原始資料保留在各機構本地。
Tag: #distributed-training23 results

NVIDIA FLARE 讓組織能在不集中敏感影像與文字資料的情況下,協調 vision-language models 的訓練。此方法支援視覺問答、圖片描述及圖文推理等多模態應用,同時讓原始資料保留在各機構本地。

本文探討 Pangu 模型在 Huawei 昇騰平台上的訓練與推理通訊最佳化實務。內容聚焦於提升平台親和性,以及改善 AI 工作負載的整體效能。
Macrocosmos 論文推出 ResBM,一種用於低頻寬管線並行訓練的 transformer 架構,實現 SOTA 128 倍激活壓縮。具備跨階段殘差編碼器-解碼器瓶頸,保留低階身份路徑。針對去中心化/網際網路級訓練,使用 Muon 測試。

中國已在國家超級計算互聯網鄭州核心節點,啟用首座完全國產化的十萬卡 AI 超級叢集。粵港澳大灣區也同步部署,配合 NDRC 建立統一國家算力網路的規劃。

Meta 詳細說明如何將其 Generative Ads Recommendation Model(GEM)擴展至數千張最新世代 GPU 上進行訓練。在訓練 FLOPs 增加四倍的同時,Meta 將端到端訓練效率提升一倍,達到 20–25% 的 Model FLOPs Utilization。

Hugging Face 與 NVIDIA 將 NeMo Automodel 與 Diffusers 整合,實現生成式影片與圖像模型的高效大規模微調。此合作為開發複雜擴散模型的開發者簡化了訓練流程。

PyTorch Monarch 現已支援 AMD GPU,實現了基於 ROCm 的單控制器分散式訓練。此更新旨在簡化在大型 GPU 叢集上進行大型語言模型訓練的擴展流程。

NVIDIA 探討利用非均勻張量平行處理(Nonuniform Tensor Parallelism)來維持大規模 LLM 叢集的訓練效率。此方法旨在解決大規模 GPU 部署中,因設備意外中斷與資源波動所導致的效能下降問題。

SpaceX 在無法解決其 Grok AI 模型所需的延遲問題後,將其 Colossus 1 資料中心租給了 Anthropic。該位於 Memphis 的設施無法與 SpaceX 的其他資料中心園區進行有效整合。

AgentJet 是一個全新的分布式群體訓練框架,將代理執行與模型優化解耦。它支援異構多代理訓練,並透過創新的上下文追蹤模組實現了顯著的訓練加速。