
FedRE:利用「糾纏」解決聯邦學習三難困境
來自中國信通院與清華大學的研究團隊提出了 FedRE,這是一個旨在平衡聯邦學習中隱私、通訊效率與模型效能的新框架。該方法利用基於「糾纏」的機制,克服了分散式 AI 訓練中固有的權衡難題。
Tag: #distributed-training23 results

來自中國信通院與清華大學的研究團隊提出了 FedRE,這是一個旨在平衡聯邦學習中隱私、通訊效率與模型效能的新框架。該方法利用基於「糾纏」的機制,克服了分散式 AI 訓練中固有的權衡難題。

NVIDIA 的 NCCL Inspector 提供輕量級、即時效能監控,用於 NCCL 的分散式深度學習 GPU 間通訊。它加速除錯,精準定位運算、通訊、特定 rank 或硬體問題。此工具與 Prometheus 整合,提供持續可觀測性。
DeepMind 推出解耦 DiLoCo,這是一種用於彈性分散式 AI 訓練的新技術。它代表了大規模模型訓練中處理故障的新前沿。此公告來自 DeepMind 部落格。

DeepSeek 更新其 DeepGEMM 儲存庫,新增對 Mega MoE 的測試支援,包括 P4 量化、分佈式通訊、Blackwell 適配以及 HyperConnection 訓練。這暗示正準備部署比 V3 更大的 MoE 模型,可能為 DeepSeek V4,需要 FP4 以實現高效推論。此更新僅限 DeepGEMM 開發,與內部模型發布無關。

Monarch 是一款新 API,能簡化在巨型叢集上執行分散式訓練任務。它特別適用於分散式強化學習等複雜設定。此工具解決大型訓練除錯的關鍵挑戰。

TGS 利用 Amazon SageMaker HyperPod 實現 Vision Transformer 基礎地震基礎模型 (SFM) 的近線性分散式訓練縮放。此方法將訓練時間從 6 個月縮短至 5 天。同時擴展上下文窗口,能分析以往不可能的大型地震體積。
PyTorch 2.11 已發佈,引入可微分集體運算以提升分散式訓練。FlexAttention 現支援 FlashAttention-4 以提高效能。完整發行說明詳列所有變更。

ImportAI 第449期報導LLM訓練其他LLM、成功的72B參數分散式訓練執行,以及研究顯示電腦視覺比生成文字更難。同時探討AI是否會引發政治空窗期。

這篇文章展示如何使用 veRL 的 GRPO 在 SageMaker 管理的 Ray 分佈式叢集上訓練 CodeFu-7B,一個專為競賽程式設計的 70 億參數模型。它涵蓋資料準備、分佈式訓練設定和全面觀測性。此統一方法為複雜 RL 訓練工作負載提供計算規模和開發者體驗。
torch-preflight 是一款 PyTorch 程式碼靜態檢查工具,可在不匯入或執行程式的情況下,找出代價高昂的訓練錯誤。它也能估算指定 GPU 的 VRAM 使用量,並建議讓訓練執行符合容量的方法。