
DCP 加速可變長度序列訓練
Data-Centric Parallel(DCP)會根據每個批次的序列長度,動態調整平行化規模、梯度累積與重計算等執行設定。該方法在 32 張 H200 GPU 上最高可達 2.88 倍加速,且據稱只需約 10 行程式碼即可整合至模型中。
Tag: #distributed-training23 results

Data-Centric Parallel(DCP)會根據每個批次的序列長度,動態調整平行化規模、梯度累積與重計算等執行設定。該方法在 32 張 H200 GPU 上最高可達 2.88 倍加速,且據稱只需約 10 行程式碼即可整合至模型中。
全新教育性 GitHub 儲存庫從頭實現 PyTorch 分散式訓練,涵蓋 DP、FSDP、TP、FSDP+TP 和 PP。使用明確的前向/反向邏輯和集體通訊,基於簡單 MLP 模型。有助將分散式訓練數學對應到可執行程式碼。

PyTorch 推出 Flight Recorder,一款用於理解大型 AI 模型訓練中 NCCL Watchdog 超時的新除錯工具。它提供失敗集體操作如 ALLREDUCE 的詳細追蹤記錄。這有助開發者診斷並解決分散式訓練的中斷問題。