
AMD GPU 獲得上游 FP8 訓練支援
PyTorch 已將 Primus-Turbo 的 AMD 最佳化功能上游整合至 TorchTitan 與 TorchAO,讓兩者可直接支援 AMD Instinct GPU。此更新提供開箱即用且具競爭力的 FP8 訓練效能,並延續超過 1,000 張 GPU 的擴展成果。
Tag: #pytorch12 results

PyTorch 已將 Primus-Turbo 的 AMD 最佳化功能上游整合至 TorchTitan 與 TorchAO,讓兩者可直接支援 AMD Instinct GPU。此更新提供開箱即用且具競爭力的 FP8 訓練效能,並延續超過 1,000 張 GPU 的擴展成果。

minFLUX 是一個輕量級的開源 PyTorch 實作,旨在幫助開發者理解 FLUX.1 與 FLUX.2 模型背後的核心架構與數學原理。它提供了與 HuggingFace diffusers 對應的逐行代碼映射,並包含完整的訓練與推論迴圈。

PyTorch 為機器學習核心的領域特定語言 Helion 引入了 LLM 引導的自動調優技術。此方法將效能調優所需的時間從幾分鐘大幅縮短至幾秒鐘。
本文探討 PyTorch 編譯器如何透過 Kernel Fusion 技術實現高達 10 倍的效能提升。文中解釋了從執行單一 GPU Kernel 到優化融合運算的技術轉變。

NVIDIA nvCOMP 僅需 30 行 Python 即可壓縮 LLM 訓練檢查點。70B 模型檢查點達 782 GB,每 15-30 分鐘一次,造成高儲存成本。此工具大幅降低費用,同時維持 GPU 使用率焦點。

Tensey 是一款全新的視覺化編輯器,讓開發者能在模型設計階段驗證張量形狀、計算參數數量,並預估 FLOPs 與 VRAM 使用量。它能幫助開發者在早期發現架構不匹配問題,並匯出可執行的 PyTorch 程式碼。
WeightsLab 是一款全新的開源 PyTorch 原生工具,旨在協助電腦視覺工程師即時除錯訓練過程。它允許使用者暫停訓練以檢查損失訊號,並識別標籤錯誤、類別不平衡及異常值等數據問題。
AdamWClip 是 AdamW 優化器的擴展,具備自適應梯度裁剪功能,無需手動設定閾值。它不需額外記憶體,且計算開銷極小。初步實驗顯示,它明顯優於標準 grad_norm 裁剪的 AdamW。
Reddit 貼文尋求 PyTorch 自訂 RL 演算法資源、在 Gym 基準測試對比基線。詢問程式碼優化、目錄結構、Docker、Mac/Linux 相容。
PyTorch now leverages Pyrefly to power type checking across its core repository. This extends to ecosystem projects including Helion and TorchTitan.