
Blackwell 上更快的擴散模型:MXFP8 與 NVFP4 搭配 Diffusers 和 TorchAO
PyTorch 部落格宣布在 NVIDIA Blackwell GPU 上使用 MXFP8 和 NVFP4 格式,搭配 Diffusers 和 TorchAO 優化擴散模型。這些功能實現超逼真影像與影片生成,同時解決記憶體與運算限制。此更新促進擴散模型在 AI 工作流程中的採用。
Tag: #diffusion-models36 results

PyTorch 部落格宣布在 NVIDIA Blackwell GPU 上使用 MXFP8 和 NVFP4 格式,搭配 Diffusers 和 TorchAO 優化擴散模型。這些功能實現超逼真影像與影片生成,同時解決記憶體與運算限制。此更新促進擴散模型在 AI 工作流程中的採用。

香港大學趙恆爽團隊提出 GDRO,一種群組級獎勵後訓練方法,讓擴散模型在任務中取得高分卻不作弊。它支援完全離線訓練,使用預生成資料集,大幅降低重複採樣的計算成本。在 OCR 和 GenEval 任務上以 FLUX.1-dev 展現優異結果,並經人工評估驗證。

擴散語言模型在推理任務上表現不佳,歸因於協調問題;計劃條件方法在前置自迴歸模型生成的計劃作為支架,將 LLaDA-8B-Instruct 在 GSM8K 上從 75.6% 提升至 87.2%,HumanEval 從 37.2% 至 50.0%。擴散模型受益幅度為 AR 基線的 2-10 倍,跨種子標準差為零,推理極其穩定。此方法每題成本約 0.002 美元,延遲增加約 2 秒。
Hugging Face 推出模組化 Diffusers,這是專為擴散管線設計的可組合構建模塊。此發布讓開發者能以更高靈活性組裝自訂生成模型工作流程。經 Hugging Face 部落格公告。

R2IR 和 R2ID 是新型架構,在 32x32 影像上訓練,能泛化至任意解析度和寬高比。它們能以每秒 4 步的速度擴散 4MP 影像。使用相對座標的像素令牌,克服 UNet 卷積和 DiT 縮放缺陷。
擴散模型在深度思考任務中達到前所未有的每秒1009個tokens速度,超越自迴歸模型。此轉變預示AI生成更高效。英偉達與微軟已投資此突破性技術。

Together AI 的 Consistency Diffusion Language Models (CDLM) 解決標準擴散語言模型的限制,透過精確區塊式 KV 快取和軌跡一致步驟減少。這種後訓練配方在不損品質下提供最高 14.5 倍延遲改善。它讓擴散語言模型適用於實際應用。

Apple Machine Learning 發表 Diffusion Language Models 與 Autoregressive Language Models 的效能比較研究。該研究探討可替代序列式下一個 Token 預測的方法,因為後者雖具備出色的下游準確度,卻受限於較低的算術強度。
Stereo2Spatial 是一個開源模型,可將標準立體聲音樂轉換為空間化雙耳音訊。它利用在原始波形上訓練的流匹配擴散模型,克服了潛空間方法中常見的品質限制。

Apple 研究人員探討了學習型解碼策略,旨在提升 Diffusion Language Models (dLLMs) 的效率與品質。此研究旨在取代手動啟發式閾值設定,透過自動化策略優化推論效能。