
新方案刷新擴散模型推理速度紀錄
來自阿里巴巴與清華大學的研究人員開發了一種極簡方案,顯著提升了擴散模型的推理速度。該論文入選 ICML 傑出論文。
Tag: #diffusion-models36 results

來自阿里巴巴與清華大學的研究人員開發了一種極簡方案,顯著提升了擴散模型的推理速度。該論文入選 ICML 傑出論文。

Google 推出了實驗性的 26B MoE 模型 DiffusionGemma,利用擴散技術而非逐個 token 的方式進行平行文字生成。此方法透過同時處理整個文字區塊,實現了高達 4 倍的推論速度提升。

來自港科大、北航與商湯的 QVGen,為影片擴散模型提出 QAT 範式,在 3/4bit 量化下逼近滿精度品質。論文獲 ICLR 2026 高分錄取。程式碼與模型已在 GitHub 與 Hugging Face 釋出。

研究人員推出了首個具備邊行動邊糾錯能力的 Agentic 擴散模型。該模型實現了 128K 的上下文視窗,在長程任務表現上追平了自回歸模型。

Hugging Face 與 NVIDIA 將 NeMo Automodel 與 Diffusers 整合,實現生成式影片與圖像模型的高效大規模微調。此合作為開發複雜擴散模型的開發者簡化了訓練流程。

研究人員推出了混合專家擴散語言模型 DiffusionGemma-26B,其在醫學視覺問答任務中的表現與自回歸模型相當甚至更優。該模型提供了獨特的雙向填充功能,允許放射科醫師編輯報告片段,同時由 AI 填補中間內容。

minFLUX 是一個輕量級的開源 PyTorch 實作,旨在幫助開發者理解 FLUX.1 與 FLUX.2 模型背後的核心架構與數學原理。它提供了與 HuggingFace diffusers 對應的逐行代碼映射,並包含完整的訓練與推論迴圈。

BrainG3N 引入了一種基於 MAE 的 3D 腦部 MRI 解耦 Tokenizer,將臨床特徵提取與體積重建分開。此架構不僅能實現高效的臨床下游分析,還能進行可控的、針對特定患者的縱向數據生成。

CVPR 2026 論文挑戰生成視覺 AI 假設,C²FG 引入動態 CFG,STARFlow-V 用流模型生成視頻,JiT 直接預測乾淨圖像。趨勢從增量調整轉向重思引導、架構與預測目標。這推動競爭向基礎重設計轉移。

FVD是一種新的擴散模型推理時對齊方法,使用Fleming-Viot重採樣解決SMC採樣器中的多樣性崩潰。它採用出生-死亡機制,結合獎勵基礎存活決策與隨機重生,避免價值函數或昂貴滾動。於DrawBench提升ImageReward 7%,類條件任務FID改善14-20%,速度快66倍。