🍎近期收集於 23h

馴服 Diffusion Transformer 中的異常 Token

馴服 Diffusion Transformer 中的異常 Token
PostLinkedIn
🍎閱讀原文: Apple Machine Learning

💡了解少數高範數 Token 為何可能劫持影像生成 Transformer 的注意力。

⚡ 30-Second TL;DR

有什麼變化

在現代 RAE-DiT 流程中,編碼器與去噪器都會出現異常 Token。

為什麼重要

研究結果顯示,Token 尺度的不穩定性不僅存在於判別式 ViT,也可能影響生成式影像模型。診斷並控制異常 Token,可能有助於改善注意力分配、表示品質與 RAE-DiT 訓練的可靠性。

下一步行動

為你的 RAE-DiT 流程加入每層 Token 範數與注意力集中度記錄,確認中間層的異常 Token 是否主導去噪過程。

誰應關注:Researchers & Academics

關鍵要點

  • 在現代 RAE-DiT 流程中,編碼器與去噪器都會出現異常 Token。
  • 預訓練 ViT 編碼器可能在擴散去噪流程前產生高範數表示。
  • DiT 可能在內部形成異常 Token,尤其是在中間層。
  • 這些 Token 可能主導注意力,卻只提供有限的局部資訊。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Apple 的研究團隊提出了一種名為『Token 歸一化』(Token Normalization)或類似的緩解策略,旨在限制這些異常 Token 的範數,從而穩定擴散模型的訓練過程。
  • 研究指出,這些異常 Token 的出現與模型在處理特定影像特徵(如高對比度邊緣或特定紋理)時的注意力機制過度集中有關。
  • 該現象不僅影響影像生成的品質,還會導致模型在推理階段出現偽影(Artifacts),特別是在生成高解析度影像時。
  • 透過分析發現,異常 Token 的高範數特徵在模型訓練的早期階段就已顯現,這表明其可能源於預訓練權重的初始化偏差。
  • 此項研究對於優化大規模 Diffusion Transformer(如 DiT-XL/2)的穩定性具有重要意義,有助於降低訓練過程中的梯度爆炸風險。

🛠️ 技術深入

  • 異常 Token 定義:指在 Transformer 層中,其嵌入向量的 L2 範數顯著高於平均水平的 Token。
  • 注意力機制影響:這些 Token 在 Softmax 計算中會佔據過高的權重,導致注意力圖(Attention Map)出現單點集中現象,忽略了其他重要的影像區域。
  • 緩解技術:研究探討了在注意力層之前應用層歸一化(Layer Normalization)或對注意力分數進行截斷(Clipping)的有效性。
  • 實驗架構:基於 DiT(Diffusion Transformer)架構,使用 ImageNet 等標準數據集進行驗證,觀察到在移除異常 Token 影響後,FID(Fréchet Inception Distance)指標有顯著改善。

🔮 前景展望AI analysis grounded in cited sources

擴散模型訓練將更依賴動態範數控制技術
隨著模型規模擴大,異常 Token 導致的訓練不穩定性將成為常態,迫使開發者在架構設計中內建自動化的範數限制機制。
預訓練 ViT 編碼器的微調策略將發生變革
為了避免異常 Token 的傳遞,未來的影像生成模型將更傾向於使用針對擴散任務專門優化或凍結特定層的 ViT 編碼器。

時間線

2022-12
伯克利大學發表 DiT (Diffusion Transformer) 論文,奠定架構基礎
2024-06
Apple 發布 OpenELM 等模型,展現對高效能 Transformer 架構的深入研究
2025-03
Apple Machine Learning 團隊開始針對擴散模型中的訓練不穩定性進行系統性分析
2026-05
Apple 發表關於馴服 Diffusion Transformer 中異常 Token 的研究成果
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Apple Machine Learning