🤖較早收集於 6h

用於可擴展視覺 Transformer 的彈性注意力核心

用於可擴展視覺 Transformer 的彈性注意力核心
PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡一種新的稀疏注意力機制,使高解析度視覺 Transformer 的效率顯著提高。

⚡ 30-Second TL;DR

有什麼變化

引入了規模為 (2NC + C2) 的核心-周邊區塊稀疏注意力結構。

為什麼重要

該架構透過降低自注意力的二次成本,顯著提高了視覺 Transformer 在高解析度任務中的可擴展性。

下一步行動

查看 VECA GitHub 儲存庫,在您自己的視覺模型中嘗試核心-周邊注意力區塊。

誰應關注:Developers & AI Engineers

關鍵要點

  • 引入了規模為 (2NC + C2) 的核心-周邊區塊稀疏注意力結構。
  • 嵌套 Dropout 實現了測試時推理成本的彈性調整。
  • 注意力模式在淺層顯示出湧現的各向同性行為,在深層則顯示出語義對齊。

🧠 深度解析

Web-grounded analysis with 17 cited sources.

🔑 增強重點摘要

  • 該論文引入了視覺彈性核心注意力(VECA)架構,挑戰了傳統視覺Transformer(ViT)中所有token之間兩兩交互的假設,證明無需直接的patch-to-patch交互也能學習有效的視覺語義表示。
  • VECA透過一組學習到的「核心」嵌入作為通訊介面,圖像patch token僅透過這些核心token交換資訊,從而實現了對於預定核心token數量C的線性複雜度O(N)。
  • 該架構結合了沿核心軸的嵌套訓練,使其能夠在推理時彈性地權衡計算成本和準確度。
  • VECA在分類和密集任務中實現了與最新視覺基礎模型(例如DINOv3)相當的性能,同時降低了計算成本,並在256到1024的廣泛解析度範圍內保持穩定。
  • 核心-周邊結構的設計靈感來自於人腦網絡的組織原則,其中核心節點扮演整合角色,作為周邊節點交換資訊的中心。
📊 競品分析▸ Show
特徵/指標彈性注意力核心 (VECA)Swin TransformerBiFormerSparsifinerMaxViT
注意力機制核心-周邊區塊稀疏注意力階層式特徵圖與移位視窗注意力路由稀疏注意力 (top-k gating)學習實例相關的注意力模式多軸注意力 (區塊與網格注意力)
複雜度O(N) (對於預定C核心token)透過局部視窗降低複雜度O(N^(4/3))透過學習稀疏模式降低FLOPsO(N) (透過控制視窗大小)
彈性調整嵌套Dropout實現測試時推理成本彈性調整無此明確功能無此明確功能無此明確功能無此明確功能
性能基準與DINOv3競爭性準確度在COCO等目標檢測數據集上達到SOTA在ImageNet上超越SOTA ViT模型在ImageNet上FLOPs減少48%-69%,準確度下降在0.4%以內在ImageNet上實現線性複雜度

備註:VECA與列出的所有競爭者之間缺乏直接的數值基準比較,此表格主要基於其設計特點和複雜度分析。

🛠️ 技術深入

  • 架構名稱:視覺彈性核心注意力(Visual Elastic Core Attention, VECA)。
  • 核心-周邊結構:VECA採用核心-周邊區塊稀疏注意力結構,其中一小組學習到的「核心」嵌入作為通訊介面。圖像patch token僅透過這些核心token交換資訊,而非直接相互作用。這些核心token從頭開始初始化並跨層傳播。
  • 稀疏性與複雜度:注意力結構的規模為(2NC + C2),其中N是輸入token的數量,C是核心token的數量。對於預定的C值,這使得計算複雜度達到線性O(N),從而繞過了傳統ViT中自注意力機制與圖像解析度呈二次方關係的限制。
  • 彈性調整機制:透過使用嵌套Dropout進行訓練,模型能夠在測試時彈性地調整推理成本。嵌套Dropout是一種正則化技術,它隱式地對網絡參數進行排序,生成一系列子網絡,使其架構可以根據計算約束即時調整。
  • 生物學啟發:核心-周邊原則的靈感來源於人腦網絡的組織方式,其中存在一個緊密連接的「核心」節點群和一個稀疏連接到核心的「周邊」節點群,這種結構指導了資訊的通訊機制。
  • 性能穩定性:該模型在廣泛的解析度範圍內(從256到1024)表現穩定,這對於高解析度圖像處理至關重要。

🔮 前景展望AI analysis grounded in cited sources

更廣泛地採用彈性計算模型
測試時調整推理成本的能力將使Vision Transformer更適用於資源受限的設備和動態工作負載,推動邊緣AI和行動應用的發展。
推動受生物學啟發的注意力機制研究
核心-周邊結構借鑒了人腦網絡的組織原則,這可能會激發更多將生物學見解應用於神經網絡設計的研究,以提高效率和可解釋性。
加速高解析度視覺任務的發展
透過解決自注意力機制的二次方複雜度問題並在不同解析度下保持穩定性,該架構將使高解析度圖像和影片處理變得更加可行和高效,有利於醫療影像、自動駕駛等領域。

時間線

2017-06
Transformer架構在自然語言處理(NLP)領域被引入,發表了《Attention Is All You Need》論文。
2020-10
Vision Transformer (ViT) 被提出,將Transformer架構應用於圖像識別,挑戰了卷積神經網絡(CNN)在電腦視覺領域的主導地位。
2021-01
嵌套Dropout的變體被提出,用於構建可根據計算約束即時調整架構的神經網絡。
2022-06
《Scaling Vision Transformers》論文發表,成功訓練出一個具有20億參數的ViT模型,在ImageNet上達到90.45%的top-1準確度。
2023-03
CP-ViT(Core-Periphery Vision Transformer)框架被提出,利用人腦網絡的核心-周邊組織原則指導自注意力機制設計。
2026-05-13
《用於可擴展視覺 Transformer 的彈性注意力核心》(VECA)論文在arXiv和Reddit r/MachineLearning上分享,引入核心-周邊區塊稀疏注意力結構和嵌套Dropout。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning