🐼較早收集於 77m

清華與阿里巴巴發表 ViT³:具備線性複雜度的視覺 Transformer

清華與阿里巴巴發表 ViT³:具備線性複雜度的視覺 Transformer
PostLinkedIn
🐼閱讀原文: Pandaily

💡新型線性複雜度視覺 Transformer 讓邊緣裝置也能處理高解析度 AI,是高效電腦視覺的一大突破。

⚡ 30-Second TL;DR

有什麼變化

實現視覺任務的線性計算複雜度

為什麼重要

ViT³ 解決了標準 Transformer 的二次方複雜度瓶頸,有望在行動裝置與物聯網硬體上實現即時 AI 視覺應用。

下一步行動

查閱 CVPR 2026 會議論文集中的 ViT³ 研究,並評估其在邊緣部署專案中相較於標準 ViT 模型的效能表現。

誰應關注:Researchers & Academics

關鍵要點

  • 實現視覺任務的線性計算複雜度
  • 引入視覺測試時訓練 (ViT³) 架構
  • 針對邊緣裝置的高解析度影像理解進行優化
  • 獲選為 CVPR 2026 口頭報告論文

🧠 深度解析

Web-grounded analysis with 21 cited sources.

🔑 增強重點摘要

  • ViT³ 透過將注意力機制重新詮釋為在測試時解決的線上學習問題來實現其線性複雜度,其中一個緊湊的「內部模型」會透過基於梯度最佳化進行即時調整。
  • 該方法在即時調整注意力時,可選擇使用 GLU 風格的多層感知器 (MLP) 或 3x3 深度可分離卷積來映射鍵值對,這提供了內部模型的具體架構選擇。
  • ViT³ 已在多種視覺任務中進行評估,包括影像分類、影像生成、物件偵測和語義分割,其性能持續超越 Mamba 和線性注意力變體等先進的線性複雜度模型。
  • 這項研究透過系統性實驗,為高效能視覺測試時訓練 (TTT) 模型建立了六項實用見解和設計原則,為該領域的未來發展提供了指導。
  • ViT³ 區塊被設計為可插拔模組,可輕鬆整合到各種視覺 Transformer 框架中,提升其在不同應用中的通用性和部署彈性。
📊 競品分析▸ Show
特點/模型ViT³ (清華/阿里巴巴)MobileViT (Apple)EfficientFormerL²ViTSwin Transformer
架構類型純 TTT (測試時訓練) Transformer混合 CNN-Transformer純 Vision Transformer混合線性全局與局部窗口注意力 Transformer分層局部窗口注意力 Transformer
計算複雜度線性 (O(N))輕量級輕量級線性 (O(N))線性 (透過局部窗口)
主要優化將注意力重塑為測試時線上學習,即時適應內部模型結合 CNN 的歸納偏置與 Transformer 的全局上下文建模直接優化行動裝置延遲,推動純 ViT 的性能與速度極限增強線性全局注意力與局部窗口注意力,捕捉全局與局部表示採用局部注意力窗口和層次結構以降低計算成本
ImageNet Top-1 準確度匹配或超越先進線性複雜度模型,縮小與高效能二次複雜度 ViT 的差距78.4% (約 6M 參數,優於 MobileNetv3 和 DeIT)EfficientFormer-L1 達 79.2% (1.6ms 延遲於 iPhone 12)84.4% (無額外訓練數據)-
邊緣裝置適用性針對資源受限邊緣裝置的高解析度影像理解進行優化輕量級、通用且適用於行動裝置專為行動裝置上的低延遲設計旨在解決二次複雜度對高解析度影像的限制透過局部注意力降低計算成本,適用於邊緣裝置

🛠️ 技術深入

  • 核心創新: ViT³ 將傳統 Transformer 的注意力操作重新定義為一個線上學習問題,並在測試時進行解決。
  • 機制: 在推論階段,模型會從鍵值對 (key-value pairs) 中建構一個緊湊的「內部模型」,並透過少量的梯度步驟進行即時適應。
  • 內部模型設計: 內部模型可以實現為 GLU (Gated Linear Unit) 風格的多層感知器 (MLP) 或 3x3 深度可分離卷積,用於映射鍵值對。
  • 內部訓練設定: 研究發現,內部訓練的最佳設定包括使用 Smooth L1 損失函數 (優於 MAE)、單次全批量梯度下降、以及相對較大的內部學習率 (1.0)。
  • 計算複雜度: 透過此機制,ViT³ 實現了線性時間和空間複雜度 (O(N)),顯著優於傳統 softmax 注意力的二次複雜度 (O(N²))。
  • 模組化設計: ViT³ 區塊被設計為可插拔模組,可以輕鬆整合到現有的視覺 Transformer 框架中,適用於多種視覺任務。
  • 性能表現: 在影像分類、生成、物件偵測和語義分割等多種視覺任務上,ViT³ 的性能與先進的線性複雜度模型 (如 Mamba 和線性注意力變體) 持平或更優,並有效縮小了與高度優化的二次複雜度 Vision Transformer 之間的性能差距。
  • 研究團隊: 該研究由清華大學博士生韓東辰主導,並由黃高副教授指導。

🔮 前景展望AI analysis grounded in cited sources

ViT³ 將加速高解析度視覺 AI 在邊緣裝置上的普及。
其線性計算複雜度顯著降低了資源需求,使其在高解析度影像處理上更具可行性,尤其適用於行動裝置和物聯網設備。
測試時訓練 (TTT) 範式將成為設計高效能視覺 Transformer 的新興方向。
ViT³ 證明了 TTT 在實現線性複雜度同時保持高表現的潛力,並為未來的視覺 TTT 模型提供了堅實的基準。
視覺 Transformer 的設計將更傾向於混合架構,融合不同優化策略以平衡效率與性能。
許多高效 ViT 模型(如 MobileViT、L²ViT)已採用混合設計,ViT³ 的模組化特性也支持其與其他優化技術結合。

時間線

2017-06
Transformer 架構問世,徹底改變自然語言處理領域。
2020-10
Vision Transformer (ViT) 將 Transformer 成功延伸到計算機視覺領域。
2021-10
Apple 發表 MobileViT,提出輕量級通用視覺 Transformer,結合 CNN 和 ViT 優勢。
2022-01
清華大學黃高團隊提出 Deformable Attention Transformer (DAT),一種分層視覺 ViT。
2025-12
ViT³ (Vision Test-Time Training) 論文首次在 arXiv 上發布。
2026-05
清華大學與阿里巴巴聯合發表 ViT³,獲選為 CVPR 2026 口頭報告論文。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily