📄ArXiv AI•最新收集於 11h
MAP 在推論前大幅削減視覺 Token

💡了解 MAP 如何僅使用 5.56% 視覺 Token,仍保留 MLLM 97.5% 的效能。
⚡ 30-Second TL;DR
有什麼變化
MAP 透過 Question Contrastive Teacher Selection 選擇每個樣本專屬的教師層,避免依賴固定中間層。
為什麼重要
此方法可大幅降低多模態推論成本與延遲,尤其適合高解析度影像或長視覺序列。其早期剪枝設計也能與現有推論加速方法相容,但仍需在不同模型與工作負載上驗證實際品質。
下一步行動
在 LLaVA-NeXT-7B 上建立 MAP 式早期視覺 Token 剪枝原型,並針對目標視覺語言任務測試準確率、Token 保留率與端到端延遲。
誰應關注:Researchers & Academics
關鍵要點
- •MAP 透過 Question Contrastive Teacher Selection 選擇每個樣本專屬的教師層,避免依賴固定中間層。
- •輕量級預測器從多模態輸入特徵蒸餾出基於注意力的視覺 Token 重要性。
- •視覺 Token 在進入第一個語言模型層前即被剪枝,並結合多樣性準則以保留有用資訊。
- •在 LLaVA-NeXT-7B 的十項基準測試中,MAP 以 5.56% 的視覺 Token 保留 97.5% 基準效能,並帶來 3.09 倍加速。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •MAP(Multimodal Attention Pruning)技術的核心在於解決視覺語言模型(VLM)中視覺 Token 冗餘導致的計算瓶頸,特別是針對高解析度圖像輸入時的效能損耗。
- •該研究提出的 Question Contrastive Teacher Selection 機制,旨在動態識別最能代表視覺特徵的教師層,而非依賴傳統的固定層特徵提取。
- •MAP 的設計允許在推理階段實現即插即用的部署,無需對原始的 LLaVA-NeXT 模型進行複雜的微調或架構重構。
- •除了加速推理,MAP 還透過多樣性準則(Diversity Criterion)確保剪枝後的 Token 集合能覆蓋圖像中的關鍵語義區域,防止資訊遺失。
- •該方法在處理長序列多模態任務時表現出顯著優勢,因為視覺 Token 的減少直接降低了注意力機制的二次計算複雜度。
📊 競品分析▸ Show
| 特性/模型 | MAP (LLaVA-NeXT) | FastV | TokenPacker |
|---|---|---|---|
| 剪枝策略 | 樣本專屬中層注意力預測 | 基於注意力權重固定剪枝 | 視覺 Token 壓縮/合併 |
| 推理加速 | 3.09 倍 | 約 2 倍 | 視壓縮率而定 |
| 效能保留 | 97.5% | 約 95-96% | 視任務而定 |
| 適用場景 | 動態視覺重要性評估 | 靜態視覺 Token 篩選 | 視覺特徵降維 |
🛠️ 技術深入
- 預測器架構:採用輕量級 MLP 或小型卷積層,從輸入的視覺特徵圖中提取注意力分數,並在進入 LLM 前進行 Top-K 篩選。
- 教師選擇機制:利用 Question Contrastive Teacher Selection,根據問題與視覺特徵的相關性,動態選擇最適合的教師層進行知識蒸餾。
- 剪枝時機:在視覺編碼器(Vision Encoder)輸出後、投影層(Projector)進入 LLM 之前執行,確保後續計算負載最小化。
- 多樣性準則:引入空間覆蓋率約束,確保選出的 Token 不僅重要且在空間分佈上具有多樣性,避免集中在圖像的單一區域。
🔮 前景展望AI analysis grounded in cited sources
視覺 Token 剪枝將成為邊緣裝置部署 VLM 的標準配置。
隨著多模態模型參數規模擴大,降低視覺輸入的計算成本是實現即時推理的唯一途徑。
動態剪枝技術將取代靜態剪枝成為主流。
樣本專屬的動態選擇能更精確地處理不同複雜度的圖像,相比固定剪枝策略具有更高的效能上限。
⏳ 時間線
2026-05
MAP 相關研究論文首次於 ArXiv 預印本平台公開
2026-07
MAP 技術在 LLaVA-NeXT-7B 基準測試中驗證了 3.09 倍加速效能
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗