⚛️最新收集於 66m

少80% Token,仍保真多模態 AI

少80% Token,仍保真多模態 AI
PostLinkedIn
⚛️閱讀原文: 量子位

💡了解免訓練 Token 剪枝如何可能將多模態推理成本降低 80%。

⚡ 30-Second TL;DR

有什麼變化

GMC 透過核心集選擇,旨在剪除多模態資料中的冗餘 Token。

為什麼重要

若能在具代表性的多模態工作負載中獲得驗證,這項方法可望降低推理成本、記憶體用量與延遲。對於運算資源受限的多模態模型部署而言,可能尤其實用。

下一步行動

在具代表性的圖文工作負載上測試 GMC,並與未剪枝流程比較 Token 數量、延遲、成本及任務準確率。

誰應關注:Developers & AI Engineers

關鍵要點

  • GMC 透過核心集選擇,旨在剪除多模態資料中的冗餘 Token。
  • 這項方法不需要額外訓練模型,主打開箱即用。
  • 在維持高保真多模態表現的同時,Token 使用量據稱可減少 80%。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • GMC(Geometric Coreset)方法基於幾何核心集理論,旨在從海量多模態數據中篩選出最具代表性的子集,從而實現數據壓縮。
  • 該技術不僅適用於文字,還能有效處理圖像和影片等高維度多模態數據,解決了長序列輸入帶來的計算瓶頸。
  • 研究團隊來自中國科學院自動化研究所(CASIA),該機構長期致力於紫東太初大模型的研發與迭代。
  • GMC 透過在特徵空間中進行子集選擇,確保了在大幅減少 Token 數量的同時,模型對原始數據語義信息的覆蓋率幾乎不變。
  • 此項技術特別針對資源受限的邊緣計算場景設計,旨在降低多模態模型在終端設備上的部署門檻。
📊 競品分析▸ Show
特性GMC (紫東太初)傳統剪枝技術 (如 Pruning)稀疏注意力機制 (Sparse Attention)
訓練需求免訓練 (Zero-shot)通常需要微調需要特定架構支持
Token 壓縮率高 (達 80%)中等低至中等
多模態保真度易受損視實現方式而定
部署靈活性開箱即用較低較低

🛠️ 技術深入

  • GMC 核心算法基於幾何核心集(Geometric Coreset)構建,通過計算數據點在特徵空間中的幾何分佈,選擇具有代表性的樣本點。
  • 該方法在模型推理階段介入,通過動態調整輸入序列的 Token 權重,過濾掉冗餘的視覺或文本特徵。
  • 實現過程中無需修改模型權重(Weights),而是通過預處理輸入數據流來實現壓縮,因此具備極高的通用性。
  • 該技術能夠與現有的 Transformer 架構無縫集成,無需對注意力機制(Attention Mechanism)進行底層修改。

🔮 前景展望AI analysis grounded in cited sources

多模態模型將在邊緣設備實現大規模普及。
GMC 技術大幅降低了推理所需的計算資源,使得複雜的多模態任務能在手機或嵌入式設備上運行。
數據處理效率將成為多模態模型競爭的核心。
隨著模型參數規模趨於穩定,如何高效處理輸入數據流將成為提升模型響應速度的關鍵技術路徑。

時間線

2021-07
紫東太初 1.0 發布,標誌著中國首個全模態大模型誕生。
2023-09
紫東太初 2.0 全面升級,增強了決策與生成能力。
2026-08
推出 GMC 核心集剪枝技術,優化多模態模型推理效率。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位