⚛️量子位•最新收集於 66m
少80% Token,仍保真多模態 AI

💡了解免訓練 Token 剪枝如何可能將多模態推理成本降低 80%。
⚡ 30-Second TL;DR
有什麼變化
GMC 透過核心集選擇,旨在剪除多模態資料中的冗餘 Token。
為什麼重要
若能在具代表性的多模態工作負載中獲得驗證,這項方法可望降低推理成本、記憶體用量與延遲。對於運算資源受限的多模態模型部署而言,可能尤其實用。
下一步行動
在具代表性的圖文工作負載上測試 GMC,並與未剪枝流程比較 Token 數量、延遲、成本及任務準確率。
誰應關注:Developers & AI Engineers
關鍵要點
- •GMC 透過核心集選擇,旨在剪除多模態資料中的冗餘 Token。
- •這項方法不需要額外訓練模型,主打開箱即用。
- •在維持高保真多模態表現的同時,Token 使用量據稱可減少 80%。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •GMC(Geometric Coreset)方法基於幾何核心集理論,旨在從海量多模態數據中篩選出最具代表性的子集,從而實現數據壓縮。
- •該技術不僅適用於文字,還能有效處理圖像和影片等高維度多模態數據,解決了長序列輸入帶來的計算瓶頸。
- •研究團隊來自中國科學院自動化研究所(CASIA),該機構長期致力於紫東太初大模型的研發與迭代。
- •GMC 透過在特徵空間中進行子集選擇,確保了在大幅減少 Token 數量的同時,模型對原始數據語義信息的覆蓋率幾乎不變。
- •此項技術特別針對資源受限的邊緣計算場景設計,旨在降低多模態模型在終端設備上的部署門檻。
📊 競品分析▸ Show
| 特性 | GMC (紫東太初) | 傳統剪枝技術 (如 Pruning) | 稀疏注意力機制 (Sparse Attention) |
|---|---|---|---|
| 訓練需求 | 免訓練 (Zero-shot) | 通常需要微調 | 需要特定架構支持 |
| Token 壓縮率 | 高 (達 80%) | 中等 | 低至中等 |
| 多模態保真度 | 高 | 易受損 | 視實現方式而定 |
| 部署靈活性 | 開箱即用 | 較低 | 較低 |
🛠️ 技術深入
- GMC 核心算法基於幾何核心集(Geometric Coreset)構建,通過計算數據點在特徵空間中的幾何分佈,選擇具有代表性的樣本點。
- 該方法在模型推理階段介入,通過動態調整輸入序列的 Token 權重,過濾掉冗餘的視覺或文本特徵。
- 實現過程中無需修改模型權重(Weights),而是通過預處理輸入數據流來實現壓縮,因此具備極高的通用性。
- 該技術能夠與現有的 Transformer 架構無縫集成,無需對注意力機制(Attention Mechanism)進行底層修改。
🔮 前景展望AI analysis grounded in cited sources
多模態模型將在邊緣設備實現大規模普及。
GMC 技術大幅降低了推理所需的計算資源,使得複雜的多模態任務能在手機或嵌入式設備上運行。
數據處理效率將成為多模態模型競爭的核心。
隨著模型參數規模趨於穩定,如何高效處理輸入數據流將成為提升模型響應速度的關鍵技術路徑。
⏳ 時間線
2021-07
紫東太初 1.0 發布,標誌著中國首個全模態大模型誕生。
2023-09
紫東太初 2.0 全面升級,增強了決策與生成能力。
2026-08
推出 GMC 核心集剪枝技術,優化多模態模型推理效率。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
