🐯虎嗅•較早收集於 4m
DeepSeek連夜刪掉的視覺原語論文

💡DeepSeek「手指」技巧(點/框)修正頂級模型視覺計數失敗,壓縮7056倍。(48字)
⚡ 30-Second TL;DR
有什麼變化
將點/框作為視覺原語嵌入CoT,精確引用圖像元素
為什麼重要
此方法可在視覺任務中以更少計算超越GPT/Claude/Gemini,推動高效多模態AI普及。凸顯DeepSeek在視覺語言MoE模型的優勢。
下一步行動
在你的多模態CoT提示中嵌入邊界框座標,測試改善視覺計數效果。
誰應關注:Researchers & Academics
關鍵要點
- •將點/框作為視覺原語嵌入CoT,精確引用圖像元素
- •將756x756圖像壓縮至81個token(7056倍),保留計數準確性
- •使用4000萬檢測數據集樣本,經嚴格品質篩選訓練
- •分別訓練框/點專家模型,再透過模仿學習合併
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •該論文撤回的主要爭議點在於數據集來源的合規性,特別是關於是否使用了未經授權的檢測數據集進行訓練,引發了開源社群對數據隱私與版權的討論。
- •DeepSeek 採用的視覺原語(Visual Primitives)技術,旨在解決多模態模型在處理高解析度圖像時,因 Token 數量過多導致的計算成本與注意力分散問題。
- •該研究展示了透過將視覺空間資訊轉化為文字 Token(座標點),能顯著提升模型在複雜場景下的計數與物體定位能力,這被視為邁向具身智慧(Embodied AI)的重要一步。
📊 競品分析▸ Show
| 特性 | DeepSeek (Visual Primitives) | OpenAI (GPT-4o) | Google (Gemini 1.5 Pro) |
|---|---|---|---|
| 視覺處理方式 | 視覺原語 (點/框) | 視覺編碼器 (Vision Encoder) | 視覺編碼器 (Vision Encoder) |
| 圖像壓縮率 | 極高 (7056倍) | 中等 | 中等 |
| 核心優勢 | 精確計數與定位 | 通用推理與多模態整合 | 長上下文與多模態理解 |
🛠️ 技術深入
- 視覺原語編碼:將圖像中的物件邊界框(Bounding Box)與中心點(Center Point)轉換為特殊的文字 Token,直接嵌入到 CoT(Chain-of-Thought)序列中。
- 壓縮機制:採用自適應池化與特徵提取技術,將 756x756 的原始圖像壓縮至 81 個 Token,同時透過位置編碼保留空間幾何關係。
- 專家模型架構:採用 MoE(Mixture of Experts)架構,分別訓練處理「框」與「點」的專家模組,最後透過模仿學習(Imitation Learning)將兩者的能力融合至主模型中。
- 訓練數據:使用了 4000 萬個高品質檢測樣本,重點在於過濾掉低品質的標註數據,以提升模型對視覺細節的敏感度。
🔮 前景展望AI analysis grounded in cited sources
視覺原語將成為多模態模型處理高解析度影像的標準架構。
該技術能有效解決圖像 Token 爆炸問題,同時提升模型在精確定位任務上的表現,具有極高的工業應用價值。
數據集來源合規性將成為 AI 論文發表的關鍵審查標準。
DeepSeek 此次撤稿事件凸顯了學術界與產業界對訓練數據版權與來源透明度的要求日益嚴格。
⏳ 時間線
2025-01
DeepSeek 發布 DeepSeek-V3,奠定 MoE 模型架構基礎。
2026-03
DeepSeek 發表《Thinking with Visual Primitives》預印本論文。
2026-03
因數據集來源爭議,DeepSeek 撤回該視覺原語相關論文。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗



