⚛️量子位•較早收集於 2h
美團原生多模態Token預測

💡美團 Token 多模態無天花板—立即重思視覺 Token 器(22字元)
⚡ 30-Second TL;DR
有什麼變化
圖像語音如文字般 Token 化
為什麼重要
推動高效多模態 LLM 邊界,可能降低視覺-語音整合運算成本。
下一步行動
使用 Hugging Face 在 Llama 基礎多模態微調中原型化圖像 Token。
誰應關注:Developers & AI Engineers
關鍵要點
- •圖像語音如文字般 Token 化
- •原生多模態預測架構
- •離散視覺無擴展上限
- •美團大膽策略
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •美團該架構採用了類似 GPT-4o 的端到端(End-to-End)原生多模態設計,旨在解決傳統模態對齊(Alignment)過程中資訊丟失的問題。
- •該技術核心在於將視覺與語音訊號通過向量量化(Vector Quantization)技術轉化為離散的 Token,使其能與文字 Token 在同一個 Transformer 空間內進行預測。
- •此研究強調了『擴展定律』(Scaling Laws)在多模態領域的適用性,通過統一的 Token 建模,模型在處理複雜場景理解時展現出更強的推理能力。
📊 競品分析▸ Show
| 特性 | 美團原生多模態 | OpenAI GPT-4o | Google Gemini 1.5 Pro |
|---|---|---|---|
| 建模方式 | 原生 Token 預測 | 原生多模態 | 原生多模態 |
| 視覺處理 | 離散 Token 化 | 端到端處理 | 混合架構 |
| 應用場景 | 本地生活服務、自動駕駛 | 通用任務 | 通用任務 |
🛠️ 技術深入
- •採用基於 VQ-VAE 或類似的離散化編碼器(Encoder),將圖像特徵映射到預定義的碼本(Codebook)空間。
- •架構基於 Transformer 解碼器(Decoder-only),通過統一的詞表(Vocabulary)同時處理文字、圖像 Token 和語音 Token。
- •引入了多模態交錯訓練(Interleaved Training)策略,使模型能夠在單一序列中理解跨模態的上下文關係。
- •優化了注意力機制(Attention Mechanism),以處理長序列多模態輸入帶來的計算複雜度問題。
🔮 前景展望AI analysis grounded in cited sources
美團將顯著提升本地生活服務的自動化決策能力。
原生多模態模型能更精準地理解用戶上傳的圖像與語音指令,從而提供更個性化的服務推薦。
該技術將降低美團在自動駕駛與機器人感知領域的研發成本。
統一的 Token 建模減少了針對不同感測器數據開發專用模型的複雜度,提升了系統的通用性。
⏳ 時間線
2024-05
美團發布自研大模型「美團大模型」,開始佈局多模態技術。
2025-03
美團在內部技術會議上首次披露基於離散 Token 的視覺建模研究進展。
2026-02
美團正式對外公佈原生多模態 Token 預測架構的技術細節與初步評測結果。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
每週 AI 簡報
每週一封,可隨時退訂。