🐼Pandaily•較早收集於 28m
Meituan 開源 LongCat-Video-Avatar 1.5 數位人生成框架

💡具備業界領先口型同步性能的高效率開源數位人框架。
⚡ 30-Second TL;DR
有什麼變化
在數位人生成中實現了業界領先的口型同步準確度。
為什麼重要
此版本降低了開發者創建高品質即時數位頭像的門檻。它顯著提升了生成式影片流程中口型同步的效率。
下一步行動
複製 LongCat-Video-Avatar 儲存庫,並將 8 步推理延遲與您目前的口型同步解決方案進行基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •在數位人生成中實現了業界領先的口型同步準確度。
- •針對效率進行優化,僅需 8 個推理步驟。
- •開源發布使開發者能夠整合逼真的數位人頭像。
🧠 深度解析
Web-grounded analysis with 15 cited sources.
🔑 增強重點摘要
- •LongCat-Video-Avatar 1.5 支援多種任務模式,包括音訊-文字-影片 (AT2V)、音訊-文字-圖像-影片 (ATI2V) 及影片續寫功能,展現了「一個模型多任務」的設計理念。
- •該框架的音訊編碼器已從 Wav2Vec2 升級至 Whisper-Large-v3,顯著提升了口型同步的精準度、唇形動態,以及多語種和跨語言口型生成的魯棒性。
- •模型能夠泛化至多樣化的主體,包括真人、動漫角色、虛擬偶像及動物,並支援多角色互動與精確的說話者區分,使其適用於更廣泛的開放領域場景。
- •透過採用共享基礎模型與多個 LoRA 適配器,LongCat-Video-Avatar 1.5 取代了傳統的三模型並行方案,大幅降低了視訊記憶體 (VRAM) 的使用量,進一步優化了部署效率。
🛠️ 技術深入
- 音訊編碼器升級:將 Wav2Vec2 編碼器替換為 Whisper-Large-v3 音訊編碼器,以提升口型同步、唇形動態及多語種、跨語言口型生成的魯棒性。
- 推理效率優化:引入 DMD (Distribution Matching Distillation) 技術,將生成去噪迭代步驟從 50 步壓縮至 8 步,實現約 15 倍的推理速度提升。
- 模型架構:基於 LongCat-Video 基座,採用「一個模型多任務」設計,原生支援 AT2V、ATI2V 及影片續寫。透過共享基礎模型搭配多個 LoRA 適配器,顯著減少了 VRAM 佔用。
- 長影片穩定性與身份一致性:透過 GRPO (Generalized Reinforcement Learning for Physical Plausibility Optimization) 強化學習優化,降低了手部變形和異常抽幀等偽影,提升了長影片的身份一致性。同時,採用多片段滾動推理,利用前序影片建立全局時序上下文,保持角色身份連貫。
- 數據管線:採用高品質數據系統,包含多階段處理流程,如離線標註(提取面部關鍵點、人物計數、身體構成、音視訊同步等)和線上驗證(自動過濾低品質片段)。
- 輸出解析度:支援 480P 和 720P 輸出。
- 授權協議:模型權重以 MIT 協議發布,但生成的內容目前僅供學術使用,商業用途需核對相關內容。
🔮 前景展望AI analysis grounded in cited sources
數位人技術將加速在多語言、多場景的商業應用普及。
LongCat-Video-Avatar 1.5 支援多語種、跨語言口型生成,並能泛化至動漫、動物、多人互動等開放領域場景,降低了商業部署的門檻。
數位人內容生成將更加高效且成本可控。
8 步推理和優化的 VRAM 使用量顯著提升了生成效率並降低了運營成本,使其更適合規模化生產和實際業務流程。
數位人將在非寫實風格內容創作中扮演更重要角色。
該框架能夠穩定處理動漫角色和動物等非寫實風格,拓展了數位人在娛樂、動畫等領域的應用潛力。
⏳ 時間線
2025-09
美團發布 LongCat-Flash 模型,採用 MoE 架構,總參數達 5600 億。
2025-10
美團推出 WOWService 智能互動系統,整合大型語言模型和多代理架構,並部署於美團 App。
2025-11
美團 LongCat-Video-Avatar (v1.0) 首次發布。
2025-12
美團正式開源虛擬人影片生成模型 LongCat-Video-Avatar (v1.0),強調動作擬真度、長影片穩定性與身份一致性的提升。
2026-04
美團悄然啟動一項超過一兆參數的大型語言模型內部測試,該模型完全基於國產計算集群訓練。
2026-05
美團開源 LongCat-Video-Avatar 1.5,專注於 8 步推理實現業界領先的口型同步準確度。
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗