🐼較早收集於 28m

Meituan 開源 LongCat-Video-Avatar 1.5 數位人生成框架

Meituan 開源 LongCat-Video-Avatar 1.5 數位人生成框架
PostLinkedIn
🐼閱讀原文: Pandaily

💡具備業界領先口型同步性能的高效率開源數位人框架。

⚡ 30-Second TL;DR

有什麼變化

在數位人生成中實現了業界領先的口型同步準確度。

為什麼重要

此版本降低了開發者創建高品質即時數位頭像的門檻。它顯著提升了生成式影片流程中口型同步的效率。

下一步行動

複製 LongCat-Video-Avatar 儲存庫,並將 8 步推理延遲與您目前的口型同步解決方案進行基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在數位人生成中實現了業界領先的口型同步準確度。
  • 針對效率進行優化,僅需 8 個推理步驟。
  • 開源發布使開發者能夠整合逼真的數位人頭像。

🧠 深度解析

Web-grounded analysis with 15 cited sources.

🔑 增強重點摘要

  • LongCat-Video-Avatar 1.5 支援多種任務模式,包括音訊-文字-影片 (AT2V)、音訊-文字-圖像-影片 (ATI2V) 及影片續寫功能,展現了「一個模型多任務」的設計理念。
  • 該框架的音訊編碼器已從 Wav2Vec2 升級至 Whisper-Large-v3,顯著提升了口型同步的精準度、唇形動態,以及多語種和跨語言口型生成的魯棒性。
  • 模型能夠泛化至多樣化的主體,包括真人、動漫角色、虛擬偶像及動物,並支援多角色互動與精確的說話者區分,使其適用於更廣泛的開放領域場景。
  • 透過採用共享基礎模型與多個 LoRA 適配器,LongCat-Video-Avatar 1.5 取代了傳統的三模型並行方案,大幅降低了視訊記憶體 (VRAM) 的使用量,進一步優化了部署效率。

🛠️ 技術深入

  • 音訊編碼器升級:將 Wav2Vec2 編碼器替換為 Whisper-Large-v3 音訊編碼器,以提升口型同步、唇形動態及多語種、跨語言口型生成的魯棒性。
  • 推理效率優化:引入 DMD (Distribution Matching Distillation) 技術,將生成去噪迭代步驟從 50 步壓縮至 8 步,實現約 15 倍的推理速度提升。
  • 模型架構:基於 LongCat-Video 基座,採用「一個模型多任務」設計,原生支援 AT2V、ATI2V 及影片續寫。透過共享基礎模型搭配多個 LoRA 適配器,顯著減少了 VRAM 佔用。
  • 長影片穩定性與身份一致性:透過 GRPO (Generalized Reinforcement Learning for Physical Plausibility Optimization) 強化學習優化,降低了手部變形和異常抽幀等偽影,提升了長影片的身份一致性。同時,採用多片段滾動推理,利用前序影片建立全局時序上下文,保持角色身份連貫。
  • 數據管線:採用高品質數據系統,包含多階段處理流程,如離線標註(提取面部關鍵點、人物計數、身體構成、音視訊同步等)和線上驗證(自動過濾低品質片段)。
  • 輸出解析度:支援 480P 和 720P 輸出。
  • 授權協議:模型權重以 MIT 協議發布,但生成的內容目前僅供學術使用,商業用途需核對相關內容。

🔮 前景展望AI analysis grounded in cited sources

數位人技術將加速在多語言、多場景的商業應用普及。
LongCat-Video-Avatar 1.5 支援多語種、跨語言口型生成,並能泛化至動漫、動物、多人互動等開放領域場景,降低了商業部署的門檻。
數位人內容生成將更加高效且成本可控。
8 步推理和優化的 VRAM 使用量顯著提升了生成效率並降低了運營成本,使其更適合規模化生產和實際業務流程。
數位人將在非寫實風格內容創作中扮演更重要角色。
該框架能夠穩定處理動漫角色和動物等非寫實風格,拓展了數位人在娛樂、動畫等領域的應用潛力。

時間線

2025-09
美團發布 LongCat-Flash 模型,採用 MoE 架構,總參數達 5600 億。
2025-10
美團推出 WOWService 智能互動系統,整合大型語言模型和多代理架構,並部署於美團 App。
2025-11
美團 LongCat-Video-Avatar (v1.0) 首次發布。
2025-12
美團正式開源虛擬人影片生成模型 LongCat-Video-Avatar (v1.0),強調動作擬真度、長影片穩定性與身份一致性的提升。
2026-04
美團悄然啟動一項超過一兆參數的大型語言模型內部測試,該模型完全基於國產計算集群訓練。
2026-05
美團開源 LongCat-Video-Avatar 1.5,專注於 8 步推理實現業界領先的口型同步準確度。

📎 來源 (15)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. longcatai.org
  2. knightli.com
  3. theresanaiforthat.com
  4. binance.com
  5. phemex.com
  6. github.io
  7. youtube.com
  8. caixinglobal.com
  9. pandaily.com
  10. arxiv.org
  11. eastmoney.com
  12. zol.com.cn
  13. sina.com.cn
  14. etnet.com.hk
  15. hket.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily