📄近期收集於 17h

PD-GS 修正說話頭像的漏嘴問題

PD-GS 修正說話頭像的漏嘴問題
PostLinkedIn
📄閱讀原文: ArXiv AI

💡音素引導正面解決純音訊說話頭像模型常見的「漏嘴」問題。

⚡ 30-Second TL;DR

有什麼變化

解決唇部動作過度平滑,以及雙唇閉合違反等「漏嘴」伪影。

為什麼重要

這項研究顯示,相較於純粹的連續音訊回歸,明確的音素條件控制能提升臉部動畫的可控性與語言忠實度。對於重視嘴唇閉合準確性的虛擬頭像、配音系統與即時對話代理而言,可能具有實用價值。

下一步行動

在現有的音訊驅動 3DGS 頭像中加入強制對齊的音素標記與學習式融合閘,並在 HDTF 上評估 LMD 與唇部閉合違規情況。

誰應關注:Researchers & Academics

關鍵要點

  • 解決唇部動作過度平滑,以及雙唇閉合違反等「漏嘴」伪影。
  • 透過 ASR 與強制對齊提供逐影格音素標記,作為明確的語言目標。
  • 提出具閘控機制的 Linguistic Fusion Module,在平滑音訊動態與音素特定發音線索間取得平衡。
  • 僅使用單眼影片,透過影像重建與唇部關鍵點監督進行訓練。
  • 在 HDTF 上取得比較基準中最佳的唇部幾何表現,LMD 為 2.66。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • PD-GS 採用了基於 3D Gaussian Splatting 的顯式幾何表示,相比傳統基於 NeRF 的方法,在渲染速度與唇部細節捕捉上具有顯著的計算效率優勢。
  • 該模型引入了針對唇部區域的局部細化策略,通過專門的唇部關鍵點損失函數(Lip Landmark Loss)來約束 Gaussian 點雲的形變,從而精確控制嘴部開合。
  • Linguistic Fusion Module 採用了跨模態注意力機制(Cross-modal Attention),能有效過濾 ASR 系統在處理快速語音時可能產生的音素對齊抖動。
  • PD-GS 的訓練流程中整合了針對表情一致性的時間平滑約束,確保在處理長序列影片時,唇部動作不會出現突兀的跳變或閃爍。
  • 該研究證實了將離散的音素資訊(Phoneme)與連續的音訊特徵(Audio Features)解耦,是解決說話頭像生成中「過度平滑」問題的關鍵路徑。
📊 競品分析▸ Show
特性PD-GSSadTalkerGeneFace++
核心技術3D Gaussian SplattingGAN-basedNeRF-based
唇部同步精度 (LMD)2.66 (HDTF)約 3.5 - 4.0約 2.8 - 3.2
渲染速度極快 (即時)中等較慢
訓練數據需求單眼影片單張照片/影片單眼影片

🛠️ 技術深入

  • 核心架構:基於 3D Gaussian Splatting (3DGS) 的動態場景建模,將唇部動作參數化為 Gaussian 點雲的位移場。
  • 音素處理:利用預訓練的 ASR 模型(如 Whisper)提取音素序列,並通過強制對齊(Forced Alignment)獲取精確的時間戳。
  • 融合機制:Linguistic Fusion Module 包含一個門控循環單元(GRU)或 Transformer 層,用於動態加權音訊特徵與音素嵌入(Phoneme Embedding)。
  • 監督訊號:結合了影像重建損失(L1/SSIM)、唇部關鍵點距離損失(LMD Loss)以及針對表情變化的正則化項。

🔮 前景展望AI analysis grounded in cited sources

PD-GS 技術將推動即時互動式數位人(Digital Humans)的普及。
其基於 3DGS 的高效渲染特性,使得在邊緣設備上實現低延遲、高精度的唇部同步成為可能。
基於音素引導的唇部生成將成為高品質說話頭像的標準配置。
實驗數據顯示,引入離散音素標記能顯著降低唇部動作的模糊度,優於單純依賴音訊特徵的方法。

時間線

2023-08
3D Gaussian Splatting 技術首次發表,為後續動態頭像研究奠定基礎。
2025-05
PD-GS 相關研究初步成型,開始針對說話頭像的唇部漏嘴問題進行實驗。
2026-03
PD-GS 模型在 HDTF 數據集上完成基準測試,驗證了 Linguistic Fusion Module 的有效性。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI