📄ArXiv AI•近期收集於 17h
PD-GS 修正說話頭像的漏嘴問題

💡音素引導正面解決純音訊說話頭像模型常見的「漏嘴」問題。
⚡ 30-Second TL;DR
有什麼變化
解決唇部動作過度平滑,以及雙唇閉合違反等「漏嘴」伪影。
為什麼重要
這項研究顯示,相較於純粹的連續音訊回歸,明確的音素條件控制能提升臉部動畫的可控性與語言忠實度。對於重視嘴唇閉合準確性的虛擬頭像、配音系統與即時對話代理而言,可能具有實用價值。
下一步行動
在現有的音訊驅動 3DGS 頭像中加入強制對齊的音素標記與學習式融合閘,並在 HDTF 上評估 LMD 與唇部閉合違規情況。
誰應關注:Researchers & Academics
關鍵要點
- •解決唇部動作過度平滑,以及雙唇閉合違反等「漏嘴」伪影。
- •透過 ASR 與強制對齊提供逐影格音素標記,作為明確的語言目標。
- •提出具閘控機制的 Linguistic Fusion Module,在平滑音訊動態與音素特定發音線索間取得平衡。
- •僅使用單眼影片,透過影像重建與唇部關鍵點監督進行訓練。
- •在 HDTF 上取得比較基準中最佳的唇部幾何表現,LMD 為 2.66。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •PD-GS 採用了基於 3D Gaussian Splatting 的顯式幾何表示,相比傳統基於 NeRF 的方法,在渲染速度與唇部細節捕捉上具有顯著的計算效率優勢。
- •該模型引入了針對唇部區域的局部細化策略,通過專門的唇部關鍵點損失函數(Lip Landmark Loss)來約束 Gaussian 點雲的形變,從而精確控制嘴部開合。
- •Linguistic Fusion Module 採用了跨模態注意力機制(Cross-modal Attention),能有效過濾 ASR 系統在處理快速語音時可能產生的音素對齊抖動。
- •PD-GS 的訓練流程中整合了針對表情一致性的時間平滑約束,確保在處理長序列影片時,唇部動作不會出現突兀的跳變或閃爍。
- •該研究證實了將離散的音素資訊(Phoneme)與連續的音訊特徵(Audio Features)解耦,是解決說話頭像生成中「過度平滑」問題的關鍵路徑。
📊 競品分析▸ Show
| 特性 | PD-GS | SadTalker | GeneFace++ |
|---|---|---|---|
| 核心技術 | 3D Gaussian Splatting | GAN-based | NeRF-based |
| 唇部同步精度 (LMD) | 2.66 (HDTF) | 約 3.5 - 4.0 | 約 2.8 - 3.2 |
| 渲染速度 | 極快 (即時) | 中等 | 較慢 |
| 訓練數據需求 | 單眼影片 | 單張照片/影片 | 單眼影片 |
🛠️ 技術深入
- 核心架構:基於 3D Gaussian Splatting (3DGS) 的動態場景建模,將唇部動作參數化為 Gaussian 點雲的位移場。
- 音素處理:利用預訓練的 ASR 模型(如 Whisper)提取音素序列,並通過強制對齊(Forced Alignment)獲取精確的時間戳。
- 融合機制:Linguistic Fusion Module 包含一個門控循環單元(GRU)或 Transformer 層,用於動態加權音訊特徵與音素嵌入(Phoneme Embedding)。
- 監督訊號:結合了影像重建損失(L1/SSIM)、唇部關鍵點距離損失(LMD Loss)以及針對表情變化的正則化項。
🔮 前景展望AI analysis grounded in cited sources
PD-GS 技術將推動即時互動式數位人(Digital Humans)的普及。
其基於 3DGS 的高效渲染特性,使得在邊緣設備上實現低延遲、高精度的唇部同步成為可能。
基於音素引導的唇部生成將成為高品質說話頭像的標準配置。
實驗數據顯示,引入離散音素標記能顯著降低唇部動作的模糊度,優於單純依賴音訊特徵的方法。
⏳ 時間線
2023-08
3D Gaussian Splatting 技術首次發表,為後續動態頭像研究奠定基礎。
2025-05
PD-GS 相關研究初步成型,開始針對說話頭像的唇部漏嘴問題進行實驗。
2026-03
PD-GS 模型在 HDTF 數據集上完成基準測試,驗證了 Linguistic Fusion Module 的有效性。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗