🏠IT之家•較早收集於 6m
京東發布 JoyAI-Echo 長影音生成框架

💡開源框架解決長影音生成中的「角色崩壞」問題,並透過技術優化實現 7.5 倍推理加速。
⚡ 30-Second TL;DR
有什麼變化
在長達 5 分鐘的影片中保持角色外觀與音色高度一致。
為什麼重要
此框架解決了長影音 AI 生成中的核心痛點,有望降低高品質、具備敘事一致性的影音內容創作門檻。
下一步行動
請前往 GitHub 下載並測試 JoyAI-Echo,評估其記憶驅動的一致性功能是否適用於您的長影音專案。
誰應關注:Developers & AI Engineers
關鍵要點
- •在長達 5 分鐘的影片中保持角色外觀與音色高度一致。
- •整合「導演助理」功能,透過自然語言自動拆解劇本、場景與鏡頭。
- •運用 DMD 技術實現推理加速,效能提升約 7.5 倍。
- •內建即時超解析度模組,支援生成高解析度影片與精細音訊。
🧠 深度解析
Web-grounded analysis with 24 cited sources.
🔑 增強重點摘要
- •JoyAI-Echo 框架引入了「邊聊邊改」的對話式編輯模式,允許創作者透過自然語言即時修改影片中的局部鏡頭,無需重新生成整段影片,將創作從「靜態生成」轉變為「動態協作」。
- •該框架旨在解決長影片生成領域的三大核心痛點:角色外觀難以穩定一致、音色變化難以控制以及影片生成速度緩慢,並透過其核心技術實現突破。
- •JoyAI-Echo 的代碼與權重已全面開源,並已在 GitHub 上線,供全球開發者和創作者體驗與使用,有助於推動長影片生成技術的普及與生態發展。
- •為客觀評估其性能,京東團隊基於100個故事、3000個鏡頭構建了專門的長音影片生成評測集,結果顯示 JoyAI-Echo 在跨鏡頭一致性、影片質量、文本一致性和語音內容準確率等所有核心指標上均表現領先,其中語音內容準確率高達0.8646。
- •此框架的應用場景廣泛,包括虛擬動漫製作、數字人直播、品牌營銷影片快速迭代、互動教育課件生成以及遊戲內容生產等,預計將大幅優化相關行業的生產成本與製作週期。
📊 競品分析▸ Show
AI 影片生成工具比較
| 功能/產品 | 京東 JoyAI-Echo | Runway Gen-4.5 | Kling AI | Google Veo 3.1 | Pika | Luma Dream Machine |
|---|---|---|---|---|---|---|
| 主要特點 | 長影片角色與音色一致性、對話式編輯、開源 | 高度創意控制、場景一致性、專業級 | 逼真人像與動作、長影片生成、高性價比 | 電影級真實感、Google數據訓練 | 創意社群媒體內容、快速生成 | 快速、電影級效果、HDR支援 |
| 最長影片 | 5 分鐘 | 10 秒 | 3 分鐘 | 20 秒 | 25 秒 | 10 秒 |
| 解析度 | 支援 1472×2560 | 4K | 1080p | 4K | 1080p | 1080p |
| 音訊生成 | 支援精細音訊生成 | 部分支援 | 支援 | 支援 (同時生成) | 部分支援 | 無 |
| 角色一致性 | 高度一致 (跨模態音影片記憶庫) | 擅長維持場景一致性 | 擅長逼真人像 | 擅長真實感 | 支援角色連貫性 | 高品質影像 |
| 定價模式 | 開源 (代碼與權重) | $12-$95/月 (有免費額度) | $5-$92/月 (有免費額度) | 約 $2,900/月 (Google AI Pro) | $10-$95/月 (有免費額度) | $9.99-$94.99/月 (有免費額度) |
| 獨特功能 | 「導演助理」對話式編輯、記憶驅動後訓練、DMD加速 | 動態筆刷、場景擴展 | 專注於逼真人像與動作 | 龐大數據訓練、真實感 | 豐富特效、社群導向 | Image-to-Video 品質高 |
註:此表格基於截至 2026 年 6 月 3 日的公開資訊。部分產品功能與定價可能隨時間變化。
🛠️ 技術深入
- 跨模態音影片記憶庫 (Cross-modal Audio-Visual Memory Bank):這是 JoyAI-Echo 的核心技術之一,內置專門記憶庫,能夠在多鏡頭生成過程中持續保存並調用角色的外觀特徵和說話人音色信息,確保長達 5 分鐘的影片中角色身份、視覺形象和聲音音色保持高度一致,解決了傳統 AI 影片生成中角色「變臉」和音色不穩定的問題。
- 記憶驅動後訓練 (Memory-driven Post-training):研發團隊創新性地提出了此訓練流程,結合了 SFT (Supervised Fine-Tuning)、跨模態 RLHF (Reinforcement Learning from Human Feedback) 和 DMD (Distribution Matching Distillation) 技術,大幅提升了生成質量並實現了推理加速。
- DMD (Distribution Matching Distillation) 技術:作為記憶驅動後訓練流程的一部分,DMD 技術單獨就帶來了約 7.5 倍的推理速度提升,使得長影片生成從「等半天」變為「秒出片」。
- 智能「導演助理」 (Director Agent):此功能讓長影片首次實現「對話式編輯」。用戶可透過自然語言輸入需求,系統會自動拆解成劇本、角色、場景和鏡頭。當對某處不滿意時,可直接透過對話方式指示修改,系統僅重新生成有問題的局部鏡頭,無需重跑整條影片,極大地提升了創作效率。
- 輕量化實時超解析度模組 (Lightweight Real-time Super-resolution Module):為滿足專業內容生產需求,JoyAI-Echo 配套了專門的實時超解析度模組,支援兩檔分辨率提升(736×1280 → 1152×1920 和 736×1280 → 1472×2560),透過單步超分即可生成高解析度影片和精細化音訊,即使在流式延遲的約束下也能保持穩定的高清表現。
🔮 前景展望AI analysis grounded in cited sources
AI 影片內容創作將從「靜態生成」轉變為「動態協作」模式。
JoyAI-Echo 的「邊聊邊改」和「對話式編輯」功能,允許創作者即時修改局部鏡頭,大幅提升了創作效率和互動性,預示著更為靈活和迭代式的創作流程。
虛擬內容生產成本與製作週期將顯著優化,加速行業進入可交互長影片量產新階段。
該框架在角色一致性、音色穩定性和生成速度上的突破,使其能廣泛應用於虛擬動漫、數字人直播、品牌營銷等領域,降低門檻並提升效率,推動長影片內容的規模化生產。
京東在 AI 影片生成領域的開源策略將促進相關技術的普及與生態發展。
JoyAI-Echo 的代碼與權重全部開源,將吸引更多開發者和創作者參與,共同推動長影片生成技術的創新與應用,並可能催生更多基於此框架的應用。
⏳ 時間線
2020
京東啟動 AI 千億參數大模型研發。
2023-09
京東推出旗艦模型參數已達 7,500 億;京東雲開發者社區發布首個 Joy 模型,用於生成 Joy 海報。
2025-09
京東集團首席執行官許冉在 JDDiscovery 大會上將 AI 價值公式更新為:AI 價值 = 模型 × 體驗 × 產業厚度的平方。
2026-03
京東 JoyAI 大模型已應用於 2000 餘業務場景,JoyAgent 平台落地超 5 萬個生產級智能體,JoyCode 工具使研發效率提升 40%。
2026-04
京東探索研究院正式開源多模態基礎模型 JoyAI-Image-Edit,具備像素級精細化編輯能力和空間智能。
2026-06
京東正式開源 JoyAI-Echo 長音影片生成框架,解決長影片角色一致性與聲音穩定性難題。
📎 來源 (24)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家 ↗
