🔥較早收集於 6m

生數科技發布 Vidu S1 即時交互模型

生數科技發布 Vidu S1 即時交互模型
PostLinkedIn
🔥閱讀原文: 36氪

💡具備語音控制功能的全新即時交互影片生成模型,適合創作者與開發者。

⚡ 30-Second TL;DR

有什麼變化

即時影片生成與交互能力

為什麼重要

Vidu S1 推動了交互式 AI 影片的邊界,為個人化內容創作與即時虛擬化身開創了新的應用場景。

下一步行動

註冊 Vidu S1 平台,測試其即時影片生成的延遲表現,以應用於您的互動媒體專案。

誰應關注:Creators & Designers

關鍵要點

  • 即時影片生成與交互能力
  • 支援語音控制影片走向
  • 支援 540P 高畫質與最高 42FPS 幀率

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Vidu S1 採用了生數科技自研的 U-ViT 架構,該架構將視覺數據與文本數據統一處理,顯著提升了生成過程中的時空一致性。
  • 該模型引入了全新的「即時推理引擎」,將首幀生成延遲降低至毫秒級,實現了與用戶語音指令的無縫對接。
  • Vidu S1 支援長達 32 秒的連續影片生成,並具備動態調整影片風格與鏡頭語言的交互式編輯功能。
  • 生數科技與清華大學人工智慧研究院保持深度合作,Vidu S1 的訓練數據集包含大量高解析度、高動態範圍的真實世界影片素材。
  • 該模型已整合至生數科技的開放平台 API,開發者可透過標準化接口調用即時交互功能,支援多種主流開發框架。
📊 競品分析▸ Show
特性Vidu S1OpenAI SoraKling AI (快手)
即時交互支援語音即時控制暫無即時交互支援部分交互
最高幀率42 FPS30 FPS30 FPS
核心優勢低延遲、語音交互長影片一致性商業化成熟度

🛠️ 技術深入

  • 模型架構:基於 U-ViT (Unified Vision-Language Transformer) 架構,將影片幀視為 Token 序列進行處理。
  • 推理優化:採用了專有的 KV Cache 壓縮技術與算子融合策略,以達成 42FPS 的高幀率輸出。
  • 交互機制:整合了輕量級語音識別 (ASR) 模型與意圖理解模組,將語音指令即時轉化為 Prompt 向量注入生成過程。
  • 訓練數據:利用大規模多模態數據集進行預訓練,並針對即時交互場景進行了強化學習 (RLHF) 微調。

🔮 前景展望AI analysis grounded in cited sources

影片生成模型將從「離線生成」轉向「即時交互式創作」。
Vidu S1 的低延遲特性證明了影片生成技術已具備進入實時應用場景(如直播、遊戲)的技術基礎。
語音將成為影片生成領域的主流交互介面。
透過語音直接控制影片走向大幅降低了專業影片創作的門檻,將推動生成式 AI 在大眾消費市場的普及。

時間線

2024-04
生數科技正式發布首個影片生成模型 Vidu。
2024-07
Vidu 進行重大更新,提升影片生成解析度與時長。
2026-07
生數科技發布具備即時交互能力的 Vidu S1。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪