來源較早收集於 6m

生數科技發布 Vidu S1 即時交互模型

閱讀原文: 36氪
#generative-video#real-time-ai#multimodal

具備語音控制功能的全新即時交互影片生成模型,適合創作者與開發者。

30 秒速覽

有什麼變化

即時影片生成與交互能力

為什麼重要

Vidu S1 推動了交互式 AI 影片的邊界,為個人化內容創作與即時虛擬化身開創了新的應用場景。

下一步行動

註冊 Vidu S1 平台,測試其即時影片生成的延遲表現,以應用於您的互動媒體專案。

誰應關注:Creators & Designers

關鍵要點

  • 即時影片生成與交互能力
  • 支援語音控制影片走向
  • 支援 540P 高畫質與最高 42FPS 幀率

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • Vidu S1 採用了生數科技自研的 U-ViT 架構,該架構將視覺數據與文本數據統一處理,顯著提升了生成過程中的時空一致性。
  • 該模型引入了全新的「即時推理引擎」,將首幀生成延遲降低至毫秒級,實現了與用戶語音指令的無縫對接。
  • Vidu S1 支援長達 32 秒的連續影片生成,並具備動態調整影片風格與鏡頭語言的交互式編輯功能。
  • 生數科技與清華大學人工智慧研究院保持深度合作,Vidu S1 的訓練數據集包含大量高解析度、高動態範圍的真實世界影片素材。
  • 該模型已整合至生數科技的開放平台 API,開發者可透過標準化接口調用即時交互功能,支援多種主流開發框架。

競品分析

即時交互
Vidu S1
支援語音即時控制
OpenAI Sora
暫無即時交互
Kling AI (快手)
支援部分交互
最高幀率
Vidu S1
42 FPS
OpenAI Sora
30 FPS
Kling AI (快手)
30 FPS
核心優勢
Vidu S1
低延遲、語音交互
OpenAI Sora
長影片一致性
Kling AI (快手)
商業化成熟度

技術深入

  • 模型架構:基於 U-ViT (Unified Vision-Language Transformer) 架構,將影片幀視為 Token 序列進行處理。
  • 推理優化:採用了專有的 KV Cache 壓縮技術與算子融合策略,以達成 42FPS 的高幀率輸出。
  • 交互機制:整合了輕量級語音識別 (ASR) 模型與意圖理解模組,將語音指令即時轉化為 Prompt 向量注入生成過程。
  • 訓練數據:利用大規模多模態數據集進行預訓練,並針對即時交互場景進行了強化學習 (RLHF) 微調。

前景展望基於引用來源的 AI 分析

影片生成模型將從「離線生成」轉向「即時交互式創作」。
Vidu S1 的低延遲特性證明了影片生成技術已具備進入實時應用場景(如直播、遊戲)的技術基礎。
語音將成為影片生成領域的主流交互介面。
透過語音直接控制影片走向大幅降低了專業影片創作的門檻,將推動生成式 AI 在大眾消費市場的普及。

時間線

2024-04
生數科技正式發布首個影片生成模型 Vidu。
2024-07
Vidu 進行重大更新,提升影片生成解析度與時長。
2026-07
生數科技發布具備即時交互能力的 Vidu S1。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。