🔥36氪•較早收集於 4h
千問App首發灰測HappyHorse模型
💡阿里HappyHorse Beta:15秒多鏡頭AI影片,1080P。現已開放早期測試。
⚡ 30-Second TL;DR
有什麼變化
千問App首頁按鈕首發HappyHorse 1.0灰測
為什麼重要
這使阿里巴巴在AI影片生成領域更具競爭力,與Sora等模型抗衡。早期存取讓從業人員可基準測試並探索整合機會。
下一步行動
下載千問App,透過首頁按鈕測試HappyHorse的15秒影片生成。
誰應關注:Creators & Designers
關鍵要點
- •千問App首頁按鈕首發HappyHorse 1.0灰測
- •支援15秒多鏡頭敘事生成
- •多畫幅適配及1080P超分輸出
- •畫面質感、敘事、人物、音畫同步及風格多樣性表現突出
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •HappyHorse 1.0 採用了阿里巴巴自研的「時空一致性」生成架構,旨在解決長影片生成中常見的物體變形與背景閃爍問題。
- •該模型整合了阿里雲的算力基礎設施,透過優化推理引擎,將 15 秒影片的生成時間縮短至行業平均水平的 60% 以內。
- •HappyHorse 1.0 深度融合了千問大語言模型的語義理解能力,能更精準地將複雜的 Prompt 轉化為分鏡腳本與視覺指令。
📊 競品分析▸ Show
| 特性 | HappyHorse 1.0 | OpenAI Sora | Runway Gen-3 Alpha |
|---|---|---|---|
| 核心優勢 | 多鏡頭敘事與音畫同步 | 長時間連貫性與物理模擬 | 專業級控制與風格化工具 |
| 輸出解析度 | 1080P 超分 | 1080P | 4K (部分方案) |
| 敘事能力 | 15秒多鏡頭敘事 | 60秒單鏡頭/多鏡頭 | 10秒/片段 |
🛠️ 技術深入
- 架構:基於 Diffusion Transformer (DiT) 的變體,針對長影片時序建模進行了特殊優化。
- 關鍵技術:引入了「語義引導分鏡生成器」,能自動將用戶輸入的文字拆解為多個鏡頭的視覺描述。
- 音畫同步:採用了多模態對齊技術,將音訊特徵作為條件輸入,實現了音訊驅動的口型與動作同步。
- 輸出規格:支援 16:9、9:16 及 1:1 等多種畫幅,並內建超解析度重建模組以達到 1080P 輸出。
🔮 前景展望AI analysis grounded in cited sources
阿里巴巴將推動 HappyHorse 進入企業級 API 市場
隨著灰測階段的完成,阿里雲極有可能將此模型整合至其 AI 開發平台,為影視製作與廣告行業提供 API 服務。
影片生成模型將成為千問 App 的核心競爭力
透過將影片生成能力直接嵌入千問 App,阿里巴巴正試圖將其從單純的文字對話工具轉型為多模態內容創作平台。
⏳ 時間線
2023-09
阿里巴巴發布通義千問 2.0,強化多模態理解能力
2024-05
阿里雲宣布通義系列模型大幅降價,加速 AI 應用普及
2025-11
阿里巴巴內部啟動代號為「HappyHorse」的影片生成模型研發項目
2026-04
千問 App 正式啟動 HappyHorse 1.0 的灰度測試
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪 ↗