🐯最新收集於 2h

字節跳動舊部湧入世界模型賽道

PostLinkedIn
🐯閱讀原文: 虎嗅

💡字節跳動舊部正布局世界模型各大方向,涵蓋影片生成、人形機器人與 Physical AI。

⚡ 30-Second TL;DR

有什麼變化

2025 年成立的世界模型新創超過 20 家,而 2026 年前七個月的數量已超過去年全年。

為什麼重要

具經驗的字節跳動人才集中進入該領域,可能加速世界模型在商業化與技術迭代上的進展,但也會帶來激烈的人才與估值競爭。開發者應預期影片模擬、機器人訓練與物理推理基礎設施將快速演進。

下一步行動

在選擇世界模型技術堆疊前,請使用碰撞、物體持續性與多步場景變化等物理一致性任務,對 PixVerse R1 及同類影片生成系統進行基準測試。

誰應關注:Founders & Product Leaders

關鍵要點

  • 2025 年成立的世界模型新創超過 20 家,而 2026 年前七個月的數量已超過去年全年。
  • 前字節跳動員工分布於影片生成、人形機器人模擬與 Physical AI 基礎模型等方向。
  • World Labs 與 AMI Labs 各自獲得約 10 億美元融資,加劇投資人對該賽道的競逐。
  • PixVerse R1、Booster Robotics 及多家具身智能新創,展示了產業正在形成的商業化路徑。
  • Google、OpenAI、Meta 與 Apple 也持續吸納字節跳動的多模態、影片與基礎模型研究人才。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 字節跳動前高管離職創業潮受到其內部『去中心化』研發架構影響,許多核心人才在離職前已深度參與過大規模多模態模型(LMM)的訓練與部署。
  • 除了影片生成與具身智能,字節跳動背景的創業者正將目光轉向『世界模擬器』(World Simulators),旨在透過強化學習與生成式模型構建可交互的物理環境,而非僅僅是視覺生成。
  • 中國風險投資機構在 2026 年上半年對『世界模型』賽道的投資偏好發生轉向,從單純的算法創新轉向具備『數據閉環能力』與『工業場景落地』的垂直領域團隊。
  • 字節跳動前員工在海外創業時,傾向於利用其在推薦算法與大規模分佈式訓練上的經驗,解決世界模型訓練中數據稀疏與長序列建模的技術瓶頸。
  • 多家由前字節跳動員工創立的 AI 公司已開始與中國本土製造業巨頭建立戰略合作,試圖在人形機器人控制領域實現『Sim-to-Real』(模擬到現實)的技術遷移。

🛠️ 技術深入

  • 世界模型架構多採用基於 Transformer 的時空預測模型,結合潛空間(Latent Space)擴散模型以提升生成效率。
  • 具身智能領域普遍採用端到端(End-to-End)模仿學習與強化學習混合架構,利用大規模模擬器(如 NVIDIA Isaac Sim)進行預訓練。
  • 針對長序列影片生成,技術路徑已從傳統的 U-Net 轉向 DiT(Diffusion Transformer)架構,並引入了時序注意力機制(Temporal Attention)以保持物理一致性。
  • 數據處理層面,創業者正開發自動化數據標註工具,利用視覺語言模型(VLM)自動生成物理屬性標籤,以降低對人工標註的依賴。

🔮 前景展望AI analysis grounded in cited sources

世界模型將在 2027 年前成為人形機器人商業化的核心基礎設施。
隨著模擬環境與現實物理規律的對齊精度提升,機器人訓練成本將大幅下降,推動具身智能進入大規模部署階段。
字節跳動背景的創業團隊將在未來兩年內主導全球開源世界模型生態。
該群體具備極強的工程化落地能力與開源社區運營經驗,能夠快速構建並迭代基礎模型架構。

時間線

2023-05
字節跳動成立專注於多模態與生成式 AI 的核心研究團隊。
2024-03
字節跳動發布多款基於 Transformer 架構的影片生成技術原型。
2025-01
首批核心研究員離職,開始在世界模型與具身智能領域進行種子輪融資。
2026-02
多個由前字節跳動員工創立的項目在國際 AI 頂會展示具身智能模擬成果。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅