⚛️較早收集於 14h

字節跳動提出視覺生成第三種技術路線

字節跳動提出視覺生成第三種技術路線
PostLinkedIn
⚛️閱讀原文: 量子位

💡視覺生成領域的潛在突破,挑戰擴散模型地位。生成式 AI 研究人員必讀。

⚡ 30-Second TL;DR

有什麼變化

超越擴散與自回歸模型的新視覺生成範式

為什麼重要

這項研究可能透過在創作過程中提供更高的控制力與效率,顛覆目前擴散模型在圖像生成領域的統治地位。

下一步行動

密切關注字節跳動關於此架構的後續論文,評估是否能將其整合至您的生成式圖像管線中。

誰應關注:Researchers & Academics

關鍵要點

  • 超越擴散與自回歸模型的新視覺生成範式
  • 支援迭代式的「邊畫邊改」能力
  • 在相同參數規模下超越現有模型

🧠 深度解析

Web-grounded analysis with 22 cited sources.

🔑 增強重點摘要

  • 字節跳動提出的新視覺生成方法被命名為GRN(Global Refinement Network),其核心架構包含層次二叉樹量化(Hierarchical Binary Tree Quantization, HBQ)、全局精煉網絡及複雜度感知採樣,旨在實現近乎無損的離散編碼,並能統一建模圖像與視頻,避免傳統自回歸模型的信息損失問題。
  • GRN模型證明了純血離散token在圖像和視頻生成方面的可行性,這有望在長期內更好地統一圖像、視頻和文本token,顯著提升模型的多模態理解與生成能力。
  • 相較於現有模型,GRN在重建上限方面高於自回歸模型,對抗誤差累積的能力更強;同時,它能比擴散模型更智能地分配計算步數,解決了兩者長期存在的難題。
  • 字節跳動在視覺生成領域已建立多個模型系列,包括專注圖像生成的Seedream系列(最新為Seedream 5.0,對標Google Nano Banana Pro)和專注視頻生成的Seedance系列(最新為Seedance 2.0,被評為業界領先),顯示其在不同細分領域的全面佈局。
  • 字節跳動正大幅增加其AI基礎設施投入,2026年資本支出預計將超過2000億人民幣(約300億美元),其中更大比例將用於採購國產AI晶片,並透過租用海外數據中心以合規方式使用Nvidia最先進硬件,以應對地緣政治風險及加速AI發展。
📊 競品分析▸ Show

目前文章主要討論字節跳動提出的「第三種技術路線」GRN,並未直接提供與其他競爭模型的詳細基準測試數據。然而,從字節跳動其他視覺生成模型的公開資訊中,可以窺見其與主要競爭對手的對標情況。

特性/模型字節跳動 GRN (第三種路線)字節跳動 Seedream 5.0 (圖像生成)字節跳動 Seedance 2.0 (視頻生成)擴散模型 (通用)自回歸模型 (通用)阿里巴巴 Qwen-Image-2.0 (圖像生成)Google Nano Banana Pro (圖像生成)OpenAI Sora / Google Veo 3 (視頻生成)
核心機制層次二叉樹量化、全局精煉網絡、複雜度感知採樣,兼顧全局精調與內容複雜度感知知識推理與智能編輯,實時聯網搜圖,強化提示詞理解統一多模態音視頻聯合生成架構,多模態內容參考與編輯從隨機噪聲逐步去噪生成序列式預測下一個token圖像生成與編輯整合,精準中文文字渲染- (對標Seedream 5.0)文本/圖像生成視頻
優勢兼顧生成質量與智能,可迭代修改,自適應分配計算步數,重建上限高,抗誤差累積強2K/4K分辨率,精確提示詞理解,複雜多步邏輯推理,實時聯網知識整合運動穩定性與物理還原能力SOTA,多主體交互與複雜運動場景可用率高,導演級控制權,角色一致性生成質量高,細節豐富具備複雜度感知能力,連貫性強底層架構整合,中文渲染能力強,高達1000token複雜文字指令- (被對標,通常具備高質量生成能力)高質量視頻生成,音頻合成,電影級工具 (Veo 3)
挑戰/劣勢- (新提出,潛在挑戰待觀察)聯網功能尚不穩定,抽象詞彙處理優異但升級幅度被部分用戶認為有限音頻能力相對欠缺 (Seedance 1.0時期)不夠智能,對所有樣本分配相同迭代步數,缺乏自適應能力,迭代採樣慢受限於離散token化導致信息損失,誤差累積和傳播,早期錯誤難修正- (對標Seedream 5.0,在文字生成圖像任務位居全球第3,編輯能力第2)- (被對標,具體劣勢未詳述)- (Sora未公開,Veo 3在圖像到視頻任務中可能出現光照和紋理變化)
應用場景視覺生成,圖像與視頻統一建模影片剪輯工具 (剪映、CapCut)、AI創作平台 (小雲雀),廣告、電商、影視影視製作、廣告行銷、短劇、AI漫畫圖像、視頻生成文本、序列數據生成海報設計、多格漫畫場景-專業工作流程、常規創作任務
定價- (研究階段,未商業化)每位用戶20次免費額度,計畫拓展至美國市場豆包AI助手擬推付費訂閱服務,最低月費68人民幣,最高500人民幣- (依具體模型和服務商而異)- (依具體模型和服務商而異)- (對標產品,具體定價未詳述)- (對標產品,具體定價未詳述)- (依具體模型和服務商而異)

🛠️ 技術深入

  • GRN (Global Refinement Network) 模型架構
    • 核心思想:結合擴散模型的高生成質量與自回歸模型的複雜度感知能力,同時解決兩者的固有問題,實現「邊畫邊改」的迭代式生成。
    • 層次二叉樹量化 (Hierarchical Binary Tree Quantization, HBQ)
      • 針對自回歸模型的離散損失問題,HBQ採用近乎無損的離散編碼,避免壓縮過程中的信息丟失。
      • 將VAE編碼後的連續特徵映射到[-1, +1]區間,再通過二叉樹結構進行多輪二進制量化。
      • 重建誤差會隨著量化輪數增加而逐漸分配到更精細的量化區間,量化誤差呈指數級衰減,理論上可實現完全無損量化。
      • 最終獲得M個二進制標籤,分別代表從粗到細的信息層次。
    • 全局精煉網絡 (Global Refinement Network):作為核心架構之一,負責對生成內容進行全局性的精細調整。
    • 複雜度感知採樣 (Complexity-Aware Sampling):能夠根據生成內容的複雜度智能地分配計算步數,提高效率與智能性。
    • 統一建模:GRN證明了純血離散token能夠做好圖像和視頻生成,從長遠來看,能更好地統一圖像、視頻、文本token,顯著提升模型的多模態理解與生成能力。
  • Seedream 3.0 (圖像生成模型)
    • 數據層面:採用新型視覺語義二維協同採樣策略(基於圖像聚類分佈與文本語義連貫性),將數據集規模擴展約100%。
    • 預訓練階段:改進包括混合分辨率訓練、跨模態旋轉位置編碼(RoPE)、表徵對齊損失、分辨率感知時間步採樣,以實現更好的擴展性、泛化能力和視覺-語言對齊。
    • 後訓練階段:利用多樣化的美學描述文本和基於視覺語言模型的獎勵模型,進一步提升綜合能力。
    • 模型加速階段:採用一致噪聲期望提升採樣過程平穩性,大幅減少採樣步數,保證生成質量無損。
  • Seedance 1.0 (視頻生成模型)
    • 創新之處:通過空間和時間層的解耦,結合多模態位置編碼,使其能同時處理文本到視頻和圖像到視頻的生成任務。
    • 數據管道:構建大規模、多來源的數據集,配有詳細的雙語註釋和豐富的動作與靜態特徵標註。
    • 強化學習:採用新穎的強化學習設置,結合三個獎勵模型,重點關注基礎對齊、動作質量和美觀度。
  • Seedance 2.0 (視頻生成模型)
    • 統一多模態音視頻聯合生成架構:支持文字、圖片、音頻、視頻四種模態輸入,集成業界最全面的多模態內容參考和編輯能力。
    • 運動穩定性與物理還原能力:在多主體交互及複雜運動場景下的視頻生成可用率達到業界SOTA水平。
    • 音畫同步能力:可同步產生搭配的音效與配樂,實現精準口型同步與情緒映射,角色表情隨語氣自然變化。
    • 導演式創作體驗:支援多達12個參考文件,可根據劇情自動規劃分鏡與運鏡,解決角色一致性難題。

🔮 前景展望AI analysis grounded in cited sources

視覺生成領域將迎來更多「第三種路線」的探索
字節跳動成功提出並驗證了GRN作為擴散模型與自回歸模型之外的新範式,將激勵更多研究者探索融合兩者優勢、規避其缺陷的創新架構。
多模態內容創作工具的智能化與易用性將大幅提升
GRN的迭代修改能力和Seedance 2.0的導演級控制權預示著AI工具將更貼近人類創作習慣,降低專業內容製作門檻,加速AI在影視、廣告等行業的普及應用。
中國AI企業在基礎模型創新上將扮演更重要角色
字節跳動在視覺生成領域的持續投入和技術突破,以及其對國產AI晶片的加碼,顯示中國企業正從應用層面走向底層技術創新,並在全球AI競爭中佔據一席之地。

時間線

2024-11-21
字節跳動推出PixelDance和Seaweed視頻生成模型,並在即夢AI平台免費開放。
2025-04-16
字節跳動發布Seedream 3.0,一款原生高分辨率中英雙語圖像生成基礎模型。
2025-06-11
字節跳動發布Seedance 1.0視頻生成模型論文,該模型在評測中超越Google Veo 3。
2025-09-12
字節跳動發布Seedream 4.0,整合圖像生成與編輯能力,支持複雜多模態生成任務。
2026-02-10
字節跳動同步發布新一代AI生圖模型Seedream 5.0預覽版和視頻生成模型Seedance 2.0。
2026-05-13
字節跳動研究人員提出視覺生成第三種技術路線GRN,挑戰擴散與自回歸模型。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位