🐼較早收集於 15m

ByteDance 發布 Lance:輕量級統一多模態模型

ByteDance 發布 Lance:輕量級統一多模態模型
PostLinkedIn
🐼閱讀原文: Pandaily

💡30 億參數的多模態模型非常適合邊緣部署;探索 Lance 是否符合您對資源受限的需求。

⚡ 30-Second TL;DR

有什麼變化

Lance 具備精簡的 30 億激活參數。

為什麼重要

發布 30 億參數的多模態模型,使先進的 AI 能力在邊緣運算和資源受限的環境中更易於實現。這挑戰了僅專注於大型、高運算需求模型的趨勢。

下一步行動

下載 Lance 模型權重並在您的本地硬體上測試其效能,以評估其是否適合邊緣端的多模態任務。

誰應關注:Researchers & Academics

關鍵要點

  • Lance 具備精簡的 30 億激活參數。
  • 支援原生統一多模態任務,包括影像理解、生成與影片處理。
  • 開源發布有助於更廣泛的社群採用並部署於邊緣裝置。

🧠 深度解析

Web-grounded analysis with 22 cited sources.

🔑 增強重點摘要

  • Lance 是一款原生統一的多模態模型,專為生成和理解任務而訓練,涵蓋影像生成、影片生成、編輯和視覺推理等多種功能。
  • 儘管模型體積小巧,Lance 在 VBench(影片生成)、GenEval(影像生成)和 GEdit-Bench(影像編輯)等基準測試中表現出色,展現了令人印象深刻的參數與性能比。
  • 其關鍵創新之一是多輪一致性編輯能力,能夠在影像和影片的多個連續編輯中保持內容一致性,這對於故事板製作和電影製作等任務至關重要。
  • Lance 採用「分階段多任務訓練方案」從頭開始訓練(除了 ViT 和 VAE 編碼器),並在 128 個 A100 GPU 的預算內完成,這在當前的 AI 領域被認為是「財務上負責任的行為」。
  • 該模型以 Apache 2.0 許可證開源,支援商業用途,並推薦使用 Python 3.10+、CUDA 12.4+ 以及至少 40GB 顯存的 GPU 進行推斷。
📊 競品分析▸ Show
模型名稱參數規模主要功能基準測試表現 (部分)許可證/可用性
字節跳動 Lance30 億 (活躍)影像/影片理解、生成、編輯GenEval: 0.90, VBench: 85.11, MVBench: 62.0, GEdit-Bench: 7.30 (統一模型中最高)Apache 2.0 (開源)
Google Gemini 2.5 Pro-文本、影像、影片、音訊處理,大規模上下文與推理MMMU 基準測試準確度 70.2%專有 API
Google Gemini 2.5 Flash-文本、影像、影片、音訊處理,快速推斷推斷速度低於 8.5 秒專有 API
OpenAI GPT-5.4-通用代理系統、多模態工作流程頂級品質專有 API
Anthropic Claude Opus 4.6-複雜代理任務、編碼、技術分析與安全頂級品質專有 API
Meta LLaMA 4 Scout-輕量級多模態任務 (影像字幕、視覺問答)-開源權重
智譜 AI GLM-4.5V1060 億 (總), 120 億 (活躍)影像、影片、長文件處理-專有 API
智譜 AI GLM-4.1V-9B-Thinking90 億通用多模態推理-開源
阿里雲 Qwen2.5-VL-32B-Instruct320 億視覺代理能力、文件理解、多語言 OCR & VQA-開源
Show-o270 億統一多模態模型MVBench: 55.7-

🛠️ 技術深入

  • 架構: 採用雙流專家混合 (Mixture-of-Experts, MoE) 架構,並結合模態感知旋轉位置編碼 (Modality-Aware Rotary Positional Encoding, MaPE)。
  • 統一上下文建模: 將所有輸入(文本、影像、影片)轉換為單一共享的交錯多模態序列。
  • 輸入處理:
    • 文本標記來自 Qwen2.5-VL 嵌入層。
    • 面向理解的視覺輸入:Qwen2.5-VL ViT 編碼器生成緊湊的語義視覺標記。
    • 面向生成的視覺輸入:Wan2.2 3D 因果 VAE 編碼器將影像和影片編碼為連續的潛在表示(空間下採樣 16 倍,時間下採樣 4 倍)。
  • 解耦能力路徑:
    • 理解專家 (LLMUND) 處理文本和語義視覺標記,用於多模態推理和文本生成。
    • 生成專家 (LLMGEN) 處理 VAE 潛在標記,用於視覺合成和編輯。
  • 訓練: 從頭開始訓練(ViT 和 VAE 編碼器除外),採用分階段多任務訓練方案,訓練預算不超過 128 個 A100 GPU。
  • 推斷硬體要求: Python 3.10+、CUDA 12.4+,以及至少 40GB 顯存的 GPU。
  • 開源許可證: Apache 2.0。

🔮 前景展望AI analysis grounded in cited sources

加速 AI 電影製作和創意產業發展。
Lance 的多輪一致性編輯和統一多模態能力簡化了複雜的視覺任務,使其在故事板、電影製作和角色設計等領域更具實用性。
推動「生成模型」與「理解模型」的融合。
Lance 統一了生成和理解任務的框架,預示著未來 AI 應用可能不再區分「看」與「創造」,而是走向單一的視覺智能層。
提高先進多模態 AI 的可及性。
其輕量級(30 億活躍參數)和 Apache 2.0 開源的特性,使其更易於部署在邊緣設備上,並為預算有限的初創公司提供解決方案。

時間線

2023
字節跳動的 Doubao(原 Skylark)發布,並發展為涵蓋多模態和多場景應用的綜合模型家族。
2025-02
字節跳動在 AWS Inferentia2 上部署多模態大型語言模型,用於影片理解,每天處理數十億個影片。
2025-08
字節跳動開源 Seed-OSS-36B,這是一款具有通用和推理能力的 360 億參數 AI 模型。
2025-12
字節跳動 Seed 團隊推出 Seedance 1.5 Pro,一款原生音視訊聯合生成基礎模型。
2026-02
字節跳動開源 DeerFlow,一個被描述為「超級代理框架」的強大 AI 系統。
2026-05
字節跳動開源 Lance,一款 30 億參數的輕量級統一多模態模型。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily