🐼較早收集於 1m

ByteDance 開源多模態模型 Lance,支援本地 40GB VRAM 運行

ByteDance 開源多模態模型 Lance,支援本地 40GB VRAM 運行
PostLinkedIn
🐼閱讀原文: Pandaily

💡ByteDance 推出的全新開源多模態模型,專為高效能本地推論而優化。

⚡ 30-Second TL;DR

有什麼變化

針對本地部署優化的原生多模態架構

為什麼重要

為開發者提供了一個強大的開源替代方案,用於處理本地多模態任務,減少對雲端 API 的依賴。

下一步行動

從 Hugging Face 下載 Lance 模型權重,並在您的本地 40GB VRAM 工作站上測試其多模態推論能力。

誰應關注:Developers & AI Engineers

關鍵要點

  • 針對本地部署優化的原生多模態架構
  • 需要 40GB VRAM 才能進行高效的本地推論
  • 在 Hugging Face 趨勢榜上迅速獲得高人氣

🧠 深度解析

Web-grounded analysis with 10 cited sources.

🔑 增強重點摘要

  • Lance 是一個「原生統一多模態模型」,能在單一框架內處理圖像和影片的理解、生成及編輯任務,這與大多數專注於單一或分離任務的多模態系統不同。
  • 儘管Lance僅有30億個活躍參數,但它在圖像生成、編輯和影片生成等基準測試中表現出色,例如VBench影片生成得分為85.11,GenEval總體得分為0.90。
  • 該模型採用「分階段多任務訓練方案」,在128個A100 GPU的預算下從頭開始訓練,透過內部共享表徵逐步學習不同的能力。
  • Lance以Apache-2.0許可證開源發布,強調其可部署性和寬鬆的重用性,其高效率使其特別適用於行動和機器人等邊緣AI應用。
  • 除了建議的40GB VRAM外,Lance的量化版本也能在24GB VRAM的GPU上流暢運行,進一步降低了本地部署的硬體門檻。
📊 競品分析▸ Show
模型名稱活躍參數VRAM需求 (本地運行)主要多模態能力定價基準測試
ByteDance Lance30億40GB (量化版24GB)圖像與影片理解、生成、編輯 (統一框架)開源 (Apache-2.0)VBench影片生成: 85.11, GenEval總體: 0.90
Meta Llama 4 Scout170億 (MoE架構總計1090億)約12GB圖像與文本理解、生成 (原生多模態)開源在基準測試中超越Gemma 3、Gemini 2.0 Flash-Lite和Mistral 3.1
Alibaba Qwen 330億 (MoE架構30B-A3B變體)36GB (Mac統一記憶體)進階推理、數學、多語言、程式碼生成開源GPQA Diamond: 77.2%, AIME 2024: 85.7%
NVIDIA Nemotron Cascade 2300億16GB+推理優化,品質媲美GPT-4o miniNVIDIA許可證 (開源權重,商業限制)消費級GPU上約54 tokens/秒
OpenAI GPT-OSS200億, 1200億未明確說明 (需高VRAM)企業級推理、工具調用、代理工作流程開源權重GPT-4級別性能

🛠️ 技術深入

  • 模型架構: 原生統一多模態模型,旨在單一框架內處理圖像和影片的理解、生成及編輯任務。
  • 參數規模: 30億個活躍參數。
  • 核心能力: 支援圖像理解、影片理解、文本到圖像生成、文本到影片生成、圖像編輯、影片編輯,以及視覺推理任務(例如計算影片中重複動作、檢測不真實現象、追蹤物體運動方向、總結烹飪過程、讀取車牌、分析圖表)。
  • 訓練方式: 採用分階段多任務訓練方案,在128個A100 GPU的預算下從頭開始訓練(ViT和VAE編碼器除外,Transformer骨幹網路完全從頭訓練)。
  • 預訓練數據: 約10億對圖像-文本對和1.4億對影片-文本對,涵蓋1.5兆個訓練token。
  • 持續訓練數據: 約3000億個token的交錯多任務數據,包括編輯樣本、主題驅動生成樣本和多模態理解數據。
  • 架構原理: 基於統一上下文建模和解耦能力路徑兩個原則。
  • 輸入轉換: 將所有輸入(文本、圖像、影片)轉換為單一共享的交錯多模態序列。
  • 文本Token: 來自Qwen2.5-VL嵌入層。
  • 理解導向視覺輸入: Qwen2.5-VL ViT編碼器產生緊湊的語義視覺Token。
  • 生成導向視覺輸入: Wan2.2 3D因果VAE編碼器將圖像和影片編碼為連續潛在表徵,應用16倍空間下採樣和4倍時間下採樣。
  • 專家架構: 採用雙流混合專家(MoE)架構,從Qwen2.5-VL 3B初始化。
    • 理解專家 (LLMUND): 處理文本和語義視覺Token,用於多模態推理和文本生成。
    • 生成專家 (LLMGEN): 處理VAE潛在Token,用於視覺合成和編輯。
  • 位置編碼: 採用模態感知旋轉位置編碼(MaPE),以減少異構視覺Token之間的位置干擾。
  • 許可證: Apache-2.0。
  • 軟體要求: Python 3.10+、CUDA 12.4+。
  • 硬體要求: 推理至少需要40GB VRAM;量化版本可在24GB GPU上運行。

🔮 前景展望AI analysis grounded in cited sources

Lance的發布將加速邊緣AI應用(特別是行動和機器人領域)的開發和部署。
其高效能、多模態能力以及對本地部署的優化,降低了開發者在資源受限環境中利用先進AI的門檻。
統一多模態模型(如Lance)的趨勢將模糊傳統上生成模型和理解模型之間的界限。
能夠在單一框架內同時處理視覺理解、生成和編輯,預示著未來AI應用將擁有更整合的視覺智慧層。
隨著像Lance這樣的小型高效能開源模型普及,將對依賴大型、閉源模型的商業AI服務構成競爭壓力。
免費、開源且能在本地硬體上運行的模型,為開發者提供了成本效益高且數據隱私性強的替代方案。

時間線

2012-03
字節跳動公司成立
2016
字節跳動AI實驗室成立
2023-08
字節跳動推出聊天機器人應用「豆包」
2025-02
字節跳動推出Goku,一個用於圖像和影片生成的先進AI模型
2025-06
字節跳動開源BAGEL AI,一個多模態AI模型,支援圖像理解、生成和編輯
2026-05
字節跳動開源多模態模型Lance

📎 來源 (10)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. medium.com
  2. marktechpost.com
  3. letsdatascience.com
  4. hyper.ai
  5. github.com
  6. pandaily.com
  7. medium.com
  8. pinggy.io
  9. github.io
  10. dirox.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily