🐼Pandaily•較早收集於 1m
ByteDance 開源多模態模型 Lance,支援本地 40GB VRAM 運行

💡ByteDance 推出的全新開源多模態模型,專為高效能本地推論而優化。
⚡ 30-Second TL;DR
有什麼變化
針對本地部署優化的原生多模態架構
為什麼重要
為開發者提供了一個強大的開源替代方案,用於處理本地多模態任務,減少對雲端 API 的依賴。
下一步行動
從 Hugging Face 下載 Lance 模型權重,並在您的本地 40GB VRAM 工作站上測試其多模態推論能力。
誰應關注:Developers & AI Engineers
關鍵要點
- •針對本地部署優化的原生多模態架構
- •需要 40GB VRAM 才能進行高效的本地推論
- •在 Hugging Face 趨勢榜上迅速獲得高人氣
🧠 深度解析
Web-grounded analysis with 10 cited sources.
🔑 增強重點摘要
- •Lance 是一個「原生統一多模態模型」,能在單一框架內處理圖像和影片的理解、生成及編輯任務,這與大多數專注於單一或分離任務的多模態系統不同。
- •儘管Lance僅有30億個活躍參數,但它在圖像生成、編輯和影片生成等基準測試中表現出色,例如VBench影片生成得分為85.11,GenEval總體得分為0.90。
- •該模型採用「分階段多任務訓練方案」,在128個A100 GPU的預算下從頭開始訓練,透過內部共享表徵逐步學習不同的能力。
- •Lance以Apache-2.0許可證開源發布,強調其可部署性和寬鬆的重用性,其高效率使其特別適用於行動和機器人等邊緣AI應用。
- •除了建議的40GB VRAM外,Lance的量化版本也能在24GB VRAM的GPU上流暢運行,進一步降低了本地部署的硬體門檻。
📊 競品分析▸ Show
| 模型名稱 | 活躍參數 | VRAM需求 (本地運行) | 主要多模態能力 | 定價 | 基準測試 |
|---|---|---|---|---|---|
| ByteDance Lance | 30億 | 40GB (量化版24GB) | 圖像與影片理解、生成、編輯 (統一框架) | 開源 (Apache-2.0) | VBench影片生成: 85.11, GenEval總體: 0.90 |
| Meta Llama 4 Scout | 170億 (MoE架構總計1090億) | 約12GB | 圖像與文本理解、生成 (原生多模態) | 開源 | 在基準測試中超越Gemma 3、Gemini 2.0 Flash-Lite和Mistral 3.1 |
| Alibaba Qwen 3 | 30億 (MoE架構30B-A3B變體) | 36GB (Mac統一記憶體) | 進階推理、數學、多語言、程式碼生成 | 開源 | GPQA Diamond: 77.2%, AIME 2024: 85.7% |
| NVIDIA Nemotron Cascade 2 | 300億 | 16GB+ | 推理優化,品質媲美GPT-4o mini | NVIDIA許可證 (開源權重,商業限制) | 消費級GPU上約54 tokens/秒 |
| OpenAI GPT-OSS | 200億, 1200億 | 未明確說明 (需高VRAM) | 企業級推理、工具調用、代理工作流程 | 開源權重 | GPT-4級別性能 |
🛠️ 技術深入
- 模型架構: 原生統一多模態模型,旨在單一框架內處理圖像和影片的理解、生成及編輯任務。
- 參數規模: 30億個活躍參數。
- 核心能力: 支援圖像理解、影片理解、文本到圖像生成、文本到影片生成、圖像編輯、影片編輯,以及視覺推理任務(例如計算影片中重複動作、檢測不真實現象、追蹤物體運動方向、總結烹飪過程、讀取車牌、分析圖表)。
- 訓練方式: 採用分階段多任務訓練方案,在128個A100 GPU的預算下從頭開始訓練(ViT和VAE編碼器除外,Transformer骨幹網路完全從頭訓練)。
- 預訓練數據: 約10億對圖像-文本對和1.4億對影片-文本對,涵蓋1.5兆個訓練token。
- 持續訓練數據: 約3000億個token的交錯多任務數據,包括編輯樣本、主題驅動生成樣本和多模態理解數據。
- 架構原理: 基於統一上下文建模和解耦能力路徑兩個原則。
- 輸入轉換: 將所有輸入(文本、圖像、影片)轉換為單一共享的交錯多模態序列。
- 文本Token: 來自Qwen2.5-VL嵌入層。
- 理解導向視覺輸入: Qwen2.5-VL ViT編碼器產生緊湊的語義視覺Token。
- 生成導向視覺輸入: Wan2.2 3D因果VAE編碼器將圖像和影片編碼為連續潛在表徵,應用16倍空間下採樣和4倍時間下採樣。
- 專家架構: 採用雙流混合專家(MoE)架構,從Qwen2.5-VL 3B初始化。
- 理解專家 (LLMUND): 處理文本和語義視覺Token,用於多模態推理和文本生成。
- 生成專家 (LLMGEN): 處理VAE潛在Token,用於視覺合成和編輯。
- 位置編碼: 採用模態感知旋轉位置編碼(MaPE),以減少異構視覺Token之間的位置干擾。
- 許可證: Apache-2.0。
- 軟體要求: Python 3.10+、CUDA 12.4+。
- 硬體要求: 推理至少需要40GB VRAM;量化版本可在24GB GPU上運行。
🔮 前景展望AI analysis grounded in cited sources
Lance的發布將加速邊緣AI應用(特別是行動和機器人領域)的開發和部署。
其高效能、多模態能力以及對本地部署的優化,降低了開發者在資源受限環境中利用先進AI的門檻。
統一多模態模型(如Lance)的趨勢將模糊傳統上生成模型和理解模型之間的界限。
能夠在單一框架內同時處理視覺理解、生成和編輯,預示著未來AI應用將擁有更整合的視覺智慧層。
隨著像Lance這樣的小型高效能開源模型普及,將對依賴大型、閉源模型的商業AI服務構成競爭壓力。
免費、開源且能在本地硬體上運行的模型,為開發者提供了成本效益高且數據隱私性強的替代方案。
⏳ 時間線
2012-03
字節跳動公司成立
2016
字節跳動AI實驗室成立
2023-08
字節跳動推出聊天機器人應用「豆包」
2025-02
字節跳動推出Goku,一個用於圖像和影片生成的先進AI模型
2025-06
字節跳動開源BAGEL AI,一個多模態AI模型,支援圖像理解、生成和編輯
2026-05
字節跳動開源多模態模型Lance
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗