🐼Pandaily•較早收集於 15m
ByteDance 發布 Lance:輕量級統一多模態模型

💡30 億參數的多模態模型非常適合邊緣部署;探索 Lance 是否符合您對資源受限的需求。
⚡ 30-Second TL;DR
有什麼變化
Lance 具備精簡的 30 億激活參數。
為什麼重要
發布 30 億參數的多模態模型,使先進的 AI 能力在邊緣運算和資源受限的環境中更易於實現。這挑戰了僅專注於大型、高運算需求模型的趨勢。
下一步行動
下載 Lance 模型權重並在您的本地硬體上測試其效能,以評估其是否適合邊緣端的多模態任務。
誰應關注:Researchers & Academics
關鍵要點
- •Lance 具備精簡的 30 億激活參數。
- •支援原生統一多模態任務,包括影像理解、生成與影片處理。
- •開源發布有助於更廣泛的社群採用並部署於邊緣裝置。
🧠 深度解析
Web-grounded analysis with 22 cited sources.
🔑 增強重點摘要
- •Lance 是一款原生統一的多模態模型,專為生成和理解任務而訓練,涵蓋影像生成、影片生成、編輯和視覺推理等多種功能。
- •儘管模型體積小巧,Lance 在 VBench(影片生成)、GenEval(影像生成)和 GEdit-Bench(影像編輯)等基準測試中表現出色,展現了令人印象深刻的參數與性能比。
- •其關鍵創新之一是多輪一致性編輯能力,能夠在影像和影片的多個連續編輯中保持內容一致性,這對於故事板製作和電影製作等任務至關重要。
- •Lance 採用「分階段多任務訓練方案」從頭開始訓練(除了 ViT 和 VAE 編碼器),並在 128 個 A100 GPU 的預算內完成,這在當前的 AI 領域被認為是「財務上負責任的行為」。
- •該模型以 Apache 2.0 許可證開源,支援商業用途,並推薦使用 Python 3.10+、CUDA 12.4+ 以及至少 40GB 顯存的 GPU 進行推斷。
📊 競品分析▸ Show
| 模型名稱 | 參數規模 | 主要功能 | 基準測試表現 (部分) | 許可證/可用性 |
|---|---|---|---|---|
| 字節跳動 Lance | 30 億 (活躍) | 影像/影片理解、生成、編輯 | GenEval: 0.90, VBench: 85.11, MVBench: 62.0, GEdit-Bench: 7.30 (統一模型中最高) | Apache 2.0 (開源) |
| Google Gemini 2.5 Pro | - | 文本、影像、影片、音訊處理,大規模上下文與推理 | MMMU 基準測試準確度 70.2% | 專有 API |
| Google Gemini 2.5 Flash | - | 文本、影像、影片、音訊處理,快速推斷 | 推斷速度低於 8.5 秒 | 專有 API |
| OpenAI GPT-5.4 | - | 通用代理系統、多模態工作流程 | 頂級品質 | 專有 API |
| Anthropic Claude Opus 4.6 | - | 複雜代理任務、編碼、技術分析與安全 | 頂級品質 | 專有 API |
| Meta LLaMA 4 Scout | - | 輕量級多模態任務 (影像字幕、視覺問答) | - | 開源權重 |
| 智譜 AI GLM-4.5V | 1060 億 (總), 120 億 (活躍) | 影像、影片、長文件處理 | - | 專有 API |
| 智譜 AI GLM-4.1V-9B-Thinking | 90 億 | 通用多模態推理 | - | 開源 |
| 阿里雲 Qwen2.5-VL-32B-Instruct | 320 億 | 視覺代理能力、文件理解、多語言 OCR & VQA | - | 開源 |
| Show-o2 | 70 億 | 統一多模態模型 | MVBench: 55.7 | - |
🛠️ 技術深入
- 架構: 採用雙流專家混合 (Mixture-of-Experts, MoE) 架構,並結合模態感知旋轉位置編碼 (Modality-Aware Rotary Positional Encoding, MaPE)。
- 統一上下文建模: 將所有輸入(文本、影像、影片)轉換為單一共享的交錯多模態序列。
- 輸入處理:
- 文本標記來自 Qwen2.5-VL 嵌入層。
- 面向理解的視覺輸入:Qwen2.5-VL ViT 編碼器生成緊湊的語義視覺標記。
- 面向生成的視覺輸入:Wan2.2 3D 因果 VAE 編碼器將影像和影片編碼為連續的潛在表示(空間下採樣 16 倍,時間下採樣 4 倍)。
- 解耦能力路徑:
- 理解專家 (LLMUND) 處理文本和語義視覺標記,用於多模態推理和文本生成。
- 生成專家 (LLMGEN) 處理 VAE 潛在標記,用於視覺合成和編輯。
- 訓練: 從頭開始訓練(ViT 和 VAE 編碼器除外),採用分階段多任務訓練方案,訓練預算不超過 128 個 A100 GPU。
- 推斷硬體要求: Python 3.10+、CUDA 12.4+,以及至少 40GB 顯存的 GPU。
- 開源許可證: Apache 2.0。
🔮 前景展望AI analysis grounded in cited sources
加速 AI 電影製作和創意產業發展。
Lance 的多輪一致性編輯和統一多模態能力簡化了複雜的視覺任務,使其在故事板、電影製作和角色設計等領域更具實用性。
推動「生成模型」與「理解模型」的融合。
Lance 統一了生成和理解任務的框架,預示著未來 AI 應用可能不再區分「看」與「創造」,而是走向單一的視覺智能層。
提高先進多模態 AI 的可及性。
其輕量級(30 億活躍參數)和 Apache 2.0 開源的特性,使其更易於部署在邊緣設備上,並為預算有限的初創公司提供解決方案。
⏳ 時間線
2023
字節跳動的 Doubao(原 Skylark)發布,並發展為涵蓋多模態和多場景應用的綜合模型家族。
2025-02
字節跳動在 AWS Inferentia2 上部署多模態大型語言模型,用於影片理解,每天處理數十億個影片。
2025-08
字節跳動開源 Seed-OSS-36B,這是一款具有通用和推理能力的 360 億參數 AI 模型。
2025-12
字節跳動 Seed 團隊推出 Seedance 1.5 Pro,一款原生音視訊聯合生成基礎模型。
2026-02
字節跳動開源 DeerFlow,一個被描述為「超級代理框架」的強大 AI 系統。
2026-05
字節跳動開源 Lance,一款 30 億參數的輕量級統一多模態模型。
📎 來源 (22)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗