來源Pandaily•較早收集於 15m
ByteDance 發布 Lance:輕量級統一多模態模型

30 億參數的多模態模型非常適合邊緣部署;探索 Lance 是否符合您對資源受限的需求。
30 秒速覽
有什麼變化
Lance 具備精簡的 30 億激活參數。
為什麼重要
發布 30 億參數的多模態模型,使先進的 AI 能力在邊緣運算和資源受限的環境中更易於實現。這挑戰了僅專注於大型、高運算需求模型的趨勢。
下一步行動
下載 Lance 模型權重並在您的本地硬體上測試其效能,以評估其是否適合邊緣端的多模態任務。
誰應關注:Researchers & Academics
關鍵要點
- •Lance 具備精簡的 30 億激活參數。
- •支援原生統一多模態任務,包括影像理解、生成與影片處理。
- •開源發布有助於更廣泛的社群採用並部署於邊緣裝置。
深度解析
背景與延伸:來自公開資料,非原文內容。引用 22 個來源。
增強重點摘要
- •Lance 是一款原生統一的多模態模型,專為生成和理解任務而訓練,涵蓋影像生成、影片生成、編輯和視覺推理等多種功能。
- •儘管模型體積小巧,Lance 在 VBench(影片生成)、GenEval(影像生成)和 GEdit-Bench(影像編輯)等基準測試中表現出色,展現了令人印象深刻的參數與性能比。
- •其關鍵創新之一是多輪一致性編輯能力,能夠在影像和影片的多個連續編輯中保持內容一致性,這對於故事板製作和電影製作等任務至關重要。
- •Lance 採用「分階段多任務訓練方案」從頭開始訓練(除了 ViT 和 VAE 編碼器),並在 128 個 A100 GPU 的預算內完成,這在當前的 AI 領域被認為是「財務上負責任的行為」。
- •該模型以 Apache 2.0 許可證開源,支援商業用途,並推薦使用 Python 3.10+、CUDA 12.4+ 以及至少 40GB 顯存的 GPU 進行推斷。
競品分析
字節跳動 Lance
- 參數規模
- 30 億 (活躍)
- 主要功能
- 影像/影片理解、生成、編輯
- 基準測試表現 (部分)
- GenEval: 0.90, VBench: 85.11, MVBench: 62.0, GEdit-Bench: 7.30 (統一模型中最高)
- 許可證/可用性
- Apache 2.0 (開源)
Google Gemini 2.5 Pro
- 參數規模
- 主要功能
- 文本、影像、影片、音訊處理,大規模上下文與推理
- 基準測試表現 (部分)
- MMMU 基準測試準確度 70.2%
- 許可證/可用性
- 專有 API
Google Gemini 2.5 Flash
- 參數規模
- 主要功能
- 文本、影像、影片、音訊處理,快速推斷
- 基準測試表現 (部分)
- 推斷速度低於 8.5 秒
- 許可證/可用性
- 專有 API
OpenAI GPT-5.4
- 參數規模
- 主要功能
- 通用代理系統、多模態工作流程
- 基準測試表現 (部分)
- 頂級品質
- 許可證/可用性
- 專有 API
Anthropic Claude Opus 4.6
- 參數規模
- 主要功能
- 複雜代理任務、編碼、技術分析與安全
- 基準測試表現 (部分)
- 頂級品質
- 許可證/可用性
- 專有 API
Meta LLaMA 4 Scout
- 參數規模
- 主要功能
- 輕量級多模態任務 (影像字幕、視覺問答)
- 基準測試表現 (部分)
- 許可證/可用性
- 開源權重
智譜 AI GLM-4.5V
- 參數規模
- 1060 億 (總), 120 億 (活躍)
- 主要功能
- 影像、影片、長文件處理
- 基準測試表現 (部分)
- 許可證/可用性
- 專有 API
智譜 AI GLM-4.1V-9B-Thinking
- 參數規模
- 90 億
- 主要功能
- 通用多模態推理
- 基準測試表現 (部分)
- 許可證/可用性
- 開源
阿里雲 Qwen2.5-VL-32B-Instruct
- 參數規模
- 320 億
- 主要功能
- 視覺代理能力、文件理解、多語言 OCR & VQA
- 基準測試表現 (部分)
- 許可證/可用性
- 開源
Show-o2
- 參數規模
- 70 億
- 主要功能
- 統一多模態模型
- 基準測試表現 (部分)
- MVBench: 55.7
- 許可證/可用性
| 模型名稱 | 參數規模 | 主要功能 | 基準測試表現 (部分) | 許可證/可用性 |
|---|---|---|---|---|
| 字節跳動 Lance | 30 億 (活躍) | 影像/影片理解、生成、編輯 | GenEval: 0.90, VBench: 85.11, MVBench: 62.0, GEdit-Bench: 7.30 (統一模型中最高) | Apache 2.0 (開源) |
| Google Gemini 2.5 Pro | 文本、影像、影片、音訊處理,大規模上下文與推理 | MMMU 基準測試準確度 70.2% | 專有 API | |
| Google Gemini 2.5 Flash | 文本、影像、影片、音訊處理,快速推斷 | 推斷速度低於 8.5 秒 | 專有 API | |
| OpenAI GPT-5.4 | 通用代理系統、多模態工作流程 | 頂級品質 | 專有 API | |
| Anthropic Claude Opus 4.6 | 複雜代理任務、編碼、技術分析與安全 | 頂級品質 | 專有 API | |
| Meta LLaMA 4 Scout | 輕量級多模態任務 (影像字幕、視覺問答) | 開源權重 | ||
| 智譜 AI GLM-4.5V | 1060 億 (總), 120 億 (活躍) | 影像、影片、長文件處理 | 專有 API | |
| 智譜 AI GLM-4.1V-9B-Thinking | 90 億 | 通用多模態推理 | 開源 | |
| 阿里雲 Qwen2.5-VL-32B-Instruct | 320 億 | 視覺代理能力、文件理解、多語言 OCR & VQA | 開源 | |
| Show-o2 | 70 億 | 統一多模態模型 | MVBench: 55.7 |
技術深入
- 架構: 採用雙流專家混合 (Mixture-of-Experts, MoE) 架構,並結合模態感知旋轉位置編碼 (Modality-Aware Rotary Positional Encoding, MaPE)。
- 統一上下文建模: 將所有輸入(文本、影像、影片)轉換為單一共享的交錯多模態序列。
- 輸入處理:
- 文本標記來自 Qwen2.5-VL 嵌入層。
- 面向理解的視覺輸入:Qwen2.5-VL ViT 編碼器生成緊湊的語義視覺標記。
- 面向生成的視覺輸入:Wan2.2 3D 因果 VAE 編碼器將影像和影片編碼為連續的潛在表示(空間下採樣 16 倍,時間下採樣 4 倍)。
- 解耦能力路徑:
- 理解專家 (LLMUND) 處理文本和語義視覺標記,用於多模態推理和文本生成。
- 生成專家 (LLMGEN) 處理 VAE 潛在標記,用於視覺合成和編輯。
- 訓練: 從頭開始訓練(ViT 和 VAE 編碼器除外),採用分階段多任務訓練方案,訓練預算不超過 128 個 A100 GPU。
- 推斷硬體要求: Python 3.10+、CUDA 12.4+,以及至少 40GB 顯存的 GPU。
- 開源許可證: Apache 2.0。
前景展望基於引用來源的 AI 分析
加速 AI 電影製作和創意產業發展。
Lance 的多輪一致性編輯和統一多模態能力簡化了複雜的視覺任務,使其在故事板、電影製作和角色設計等領域更具實用性。
推動「生成模型」與「理解模型」的融合。
Lance 統一了生成和理解任務的框架,預示著未來 AI 應用可能不再區分「看」與「創造」,而是走向單一的視覺智能層。
提高先進多模態 AI 的可及性。
其輕量級(30 億活躍參數)和 Apache 2.0 開源的特性,使其更易於部署在邊緣設備上,並為預算有限的初創公司提供解決方案。
時間線
2023
字節跳動的 Doubao(原 Skylark)發布,並發展為涵蓋多模態和多場景應用的綜合模型家族。
2025-02
字節跳動在 AWS Inferentia2 上部署多模態大型語言模型,用於影片理解,每天處理數十億個影片。
2025-08
字節跳動開源 Seed-OSS-36B,這是一款具有通用和推理能力的 360 億參數 AI 模型。
2025-12
字節跳動 Seed 團隊推出 Seedance 1.5 Pro,一款原生音視訊聯合生成基礎模型。
2026-02
字節跳動開源 DeerFlow,一個被描述為「超級代理框架」的強大 AI 系統。
2026-05
字節跳動開源 Lance,一款 30 億參數的輕量級統一多模態模型。
- 2023字節跳動的 Doubao(原 Skylark)發布,並發展為涵蓋多模態和多場景應用的綜合模型家族。
- 2025-02字節跳動在 AWS Inferentia2 上部署多模態大型語言模型,用於影片理解,每天處理數十億個影片。
- 2025-08字節跳動開源 Seed-OSS-36B,這是一款具有通用和推理能力的 360 億參數 AI 模型。
- 2025-12字節跳動 Seed 團隊推出 Seedance 1.5 Pro,一款原生音視訊聯合生成基礎模型。
- 2026-02字節跳動開源 DeerFlow,一個被描述為「超級代理框架」的強大 AI 系統。
- 2026-05字節跳動開源 Lance,一款 30 億參數的輕量級統一多模態模型。
來源 (22)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1medium.comvertexaisearch.cloud.google.com2marktechpost.comvertexaisearch.cloud.google.com3reddit.comvertexaisearch.cloud.google.com4phemex.comvertexaisearch.cloud.google.com5kucoin.comvertexaisearch.cloud.google.com6github.iovertexaisearch.cloud.google.com7reddit.comvertexaisearch.cloud.google.com8huggingface.covertexaisearch.cloud.google.com9github.comvertexaisearch.cloud.google.com10startupfortune.comvertexaisearch.cloud.google.com11youtube.comvertexaisearch.cloud.google.com12roboflow.comvertexaisearch.cloud.google.com13fluence.networkvertexaisearch.cloud.google.com14kanerika.comvertexaisearch.cloud.google.com15unitlab.aivertexaisearch.cloud.google.com16siliconflow.comvertexaisearch.cloud.google.com17reddit.comvertexaisearch.cloud.google.com18substack.comvertexaisearch.cloud.google.com19amazon.comvertexaisearch.cloud.google.com20scmp.comvertexaisearch.cloud.google.com21bytedance.comvertexaisearch.cloud.google.com22tekedia.comvertexaisearch.cloud.google.com
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗
每週電子報
每週一封,可隨時退訂。



