🔥36氪•較早收集於 14m
卓驭推出物理AI多模態基礎模型
#embodied-ai#multimodal#autonomous-driving#foundation-modelzhuoyu-multimodal-foundation-modelzhuoyuvla-2.0physical-ai
💡物理AI生存轉型:卓驭多模態模型+新商業模式,助自動駕駛/機器人擴展。(48字)
⚡ 30-Second TL;DR
有什麼變化
原生多模態模型預訓練融合視覺、音頻、動作,不經語言轉譯。
為什麼重要
這標誌自動駕駛從專家模型轉向可擴展基礎模型,可能標準化移動平台的物理AI。卓驭的分發策略可加速L4機器人採用,挑戰既有業者。
下一步行動
將卓驭移動AI SDK整合至機器人原型,快速測試物理AI。
誰應關注:Developers & AI Engineers
關鍵要點
- •原生多模態模型預訓練融合視覺、音頻、動作,不經語言轉譯。
- •數據組合:30%車輛、30%機器人、40%網際網路第一人稱移動影片。
- •從VLA 1.0進化至VLA 2.0範式,實現約70%零樣本能力。
- •新商業模式:SDK分發、開源給夥伴、雲端動作令牌。
- •擴展至車輛、Robotaxi、RoboVan,超越傳統硬體銷售。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •卓馭科技(前身為大疆車載)此次發布的模型架構採用了基於Transformer的端到端決策路徑,顯著降低了傳統模組化自動駕駛系統中的延遲與資訊損耗。
- •該模型在訓練階段引入了「動作令牌(Action Tokenization)」技術,將連續的控制指令離散化,使得模型能夠像處理語言一樣處理車輛的轉向、油門與煞車動作。
- •卓馭科技已與多家Tier 1供應商達成戰略合作,將此多模態模型整合至現有的車載計算平台中,旨在解決跨平台硬體適配的碎片化問題。
📊 競品分析▸ Show
| 競爭對手 | 核心技術路徑 | 商業模式 | 關鍵優勢 |
|---|---|---|---|
| Tesla (FSD V13+) | 端到端神經網絡 (End-to-End) | 軟體訂閱 (FSD) | 龐大的真實路測數據庫 |
| Waymo | 模組化感知 + 預測規劃 | Robotaxi 運營 | 極高的安全性與運營成熟度 |
| 華為 (ADS 3.0) | GOD感知 + PDP規劃 | 軟硬體整合銷售 | 國內領先的落地規模與體驗 |
🛠️ 技術深入
- 模型架構:採用原生多模態Transformer架構,直接將視覺感測器數據與車輛CAN總線數據進行聯合編碼,跳過傳統的感知-決策中間層。
- 數據處理:利用自監督學習(Self-Supervised Learning)處理40%的網際網路第一人稱影片,透過預測下一幀動作來強化模型的物理世界理解能力。
- 動作令牌化:將車輛控制指令映射為離散的Token序列,實現了決策輸出的可解釋性與可控性。
- 零樣本能力:在未經特定場景微調的情況下,模型能處理約70%的長尾邊緣案例(Edge Cases),主要得益於大規模多樣化數據集的預訓練。
🔮 前景展望AI analysis grounded in cited sources
自動駕駛軟體授權將成為卓馭的主要營收支柱
透過SDK分發與動作令牌模式,公司成功將商業模式從依賴硬體出貨轉向高毛利的軟體服務與雲端訂閱。
物理AI模型將加速Robotaxi在複雜城市環境的部署
原生多模態模型對物理規律的理解能力,能有效提升車輛在無保護左轉、施工路段等複雜場景下的決策準確度。
⏳ 時間線
2023-04
大疆車載業務獨立,正式啟用「卓馭科技」品牌名稱。
2024-01
卓馭科技宣布全面轉向端到端自動駕駛技術研發。
2025-09
完成首個基於VLA 1.0架構的城市領航輔助駕駛系統大規模量產交付。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪 ↗