🔥較早收集於 9m

理想汽車發布下一代自動駕駛基礎模型MindVLA-o1

理想汽車發布下一代自動駕駛基礎模型MindVLA-o1
PostLinkedIn
🔥閱讀原文: 36氪
#autonomous-driving#vlamindvla-o1li-automindvla-o1

💡具閉環RL的新VLA模型革新物理AI代理。

⚡ 30-Second TL;DR

有什麼變化

下一代自動駕駛基礎模型

為什麼重要

推動具身AI在自動駕駛的進展,透過物理世界推理提升車輛安全與智能。

下一步行動

在機器人模擬中基準測試MindVLA-o1的閉環RL,以改善VLA模型。

誰應關注:Researchers & Academics

關鍵要點

  • 下一代自動駕駛基礎模型
  • 3D空間理解提升感知
  • 多模態思考與統一行為生成
  • 閉環強化學習適應真實世界
  • 軟硬體協同設計優化效能

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • MindVLA採用雙系統架構,整合端到端學習與視覺語言模型(VLM),並透過3D空間編碼器生成行動令牌,再經擴散模型優化即時駕駛軌跡。[1]
  • MindVLA於NVIDIA GTC 2025活動發布,CEO李想比喻其影響力如同iPhone 4重塑智慧手機,將車輛轉變為具認知與適應能力的全職駕駛員。[2][3]
  • MindVLA將於7月隨理想汽車首款純電動SUV Li i8上市,並支援即時語音指令如「找超市」或「減速」,無需預設導航自主探索。[1][2]
  • MindVLA自研大型語言模型基座,使用MoE混合專家架構與稀疏注意力機制,確保模型規模增長不損用戶端推理效率。[3]

🛠️ 技術深入

  • 雙系統架構:整合端到端學習與VLM,3D空間編碼器融合語言模型與邏輯推理生成行動令牌(action tokens)。[1]
  • 行動解碼:使用擴散模型(diffusion model)將行動令牌轉換為最佳駕駛軌跡,並整合其他車輛軌跡預測提升複雜交通博弈能力。[1][3]
  • 世界模型:自研統一雲端世界模型,支援3D場景重建、生成視圖補全與未見視角預測,實現大規模閉環強化學習,過去一年優化3D GS訓練速度提升逾7倍。[1]
  • 基座模型:從頭設計訓練大型語言模型,使用MoE混合專家架構與稀疏注意力(Sparse Attention)機制,維持推理效率。[3]

🔮 前景展望AI analysis grounded in cited sources

MindVLA將於2026年7月隨Li i8上市,推動理想汽車邁向L4自動駕駛
公司宣布MindVLA將搭配首款純電動SUV Li i8於7月發布,視為通往L4自動駕駛的最重要一步。[2][3]
MindVLA語音互動能力將重塑車輛為智慧代理
系統支援自然語言指令即時執行,如自主尋找超市或調整車道,賦予車輛人類般認知與適應性。[1]

時間線

2025-03
於NVIDIA GTC 2025發布MindVLA自動駕駛架構
2026-03
正式公布MindVLA-o1下一代基礎模型五大技術創新
2026-07
MindVLA隨Li i8純電動SUV上市
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。