⚛️量子位•較早收集於 82m
高德發布全球首個由大模型驅動的視覺認知步行導引系統
💡高德首個大模型驅動視覺步行導航-多模態AI應用落地(24字元)
⚡ 30-Second TL;DR
有什麼變化
全球首個大模型驅動視覺認知系統
為什麼重要
開創大模型於真實導航整合,提升AR/VR移動應用。可為消費空間AI視覺語言模型樹立標準。
下一步行動
將高德視覺導引系統整合至您的LLM基AR導航原型。
誰應關注:Developers & AI Engineers
關鍵要點
- •全球首個大模型驅動視覺認知系統
- •專為步行導引設計,具空間智能
- •強調可視、可感及實用性
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •高德地圖的視覺認知步行導引系統整合了深度學習算法,能夠實時檢測畫面中的車道線、車輛等關鍵元素,並通過手機相機方位參數建立空間理解[2]
- •該系統採用多模態融合技術,包括Embedding(數據向量化)、對齐(不同模態單位統一)、融合(模態間深度交互)和解碼四個步驟,實現視覺與空間信息的深度交互[3]
- •高德已開發基於RTK服務的高精定位解決方案「知途」,在高速及普通道路場景下定位精度可達10厘米以內,為視覺認知系統提供厘米級位置基礎[1]
- •AR步行導航利用類似雷達原理的技術,通過多角度圖像對比計算像素在現實世界的距離,結合手機CPU進行圖像識別和渲染,優化算力使用效率[2]
- •沉浸導航功能基於數字孿生和人工智能技術,將城市道路和周邊環境以三維立體模型呈現,通過動態箭頭和車道引導增強用戶體驗[5]
🛠️ 技術深入
• 多模態融合架構:採用統一Transformer架構處理所有模態Token,實現視覺、空間和語義信息的深度交互[3] • 深度學習模型:使用深度學習算法檢測車道線、車輛等環境元素,結合手機相機方位參數建立實時空間理解[2] • 高精定位基礎:整合RTK(實時動態定位)服務,實現厘米級定位精度,為視覺認知提供精確的地理參考[1] • 卡爾曼濾波融合:採用Kalman濾波實現多源數據融合,通過狀態轉移方程和觀測方程優化導航誤差估計[1] • 地圖匹配算法:在HMM框架下建立地圖匹配模型,使用正態分布、Von Mises分布和指數分布分別建立發射概率和轉移概率模型[1] • 算力優化:相比車載芯片(百萬億次/秒),手機CPU算力約十萬億次/秒,通過加速深度學習方法和代碼效率優化實現流暢體驗[2]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2019-09
高德地圖首席科學家任小楓在杭州云棲大會分享視覺智能應用進展
2020-12
高德發布導航定位向高精定位的演進技術方案,介紹HMM地圖匹配和Kalman濾波融合算法
2020-12
高德與千尋位置合作開發基於RTK服務的高精定位解決方案「知途」,精度達10厘米以內
2021-10
高德地圖發布業內首個車道級導航功能,基於高精定位技術實現亞米級精度
2025-11
阿里巴巴基於Qwen-Omni大模型發布AI眼鏡應用,展示視覺認知在導航中的應用潛力
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗
每週 AI 簡報
每週一封,可隨時退訂。