⚛️較早收集於 82m

高德發布全球首個由大模型驅動的視覺認知步行導引系統

高德發布全球首個由大模型驅動的視覺認知步行導引系統
PostLinkedIn
⚛️閱讀原文: 量子位
#llm-vision#navigation#spatial-aigaode-visual-cognitive-pedestrian-guidance-systemgaode

💡高德首個大模型驅動視覺步行導航-多模態AI應用落地(24字元)

⚡ 30-Second TL;DR

有什麼變化

全球首個大模型驅動視覺認知系統

為什麼重要

開創大模型於真實導航整合,提升AR/VR移動應用。可為消費空間AI視覺語言模型樹立標準。

下一步行動

將高德視覺導引系統整合至您的LLM基AR導航原型。

誰應關注:Developers & AI Engineers

關鍵要點

  • 全球首個大模型驅動視覺認知系統
  • 專為步行導引設計,具空間智能
  • 強調可視、可感及實用性

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • 高德地圖的視覺認知步行導引系統整合了深度學習算法,能夠實時檢測畫面中的車道線、車輛等關鍵元素,並通過手機相機方位參數建立空間理解[2]
  • 該系統採用多模態融合技術,包括Embedding(數據向量化)、對齐(不同模態單位統一)、融合(模態間深度交互)和解碼四個步驟,實現視覺與空間信息的深度交互[3]
  • 高德已開發基於RTK服務的高精定位解決方案「知途」,在高速及普通道路場景下定位精度可達10厘米以內,為視覺認知系統提供厘米級位置基礎[1]
  • AR步行導航利用類似雷達原理的技術,通過多角度圖像對比計算像素在現實世界的距離,結合手機CPU進行圖像識別和渲染,優化算力使用效率[2]
  • 沉浸導航功能基於數字孿生和人工智能技術,將城市道路和周邊環境以三維立體模型呈現,通過動態箭頭和車道引導增強用戶體驗[5]

🛠️ 技術深入

多模態融合架構:採用統一Transformer架構處理所有模態Token,實現視覺、空間和語義信息的深度交互[3]深度學習模型:使用深度學習算法檢測車道線、車輛等環境元素,結合手機相機方位參數建立實時空間理解[2]高精定位基礎:整合RTK(實時動態定位)服務,實現厘米級定位精度,為視覺認知提供精確的地理參考[1]卡爾曼濾波融合:採用Kalman濾波實現多源數據融合,通過狀態轉移方程和觀測方程優化導航誤差估計[1]地圖匹配算法:在HMM框架下建立地圖匹配模型,使用正態分布、Von Mises分布和指數分布分別建立發射概率和轉移概率模型[1]算力優化:相比車載芯片(百萬億次/秒),手機CPU算力約十萬億次/秒,通過加速深度學習方法和代碼效率優化實現流暢體驗[2]

🔮 前景展望AI analysis grounded in cited sources

視覺認知步行導引系統將推動自動駕駛環境感知能力的民用化
高德的厘米級高精定位和實時視覺識別技術原本為自動駕駛開發,現已應用於步行導航,表明該技術棧正向消費級應用轉移[1][2][6]
多模態大模型將成為導航應用的標準技術底座
高德採用統一Transformer架構融合視覺、空間和語義模態,反映行業趨勢從單一模態向多模態AI演進[3][5]
邊緣計算優化將成為移動導航應用的關鍵競爭力
在手機CPU算力限制下,通過加速深度學習和代碼優化實現高性能體驗,預示未來應用將更加依賴邊緣側算法優化[2]

時間線

2019-09
高德地圖首席科學家任小楓在杭州云棲大會分享視覺智能應用進展
2020-12
高德發布導航定位向高精定位的演進技術方案,介紹HMM地圖匹配和Kalman濾波融合算法
2020-12
高德與千尋位置合作開發基於RTK服務的高精定位解決方案「知途」,精度達10厘米以內
2021-10
高德地圖發布業內首個車道級導航功能,基於高精定位技術實現亞米級精度
2025-11
阿里巴巴基於Qwen-Omni大模型發布AI眼鏡應用,展示視覺認知在導航中的應用潛力
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。