⚛️較早收集於 2h

Waymo CEO:僅靠端到端模型不足以實現 L4 自動駕駛

Waymo CEO:僅靠端到端模型不足以實現 L4 自動駕駛
PostLinkedIn
⚛️閱讀原文: 量子位

💡Waymo CEO 挑戰自動駕駛領域的「端到端」炒作,機器人與 AI 工程師必讀。

⚡ 30-Second TL;DR

有什麼變化

端到端 AI 不足以滿足 L4 安全需求

為什麼重要

這標誌著自動駕駛產業的轉向,從純粹的端到端炒作轉向結合基模與強大安全系統的混合架構。

下一步行動

評估您的自動駕駛堆疊對端到端模型的依賴程度,並考慮實施結合模組化安全層的混合架構。

誰應關注:Researchers & Academics

關鍵要點

  • 端到端 AI 不足以滿足 L4 安全需求
  • 專注於車載雲端基模蒸餾技術
  • 利用語言對齊世界模型以提升環境理解能力

🧠 深度解析

Web-grounded analysis with 16 cited sources.

🔑 增強重點摘要

  • Waymo 的自動駕駛系統採用「快思慢想」(Think Fast and Think Slow)架構,包含感測器融合編碼器(Sensor Fusion Encoder)負責快速反應,以及駕駛視覺語言模型(Driving VLM)處理複雜的語義推理,後者利用 Google Gemini 的廣泛世界知識來理解罕見和複雜的道路情境。
  • Waymo 的「雲端基模蒸餾技術」涉及將大型的「教師模型」(Waymo Foundation Model)精煉成更小、更高效的「學生模型」,以便在車載系統上進行即時決策,並在雲端進行大規模模擬和評估,從而克服大型模型在車載運算資源上的限制。
  • Waymo 的「語言對齊世界模型」是其 Waymo 世界模型(Waymo World Model)的一部分,該模型基於 Google DeepMind 的 Genie 3,能夠生成超現實的 3D 模擬環境,並允許工程師透過自然語言提示來修改模擬情境,以測試極端天氣、逆向行駛或不尋常障礙物等罕見事件。
  • Waymo 採用整合式 AI 方法,將其基礎模型(Foundation Model)應用於駕駛、模擬器和評估器(Critic)三個核心環節,形成持續學習的「飛輪效應」,以加速系統改進並確保可驗證的安全性。
  • Waymo 的前執行長 John Krafcik 強調,實現 L4 級自動駕駛需要「超人類視覺」(Superhuman Vision),即整合攝影機、光達和雷達等多種感測器,並對僅依賴攝影機的方案(如 Tesla)持懷疑態度,認為缺乏光達會導致「嚴重的近視」。
📊 競品分析▸ Show

Waymo 及其主要競爭對手在 L4 自動駕駛技術和商業模式上存在顯著差異:

公司/產品自動化等級AI 方法/架構感測器套件商業模式/部署主要特點
WaymoL4混合式(模組化 + 端到端元素),Waymo Foundation Model,雲端基模蒸餾,語言對齊世界模型攝影機、光達、雷達、高精地圖商業化 Robotaxi 服務(鳳凰城、舊金山、洛杉磯等)強調可驗證的安全性,透過模擬測試罕見情境,混合式方法兼顧靈活性與可解釋性
Tesla FSDL2/3端到端(Vision-only),基於 Transformer 的架構主要為攝影機(Vision-only),近期部分車型恢復雷達消費者車輛的輔助駕駛功能,透過大量用戶數據進行訓練不依賴高精地圖,數據收集規模龐大,但仍需人類監督
CruiseL4針對城市駕駛優化的 AI 模型光達、雷達、攝影機商業化 Robotaxi 服務(舊金山等),曾因事故暫停服務專注於複雜城市環境,與通用汽車合作
ZooxL4專為自動駕駛設計的 AI光達、雷達、攝影機目的建造的自動駕駛電動接駁車,無方向盤/踏板,亞馬遜旗下強調從零開始設計的自動駕駛體驗,針對城市叫車服務
WayveL4 (開發中)端到端,基於 Transformer 的基礎模型攝影機為主,可能包含其他感測器專注於開發通用型自動駕駛基礎模型強調單一模型處理整個駕駛任務,易於適應新城市和駕駛條件

備註:Waymo 認為純粹的端到端模型不足以滿足 L4 的安全需求,並採用了結合模組化和端到端優勢的混合方法。

🛠️ 技術深入

  • Waymo Foundation Model (Waymo 基礎模型):這是一個多功能的世界模型,結合了純粹端到端和模組化方法的優勢。它利用學習到的嵌入作為模型組件之間的豐富介面,並在訓練期間支援完整的端到端訊號反向傳播。同時,它也包含緊湊、具體化的結構化表示(如物體、語義屬性和道路圖元素),以便在駕駛過程中進行強大的正確性和安全驗證。
  • 「快思慢想」架構 (Think Fast and Think Slow Architecture):Waymo 基礎模型採用雙組件架構:
    • 感測器融合編碼器 (Sensor Fusion Encoder):這是基礎模型的感知組件,用於快速反應。它融合了攝影機、光達和雷達的時序輸入,生成物體、語義和豐富的嵌入,供下游任務使用,以實現快速安全的駕駛決策。
    • 駕駛視覺語言模型 (Driving VLM):此組件用於複雜的語義推理。它使用豐富的攝影機數據,並根據 Waymo 的駕駛數據和任務進行微調。透過利用 Google Gemini 的廣泛世界知識,它能更好地理解道路上罕見、新穎和複雜的語義情境。
  • 雲端基模蒸餾 (Cloud-based Schema Distillation):Waymo 訓練大型、高品質的「教師模型」(Waymo Foundation Model),這些模型在特定任務中表現出色。由於這些教師模型過於龐大,無法在車輛上進行即時決策或在雲端模擬數億英里,因此 Waymo 將其安全地蒸餾成更小、更高效的「學生模型」。蒸餾技術確保了小型模型能保留大型模型的卓越性能。
  • Waymo 世界模型 (Waymo World Model):這是一個前沿的生成模型,用於大規模、超現實的自動駕駛模擬。它基於 Google DeepMind 的 Genie 3,能夠生成高擬真度、多感測器輸出(包括攝影機和光達數據)的 3D 環境。該模型提供強大的模擬可控性,工程師可以透過駕駛動作控制、場景佈局控制和語言控制(例如,使用自然語言提示調整天氣條件或生成完全合成的場景)來修改模擬。
  • EMMA (End-to-End Multimodal Model for Autonomous Driving):Waymo 曾發表過 EMMA,這是一個基於多模態大型語言模型的端到端模型,可將原始攝影機感測器數據直接映射到各種駕駛特定輸出(如規劃軌跡、感知物體和道路圖元素)。EMMA 透過將所有非感測器輸入和輸出表示為自然語言文本,最大化了預訓練大型語言模型的知識效用。然而,EMMA 存在局限性,例如只能處理少量圖像幀、未整合光達或雷達等精確 3D 感測模態,且運算成本高昂,因此 Waymo 認為純粹的端到端模型不足以滿足 L4 的安全和性能需求。

🔮 前景展望AI analysis grounded in cited sources

Waymo 的混合式 AI 架構將成為 L4+ 自動駕駛發展的主流。
這種結合模組化和端到端優勢的方法,既能利用大型模型的學習能力,又能解決純端到端模型在安全性和可解釋性方面的挑戰。
生成式 AI 驅動的模擬技術將大幅加速自動駕駛系統的開發與安全驗證。
Waymo 世界模型能夠生成和測試現實世界中難以大規模收集的罕見及複雜「長尾」情境,從而顯著提升系統的穩健性。
Waymo 對多感測器融合(光達、雷達、攝影機)的堅持將繼續成為其 L4 安全優勢的關鍵差異化因素。
Waymo 前執行長明確指出 L4 需要「超人類視覺」,並對僅依賴攝影機的系統持懷疑態度,強調光達對安全的重要性。

時間線

2009-01
Google 無人駕駛汽車專案啟動
2015
首次在公共道路上進行完全自動駕駛(無人操作)的載客測試
2016-12
Google 無人駕駛汽車專案更名為 Waymo,成為 Alphabet 旗下獨立子公司
2017-11
Waymo 在亞利桑那州錢德勒市的公共道路上開始測試無安全駕駛員的完全自動駕駛車輛
2018-12
Waymo One 商業叫車服務在鳳凰城推出
2026-02
Waymo 推出基於 Google DeepMind Genie 3 的 Waymo 世界模型,用於超現實模擬
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位