
AI 驅動的火星車自主導航技術
NASA 已成功將 Anthropic 的 Claude VLM 整合至「毅力號」火星車的路徑規劃流程中。這種從「人工規劃、機器執行」轉向「AI 規劃、自主決策」的模式,標誌著深空探測效率的典範轉移。
Tag: #vlm20 results

NASA 已成功將 Anthropic 的 Claude VLM 整合至「毅力號」火星車的路徑規劃流程中。這種從「人工規劃、機器執行」轉向「AI 規劃、自主決策」的模式,標誌著深空探測效率的典範轉移。

LLMForge 是一個透過自然語言生成機械 CAD 設計的新框架,利用迭代優化與多模型評估技術。該研究針對 97 項工程任務對七種基礎模型進行了基準測試,突顯了基於 VLM 視覺評論的有效性。

CaVe-VLM-CoT 是一個新型代理式 RAG 框架,旨在透過五階段閉環驗證流程減少視覺語言模型的幻覺。該研究引入了 CaVeScore,這是一套用於評估檢索品質、引用忠實度及跨模態基礎性的綜合指標。
PixelRAG 是一項基於研究的新系統,它將網頁視為截圖而非解析為純文字。這種方法保留了視覺上下文與排版,相較於傳統基於文字的 RAG 流程,顯著降低了檢索錯誤。

這項研究引入了一種強化學習框架,透過解耦感知與推理步驟,解決了視覺語言模型(VLM)中的「蹺蹺板效應」。利用感知驗證與結構化口頭驗證,模型能精確地將錯誤歸因於視覺感知或邏輯推理。
麥肯錫《2026 中國汽車消費者洞察》報告指出,產業應超越僵化的 L3/L4 自動駕駛分級。企業應轉而專注於透過 VLM 與 AI 驅動的創新,為用戶提供實質價值。

REVELIO 是一個旨在系統性識別視覺語言模型 (VLM) 可解釋失效模式的新框架。透過結合多樣性感知束搜尋與高斯過程湯普森採樣,該框架能找出模型在特定場景(如自動駕駛或機器人技術)中持續失敗的具體原因。

Google DeepMind 發表機器人專用視覺語言模型「Gemini Robotics-ER 1.6」,針對產業現場優化。具備優秀空間辨識與儀表讀取能力。並與 Boston Dynamics 合作強化功能。

IBM 推出 Granite-4.0-3B-Vision,一款小型 VLM,用於企業文件提取,包括圖表轉 CSV/程式碼、複雜表格轉 JSON/HTML,以及語義 KVP。作為 Granite 4.0 Micro 的 LoRA 提供,支援文字/視覺雙用;與前版相容。

ELITE透過互動經驗學習,彌補VLMs靜態知識與具身任務的差距。它利用自我反思知識建構來建立可重用策略,並透過意圖感知檢索進行任務適應。在無監督設定下,在EB-ALFRED和EB-Habitat基準上提升9%和5%。