
DeepSeek 視覺原語框架突破多模態空間瓶頸
DeepSeek 在 GitHub 發布多模態大模型技術報告,提出「基於視覺原語的思考」框架,將點、邊界框等轉為推理基本單位,解決空間参照瓶頸。克服語言模糊性於複雜布局,实现精準空間推演。緊湊模型在計數及空間基準上匹敵 GPT-4o、Claude-Sonnet、Gemini。
Tag: #spatial-reasoning10 results

DeepSeek 在 GitHub 發布多模態大模型技術報告,提出「基於視覺原語的思考」框架,將點、邊界框等轉為推理基本單位,解決空間参照瓶頸。克服語言模糊性於複雜布局,实现精準空間推演。緊湊模型在計數及空間基準上匹敵 GPT-4o、Claude-Sonnet、Gemini。
谷歌發布Gemini Robotics,其最強具身AI大腦。第三代模型專攻空間推理,讓波士頓動力學機器狗瞬間展現人模人樣行為。

MetaSpace 是一套變形測試框架,用於評估具身代理人在執行任務時是否具備穩健的空間認知能力。該框架在最先進的 MLLM 驅動代理中偵測出 90,422 個空間錯誤;這些代理的 Spatial Cognition 分數介於 0.44 至 0.52,遠低於人類的 0.96。

研究人員發現目標導向的世界模型常出現「指令洩漏」現象,模型會直接從指令中提取答案而非真正理解空間關係。透過將目標從動態預測中分離並監督讀取路徑,可恢復模型真正的感知能力。
DeepMind 發布 Gemini Robotics-ER 1.6 以驅動真實世界機器人任務。它透過強化空間推理和多視圖理解來提升具身推理。這實現了更好的自主機器人效能。
視覺語言模型在文字網格轉錄達 84% F1,但在相同方塊網格僅 29-39% F1,經相同編碼器。此差距橫跨 Claude Opus、ChatGPT 5.2、Gemini 3 Thinking,各有獨特失效。暴露依賴 OCR 而非真正空間視覺。

Spatial Atlas 引入計算基礎推理 (CGR),在語言模型生成前透過確定性計算解決子問題。它處理 FieldWorkArena 的多模態空間問答及 MLE-Bench 的機器學習競賽,使用場景圖與模型路由。在基準上實現競爭性準確率並具高度可解釋性。

NeuroHex 推出受腦部格子細胞啟發的六角座標系統,用於適應性 AI 的高效世界模型。它實現低成本空間運算,如平移、旋轉和距離計算,並具備完整的 60° 對稱性。OSM2Hex 工具處理 OpenStreetMap 資料,將幾何複雜度降低 90-99%,適用於導航任務。

華為鴻蒙智家小藝管家 6.0 接入大模型,實現 3D 空間設備控制,如「打開書櫃右邊的燈」。具備深度語義理解、悄悄話模式、雜訊辨識喚醒,以及一句話建立場景的 AI 智能體功能。已購用戶可 OTA 升級。
MLLMs excel in perception but fail mathematical spatial reasoning, scoring under 60% on tasks humans solve at 95% accuracy. MathSpatial introduces a framework with MathSpatial-Bench (2K problems), MathSpatial-Corpus (8K training data), and MathSpatial-SRT for structured reasoning. Fine-tuning Qwen2.5-VL-7B achieves strong results with 25% fewer tokens.