
DeepSeek 視覺原語框架突破多模態空間瓶頸
DeepSeek 在 GitHub 發布多模態大模型技術報告,提出「基於視覺原語的思考」框架,將點、邊界框等轉為推理基本單位,解決空間参照瓶頸。克服語言模糊性於複雜布局,实现精準空間推演。緊湊模型在計數及空間基準上匹敵 GPT-4o、Claude-Sonnet、Gemini。
Tag: #multimodal-llm14 results

DeepSeek 在 GitHub 發布多模態大模型技術報告,提出「基於視覺原語的思考」框架,將點、邊界框等轉為推理基本單位,解決空間参照瓶頸。克服語言模糊性於複雜布局,实现精準空間推演。緊湊模型在計數及空間基準上匹敵 GPT-4o、Claude-Sonnet、Gemini。

DeepMind哈薩比斯憑AlphaFold蛋白質預測獲2024諾貝爾化學獎。2025年11月Gemini 3領先多模態排行;2026年1月AlphaGenome以90%準確率建模98%基因組。預測2030年前AGI機率50%,需具假設能力。
萬億參數國產多模態大模型開源發布,成為企業級 OpenClaw 最強拍檔。這標誌中國 AI 多模態技術重大躍進。可立即整合使用。

DeepSeek識圖模式進入灰度釋出,一手實測顯示疑似全新模型。非思考模式速度極快。用戶透過Beta內測獲得存取。

華為發布鴻蒙座艙 HarmonySpace 6,首發全場景聊天型 AI 助理「小藝智能體」,支援邊聊邊控車、導航與服務。升級 AMS 多模態感知系統偵測生命徵象與安全,MoLA 2.0 融合千億參數多模態大模型與 Agent 平台。新硬體含雙 17.2 吋螢幕、百萬像素車燈與雷射投影,提升娛樂體驗。

新一代小米 SU7 交付即搭載 Xiaomi XLA 認知大模型,提供先進輔助駕駛,配備 700TOPS Thor 晶片及多種感測器等頂級硬體。XLA 實現多模態融合,包括語音控制行車與泊車。將為初代 SU7 Pro/Max/Ultra 及 YU7 全系推送 OTA 升級。
3月24日,中國首個具身智能工程機器人行業標準編制在成都啟動。旨在填補評價、安全及規模化空白。成都人形機器人創新中心發布全球首個具身智能工程機器人多模態大模型。

RideJudge 提出漸進式框架,將視覺與邏輯推理對齊,用於網約車糾紛裁決,解決多模態 LLM 的限制。主要創新包括 SynTraj 軌跡合成、適應性上下文優化及序數敏感強化學習。8B 模型達 88.41% 準確率,超越 32B 基準。

中國 AI 初創階躍星辰(StepFun)據傳計劃赴港 IPO,募資約 5 億美元,繼智譜 AI 與 MiniMax 之後。公司押注「AI+終端」策略,多模態模型已與 OPPO、榮耀手機及吉利汽車合作。最近 B+ 輪融資超 50 億元人民幣。
PlotChain 推出一個確定性基準,用於評估多模態 LLM 從工程圖表(如 Bode 和 FFT)中提取定量值。它包含 15 個家族的 450 個圖表,配備地面真相和檢查點診斷以分析失敗。頂級模型得分約 80%(Gemini 2.5 Pro 領先),但頻域任務仍薄弱。