
生成式AI模型世代認知發展不均
研究人員開發心理測驗框架,評估生成式AI認知輪廓與人類標準比較,顯示語言理解和工作記憶表現頂尖,但感知推理幾近失敗。AIQ基準測試追蹤六代兩家族模型,揭示不對稱進展,語言任務遠勝視覺,顯示語言偏誤。此結果顯示單靠擴展無法實現均衡AGI。
Tag: #multimodal329 results

研究人員開發心理測驗框架,評估生成式AI認知輪廓與人類標準比較,顯示語言理解和工作記憶表現頂尖,但感知推理幾近失敗。AIQ基準測試追蹤六代兩家族模型,揭示不對稱進展,語言任務遠勝視覺,顯示語言偏誤。此結果顯示單靠擴展無法實現均衡AGI。

OpenAI 推出三款全新 AI 語音模型,旨在為開發者解鎖全新語音應用類別。這些模型支援深度推理、翻譯和轉錄等進階功能。ChatGPT 創造者希望以尖端語音 AI 工具賦能開發者。

PRISM 提出一個框架,透過動態問答管道緊密結合 VLM 感知與 LLM 決策。LLM 會批判 VLM 描述、提出目標導向問題,並合成任務導向的場景理解。它在 ALFWorld 和 R2R 基準測試中自動超越最先進模型。

拉請求 #22493 在 llama.cpp 中新增 Xiaomi 的 Mimo v2.5 稀疏 MoE 模型支援。此模型總參數 310B,啟動 15B 參數,支援 1M 權重上下文,並處理文字、圖像、影片、音訊模態。具備專用 ViT 視覺與音訊編碼器及多權重預測。

字節跳動升級 Doubao-Seed-2.0-lite,為豆包家族首款全模態模型,原生統一理解影片、圖像、音訊與文字。在視覺/音訊基準達 SOTA,超越 Gemini-3.1-Pro,Agent、Coding 與 GUI 能力同步強化。現已在火山方舟上線,適合企業部署。

Apple 推出 SFI-Bench,一個基於影片的基準測試,包含超過 1700 個來自多樣自我中心室內影片掃描的問題。它評估多模態 LLM 的高階空間-功能智能,超越 VSI-Bench 等基本幾何感知。該基準填補通往真實世界代理應用之扎實智能的差距。

CVPR 2026 多模態論文重定義視覺智能:VideoAuto-R1 實現按需推理,LIVR 在潛在空間無語言視覺推理,ARC 重新定位為視覺任務。趨勢強調高效隱式推理而非恆定鏈式。評估轉向開放任務與結構化數據。

中國 AI 新創 DeepSeek 為其旗艦聊天機器人新增多模態功能,能處理圖像與影片,結合文字。該首次功能限特定用戶測試,繼 V4 模型推出與大幅降價後。使 DeepSeek 與具視覺功能的競爭對手看齊。

DeepSeek V4 發布僅5天,網頁端已進入灰度測試識圖模式,能理解圖像資訊。使用者可直接上傳截圖,讓DeepSeek分析,比自行描述問題更簡單。它甚至能讀懂CT圖。

商湯科技推出並開源 SenseNova U1,這是一款統一多模態模型。基於 NEO-unify 架構,它將理解與生成合併至單一框架。此舉推動邁向統一模型時代。