
何凱明流匹配多角度突破
何凱明團隊發表多篇CVPR論文,推進流匹配超越擴散模型,Improved MeanFlow單步FID達1.72,JiT在ImageNet上達1.78。JiT直接預測乾淨圖像,使用大patch ViT無需VAE。VARC無語言達人類級ARC視覺推理。
Tag: #visual-reasoning12 results

何凱明團隊發表多篇CVPR論文,推進流匹配超越擴散模型,Improved MeanFlow單步FID達1.72,JiT在ImageNet上達1.78。JiT直接預測乾淨圖像,使用大patch ViT無需VAE。VARC無語言達人類級ARC視覺推理。

本文針對 Claude 最新模型 Fable 5 進行實測。報導指出該模型在視覺推理能力上有顯著提升,特別是能準確識別圖像中的手指數量。

曾參與 Google Gemini 與 PaLM 開發的核心科學家 Andrew Dai 離開 Google 並創立 Elorian AI。該新創公司專注於多模態視覺推理模型,旨在超越純語言模型架構。

CVPR 2026 多模態論文重定義視覺智能:VideoAuto-R1 實現按需推理,LIVR 在潛在空間無語言視覺推理,ARC 重新定位為視覺任務。趨勢強調高效隱式推理而非恆定鏈式。評估轉向開放任務與結構化數據。
OpenAI 推出 ChatGPT Images 2.0,這是一款最先進的圖像生成模型。它具備改進的文字渲染、多語言支援,以及先進的視覺推理功能。

劉壯與陳丹琦發布開源通用視覺推理RL框架。該框架無需思考數據即刷新SOTA。廣泛數據是視覺推理RL擴展的主要驅動力。
Lang2Act 透過自湧現語言工具鏈提升視覺語言模型 (VLM) 在 VRAG 中的精細視覺感知,避免僵硬外部工具及影像操作造成的資訊損失。它採用兩階段 RL 框架:第一階段建構可重用動作工具箱,第二階段用於推理。性能提升超過 4%;程式碼在 GitHub 上開放。
前 Google Deepmind 研究員 Andrew Dai 創立了名為 Elorian 的 AI 新創公司。該公司目前專注於開發視覺推理能力,並正積極進行人才招募與融資計畫。

前Google DeepMind研究員Andrew Dai正推出專注視覺AI的新創公司。他批評大型實驗室AI模型在處理視覺提示時,智能僅相當於3歲孩童。

AdaReasoner, a 7B model, achieves superior performance on visual reasoning tasks like puzzles by dynamically learning tool selection, timing, and usage. It introduces 'Agentic Vision' with iterative think-act-observe loops, outperforming larger models without massive scaling. Open-source code, models, and paper available on arXiv and GitHub.