🐯虎嗅•較早收集於 6m
DeepMind 前核心科學家 Andrew Dai 創立 Elorian AI

💡Google AI 核心科學家離職,獲 Nvidia 支持,致力於開發次世代多模態視覺推理模型。
⚡ 30-Second TL;DR
有什麼變化
Andrew Dai 在 Google 工作 14 年,曾參與 Google Brain 與 DeepMind 的多項關鍵專案。
為什麼重要
此舉標誌著 AI 研究正轉向專注於視覺推理模型,可能挑戰當前以 LLM 為中心的 SOTA 發展路徑。
下一步行動
密切關注 Elorian AI 即將發布的研究成果,以了解他們將視覺推理與語言模型整合的技術路徑。
誰應關注:Researchers & Academics
關鍵要點
- •Andrew Dai 在 Google 工作 14 年,曾參與 Google Brain 與 DeepMind 的多項關鍵專案。
- •Elorian AI 獲得 Menlo Ventures 與 Nvidia 投資,估值達 3 億美元,融資 5500 萬美元。
- •公司專注於語言與視覺推理的結合,而非單純的語言模型。
- •團隊計劃在兩年內擴張至 50 到 70 名研究人員與工程師。
🧠 深度解析
Web-grounded analysis with 22 cited sources.
🔑 增強重點摘要
- •Andrew Dai 於 2015 年共同撰寫了一篇關於語言模型預訓練和監督式微調的論文,該論文為後來的 GPT 系列模型奠定了基礎,顯示其在大型語言模型領域的早期開創性貢獻。
- •Elorian AI 的種子輪融資總額為 5500 萬美元,估值達 3 億美元,投資方除了 Menlo Ventures 和 Nvidia 外,還包括 Altimeter Capital、Striker Venture Partners 以及知名 AI 研究員 Jeff Dean,且融資分兩批進行,第二批的估值更高。
- •Elorian AI 的核心理念是超越現有視覺語言模型將視覺輸入轉換為文本再進行推理的局限性,旨在建立能直接在視覺空間中進行原生思考的模型,將 AI 的視覺推理能力從「兒童級」提升至「成人級」,並視此為通往實體世界「視覺通用人工智慧 (Visual AGI)」的關鍵路徑。
- •Andrew Dai 離開 Google 的部分原因是他希望對計算資源有更大的控制權,並認為 Google 內部官僚體制和資源競爭阻礙了先進 AI 研究的進展,這促使他選擇創立新公司以追求更大的創新自由。
- •Elorian AI 計劃在脫離隱身模式(2026 年 4 月)後的約 12 個月內發布其首個公開推理模型,並正在與潛在客戶進行洽談。
📊 競品分析▸ Show
| 公司/模型 | 主要特點 | 視覺推理基準 (MMMU Pro) | 應用領域 |
|---|---|---|---|
| Elorian AI | 專注於原生多模態視覺推理,直接理解物理世界,而非轉換為文本。旨在實現「視覺 AGI」。 | 尚未發布公開基準 | 機器人、自動駕駛、建築、汽車、工業檢測、災害管理、工程、農業 |
| Google DeepMind (Gemini 系列) | 先進的視覺語言推理,支援多輪對話,處理文件和圖像輸入。Gemini 3 Flash 和 Gemini 3.1 Pro Preview 在視覺任務上表現領先。 | Gemini 3 Flash: 79% (MMMU Pro);Gemini 3.1 Pro Preview: 領先 (MMMU Pro) | 企業級會議與研究助理、視覺分析儀表板、課堂 AI 導師、程式碼與設計配對程式設計工具、法律研究 |
| OpenAI (GPT-4o, GPT-5.2) | 整合文本、圖像、音訊和視訊感知,支援即時語音對話,能解釋圖像和文件。GPT-5.2 在視覺推理方面表現強勁。 | GPT-5.2: 75% (MMMU Pro) | 客戶支援、視覺故障排除、無障礙工具、AI 伴侶、語言學習 |
| Anthropic (Claude 3.7, Opus/Sonnet) | 以安全為中心的設計,強調憲法式 AI 原則和對齊訓練。在文件提取和財務報告分析方面表現出色,對危險醫療建議有內置拒絕機制。 | Claude Opus 4.5: 74% (MMMU Pro) | 企業級應用、醫療保健、法律研究、內容審核 |
| xAI (Grok-4 Multimodal) | 整合特斯拉級視覺學習能力,處理即時感測器數據。內嵌於 X 平台,支援即時多模態互動。 | 尚未發布公開基準 | 市場情緒追蹤、突發新聞監控、自動駕駛 |
| Reka AI | 專注於多模態和效率,為物理世界而建。提供視訊、圖像、音訊和文本的原生理解。 | 尚未發布公開基準 | 視訊搜尋、圖像字幕、物件偵測、嵌入、問答 |
🛠️ 技術深入
- Elorian AI 旨在構建原生的多模態模型,能夠同時處理文本、圖像、視訊和音訊,並以統一的方式進行跨模態推理。
- 該公司的方法是透過底層技術的顛覆性創新,深度整合視覺推理,而非依賴將視覺輸入轉換為文本進行推理的傳統模式。
- 他們高度重視數據品質、數據混合比例、數據來源和數據多樣性,並大規模且深入地使用合成數據來重建視覺空間中的推理鏈路。
- Elorian AI 正在內部構建其完整的技術棧,涵蓋從數據、模型架構、強化學習演算法到視覺編碼器等所有環節。
- 模型的目標是超越簡單的圖像識別和語義標籤,理解物體之間的邏輯和物理關係,並進行複雜的多步驟問題解決。
- 該公司正在基於開源模型開發其早期 AI 產品,並考慮向開源社區發布較小版本的模型,但其旗艦版本可能保持專有。
- Andrew Dai 在 Google 期間曾共同主導 GLaM (Mixture of Experts, MoE) 大型語言模型,並負責 Gemini 的數據預訓練工作,這暗示 Elorian AI 可能會借鑒 MoE 架構和先進的數據策略。
🔮 前景展望AI analysis grounded in cited sources
Elorian AI 將加速實體世界 AI 應用發展。
其專注於原生視覺推理模型,能更深入理解物理世界,對機器人、自動駕駛、工業檢測等領域至關重要。
傳統大型語言模型在視覺推理領域的局限性將更加凸顯。
Elorian AI 的成立及其對「視覺 AGI」的追求,突顯了純語言模型在處理複雜視覺任務時,因需將視覺轉化為文本而導致的根本性不足。
AI 人才與計算資源的競爭將持續加劇,並促使更多頂尖研究者創立新創公司。
Andrew Dai 離開 Google 部分原因是對計算資源控制權和官僚體制的考量,這反映了大型科技公司內部可能存在的資源分配問題,鼓勵了外部創新。
⏳ 時間線
2012
Andrew Dai 加入 Google 擔任首席研究科學家兼總監。
2015
Andrew Dai 與 Quoc V. Le 共同發表關於語言模型預訓練與監督式微調的論文,為 GPT 系列模型奠定基礎。
2021
Andrew Dai 共同主導開發 GLaM (Mixture of Experts LLM),其性能超越當時的 GPT-3。
2023
Andrew Dai 擔任 PaLM 2 預訓練負責人及 Gemini 數據領域共同負責人。
2025
Elorian AI 成立。
2026-01
Elorian AI 首次被報導正在籌集 5000 萬美元種子輪資金。
2026-01-30
Elorian AI 完成 5500 萬美元種子輪融資,估值達 3 億美元。
2026-04-09
Elorian AI 正式脫離隱身模式 (emerges from stealth)。
📎 來源 (22)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗


