🐯虎嗅•較早收集於 23m
頂尖AI ARC-AGI-3僅得不到1分,人類滿分100?

💡揭露 GPT-5.5 與 Opus 4.7 為何在真 AGI 測試僅 <1%、人類滿分—推理研究關鍵(78字)
⚡ 30-Second TL;DR
有什麼變化
GPT-5.5 得分 0.43%,Claude Opus 4.7 得分 0.18%於 ARC-AGI-3
為什麼重要
暴露當前頂尖 LLM 在核心 AGI 推理上的限制,促使從擴展轉向新型架構研究。此類基準驗證人類智能差距,可能重定向抽象與適應研究。
下一步行動
從 GitHub 下載 ARC-AGI-3 公開資料集,並基準測試你模型的新穎推理表現。
誰應關注:Researchers & Academics
關鍵要點
- •GPT-5.5 得分 0.43%,Claude Opus 4.7 得分 0.18%於 ARC-AGI-3
- •人類無指示首次接觸即解決 100% 任務
- •失敗:無法從局部反饋建構全球世界模型
- •受訓練資料偏差影響,誤將任務當成俄羅斯方塊等已知遊戲
- •Level-1 僥倖成功無法轉化為對更難關卡的理解
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •ARC-AGI-3 基準測試由 François Chollet 設計,旨在評估 AI 的「流體智力」(Fluid Intelligence)與泛化能力,而非僅僅是基於大規模數據集的模式識別。
- •研究指出,當前大型語言模型(LLM)依賴於「系統 1」的快速直覺反應,而 ARC-AGI-3 要求具備「系統 2」的慢速邏輯推理與規劃能力,這正是目前 Transformer 架構的瓶頸。
- •測試結果顯示,模型在面對未見過的抽象規則時,傾向於調用訓練數據中的相似模式(如 Tetris),這種「過度擬合」現象證明了模型缺乏真正的因果推理能力。
🛠️ 技術深入
- •ARC-AGI-3 測試集由 135 個高度抽象的視覺推理任務組成,每個任務要求模型在極少樣本(Few-shot)甚至零樣本(Zero-shot)條件下,從輸入輸出對中推導出轉換規則。
- •模型失敗的核心原因在於缺乏「程序合成」(Program Synthesis)能力,即無法在運行過程中動態構建並執行邏輯程序來處理空間變換。
- •測試環境強制要求模型具備「主動探索」機制,而現有模型多為被動的序列預測器,無法在缺乏明確指令的情況下進行假設驗證與反饋修正。
🔮 前景展望AI analysis grounded in cited sources
AI 研發重心將從擴大參數規模轉向神經符號系統(Neuro-symbolic AI)。
純 Transformer 架構在處理抽象邏輯推理上的極限已顯現,未來必須結合符號邏輯以提升泛化能力。
ARC-AGI 基準測試將成為衡量 AGI 進程的唯一標準。
由於傳統基準測試(如 MMLU)已出現數據污染,ARC-AGI 的動態性使其成為評估模型是否具備真正推理能力的關鍵指標。
⏳ 時間線
2019-11
François Chollet 發布 ARC (Abstraction and Reasoning Corpus) 基準測試。
2024-06
Kaggle 舉辦 ARC 競賽,推動了基於程序合成的解決方案發展。
2026-03
ARC-AGI-3 測試集正式發布,針對 GPT-5.5 與 Claude Opus 4.7 等頂尖模型進行壓力測試。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗



