🐯較早收集於 23m

頂尖AI ARC-AGI-3僅得不到1分,人類滿分100?

頂尖AI ARC-AGI-3僅得不到1分,人類滿分100?
PostLinkedIn
🐯閱讀原文: 虎嗅

💡揭露 GPT-5.5 與 Opus 4.7 為何在真 AGI 測試僅 <1%、人類滿分—推理研究關鍵(78字)

⚡ 30-Second TL;DR

有什麼變化

GPT-5.5 得分 0.43%,Claude Opus 4.7 得分 0.18%於 ARC-AGI-3

為什麼重要

暴露當前頂尖 LLM 在核心 AGI 推理上的限制,促使從擴展轉向新型架構研究。此類基準驗證人類智能差距,可能重定向抽象與適應研究。

下一步行動

從 GitHub 下載 ARC-AGI-3 公開資料集,並基準測試你模型的新穎推理表現。

誰應關注:Researchers & Academics

關鍵要點

  • GPT-5.5 得分 0.43%,Claude Opus 4.7 得分 0.18%於 ARC-AGI-3
  • 人類無指示首次接觸即解決 100% 任務
  • 失敗:無法從局部反饋建構全球世界模型
  • 受訓練資料偏差影響,誤將任務當成俄羅斯方塊等已知遊戲
  • Level-1 僥倖成功無法轉化為對更難關卡的理解

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • ARC-AGI-3 基準測試由 François Chollet 設計,旨在評估 AI 的「流體智力」(Fluid Intelligence)與泛化能力,而非僅僅是基於大規模數據集的模式識別。
  • 研究指出,當前大型語言模型(LLM)依賴於「系統 1」的快速直覺反應,而 ARC-AGI-3 要求具備「系統 2」的慢速邏輯推理與規劃能力,這正是目前 Transformer 架構的瓶頸。
  • 測試結果顯示,模型在面對未見過的抽象規則時,傾向於調用訓練數據中的相似模式(如 Tetris),這種「過度擬合」現象證明了模型缺乏真正的因果推理能力。

🛠️ 技術深入

  • ARC-AGI-3 測試集由 135 個高度抽象的視覺推理任務組成,每個任務要求模型在極少樣本(Few-shot)甚至零樣本(Zero-shot)條件下,從輸入輸出對中推導出轉換規則。
  • 模型失敗的核心原因在於缺乏「程序合成」(Program Synthesis)能力,即無法在運行過程中動態構建並執行邏輯程序來處理空間變換。
  • 測試環境強制要求模型具備「主動探索」機制,而現有模型多為被動的序列預測器,無法在缺乏明確指令的情況下進行假設驗證與反饋修正。

🔮 前景展望AI analysis grounded in cited sources

AI 研發重心將從擴大參數規模轉向神經符號系統(Neuro-symbolic AI)。
純 Transformer 架構在處理抽象邏輯推理上的極限已顯現,未來必須結合符號邏輯以提升泛化能力。
ARC-AGI 基準測試將成為衡量 AGI 進程的唯一標準。
由於傳統基準測試(如 MMLU)已出現數據污染,ARC-AGI 的動態性使其成為評估模型是否具備真正推理能力的關鍵指標。

時間線

2019-11
François Chollet 發布 ARC (Abstraction and Reasoning Corpus) 基準測試。
2024-06
Kaggle 舉辦 ARC 競賽,推動了基於程序合成的解決方案發展。
2026-03
ARC-AGI-3 測試集正式發布,針對 GPT-5.5 與 Claude Opus 4.7 等頂尖模型進行壓力測試。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅