💰钛媒体•較早收集於 12m
大模型通過考試,卻離 AGI 越來越遠

💡了解為何當前的大模型基準測試無法預測 AGI 進展,以及如何更有效地評估模型。
⚡ 30-Second TL;DR
有什麼變化
標準化考試分數與 AGI 推理能力並無直接關聯
為什麼重要
這凸顯了開發更穩健、非考試導向的 AI 模型評估框架的迫切需求。開發者在評估模型可靠性時,應超越排行榜分數。
下一步行動
建立自定義的私有評估數據集,針對未見過的領域特定問題進行推理測試,而非依賴公開基準測試。
誰應關注:Researchers & Academics
關鍵要點
- •標準化考試分數與 AGI 推理能力並無直接關聯
- •當前的評估基準更像是 AI 的「羅夏墨跡測試」
- •模型表現與現實世界智慧之間存在顯著落差
🧠 深度解析
Web-grounded analysis with 20 cited sources.
🔑 增強重點摘要
- •許多現有基準測試(例如GSM8K)可能因模型「記憶」了答案而非真正推理而存在缺陷;研究顯示,即使是微小的符號或語句順序變更,都可能導致模型準確率大幅下降,揭示其對表面模式的依賴性。
- •新的AGI評估基準正朝向更注重效率、跨領域推理及真實世界適用性的方向發展,例如ARC-AGI-2測試引入了嚴格的算力成本限制(每題0.42美元),並要求模型在有限資源下快速掌握新技能。
- •大型語言模型(LLM)常被比喻為「缸中之腦」,因其主要透過大量文本訓練,缺乏與真實世界的「符號落地」連結,導致在常識、物理直覺和因果推理等方面的結構性局限。
- •通用人工智慧(AGI)的定義本身仍高度爭議且缺乏統一標準,專家們對其能力範圍、實現路徑及評估方式存在多種觀點,促使DeepMind等機構提出分級框架以提供更實用的評估語言。
🛠️ 技術深入
- 基準測試的局限性:
- 模型可能僅是「記憶」了答案,而非真正具備推理能力,例如在GSM8K測試中,更換不影響難度的符號或語句順序會導致模型準確率下降。
- 大模型在理解能力上存在短板,例如現有最強模型在讀取簡單模擬時鐘時準確率僅39%,讀取日期時僅23%。
- 大模型的推理能力可能更多來自於大量文本的相關性,而非對邏輯關係的真正理解;一旦將自然語言替換為符號,其在歸納、演繹、溯因任務上的表現會驟降。
- 冗長的推理過程不必然帶來更好的結果,反而可能浪費運算資源,且實驗證明更長的答案不一定有更高的準確度。
- 缺乏真實世界連結:
- 大模型被認為是「缸中之腦」,缺乏與真實世界的互動,無法實現從「詞語」到「世界」的聯結,導致其在常識、物理直覺和因果推理方面存在局限。
- 新興評估方法與技術方向:
- ARC-AGI:旨在避免模型依賴網路知識,透過圖形化智力測驗題和輸入/輸出範例來評估真正的推理能力。
- ARC-AGI-2:引入「效率」指標,強調在有限算力成本(每題0.42美元)下快速掌握新技能的能力,推動小參數模型和新型訓練範式的發展。
- FrontierScience (OpenAI):評估AI在物理、化學及生物學領域的專家級科學推理能力,包含奧林匹克風格和貼近現實研究的任務,並評估中間推理步驟。
- 「圖靈-AGI測試」(吳恩達):專為AGI設計,著重於AI在具備經濟效益的實際工作(如客服)中的表現,可能涉及多日任務和上網工具的使用。
- 「知行合一」認知架構:朱松純團隊提出AGI應具備「知行合一」的機制,透過與真實世界的交互、主動探索和試錯來獲取知識,而非被動接受。
- AI Agent:被視為克服大模型局限性的新方向,能讓AI在真實世界中落地,解決理解能力不足、幻覺和缺乏真正認知能力等問題。
🔮 前景展望AI analysis grounded in cited sources
AI評估標準將加速轉向更注重實際應用、效率和真實世界互動的綜合性測試。
現有基準測試的局限性日益凸顯,新的評估框架如ARC-AGI-2和吳恩達的「圖靈-AGI測試」正強調計算效率、跨領域推理及實際工作場景的表現。
AI模型開發將更著重於「知行合一」的認知架構,而非單純擴大模型規模。
研究指出大模型缺乏與真實世界的連結,無法進行真正的概念學習和因果推理,促使研究者探索結合物理與社會環境互動的智能體(AI Agent)方法。
對於AGI的定義和實現路徑將持續存在爭議,但業界將更傾向於分級評估和實用性指標。
AGI的定義至今仍未統一,但DeepMind等機構已提出分級框架,且投資者評估AGI成熟度也開始關注「代理人經濟」的落地進度,而非僅限於模型參數。
⏳ 時間線
1950
艾倫·圖靈提出「圖靈測試」,作為評估機器智慧的基礎概念。
1956
人工智慧在達特茅斯會議上被確立為一門學科。
1997
馬克·古布魯德首次提出「通用人工智慧」(AGI)一詞,定義為在複雜性和速度上媲美或超越人腦的AI系統。
2023-11
DeepMind發表框架,提出定義和評估AGI的六項原則及五個等級,強調能力、通用性和分級路徑。
2025-03
ARC Prize發布ARC-AGI-2新基準測試,專注於效率和抽象推理,顯示當前主流AI模型得分極低(1-1.3%)。
2026-01
吳恩達宣布計劃開發「圖靈-AGI測試」,旨在評估AI執行具有經濟價值之實際工作任務的能力。
📎 來源 (20)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 钛媒体 ↗


