🐯虎嗅•最新收集於 31m
GPT-6 Astra 真的等於 AGI 嗎?

💡99.9% 的基準分數看似等於 AGI,但執行環境與真實任務失敗揭示了另一面。
⚡ 30-Second TL;DR
有什麼變化
GPT-6 Astra 在 OpenAI 專用框架下的 ARC-AGI-3 得分據稱為 99.9%,但在標準評測框架下為 62.7%。
為什麼重要
對 AI 建構者與研究者而言,關鍵影響是必須將基準測試標題與端到端系統能力分開看待。產品團隊應評估記憶、工具使用、持續執行、錯誤復原,以及在模糊工作流程中的表現,而不應只依賴單一基準分數。
下一步行動
在宣稱具備 AGI 級能力前,請使用自有多步驟工作流程,分別測試 GPT-6 Astra 或同類模型在有無持久記憶與工具編排下的表現。
誰應關注:Researchers & Academics
關鍵要點
- •GPT-6 Astra 在 OpenAI 專用框架下的 ARC-AGI-3 得分據稱為 99.9%,但在標準評測框架下為 62.7%。
- •其表現差異很大:FrontierMath Tier 4 為 97.6%、OSWorld 2.0 為 72.6%、AutomationBench 為 41.4%,Agents' Last Exam 為 59.3%。
- •OpenAI 以自主完成大多數具經濟價值工作來定義 AGI;Anthropic 與 Google DeepMind 則採用更廣泛的能力、自主性與衡量框架。
- •文章認為,AGI 宣告既是技術主張,也是會影響投資、客戶、人才與安全優先級的產品敘事。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗
每週 AI 簡報
每週一封,可隨時退訂。



