🌍The Next Web (TNW)•最新收集於 58m
OpenAI 的 AGI 分數在官方測試框架下大幅下滑

💡99.9% 的 AGI 宣稱,在基準測試官方軟體下變成 62.7%。
⚡ 30-Second TL;DR
有什麼變化
OpenAI 以 99.9% 的基準測試分數作為宣告 AGI 時代的依據。
為什麼重要
這項差異可能削弱外界對 AGI 宣稱的信心,也讓獨立重現變得更加重要。AI 團隊或許需要將基準分數視為取決於實作方式的結果,而非衡量模型能力的普遍標準。
下一步行動
在引用該基準測試前,使用 ARC Prize 的官方 harness 重新執行 GPT-6 Astra 或同級模型,並記錄所有評測設定。
誰應關注:Researchers & Academics
關鍵要點
- •OpenAI 以 99.9% 的基準測試分數作為宣告 AGI 時代的依據。
- •使用該基準測試官方 harness 執行同一模型時,分數降至 62.7%。
- •ARC Prize 公布兩組結果,凸顯評測軟體造成的重大差異。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Next Web (TNW) ↗
每週 AI 簡報
每週一封,可隨時退訂。



