🌍最新收集於 58m

OpenAI 的 AGI 分數在官方測試框架下大幅下滑

OpenAI 的 AGI 分數在官方測試框架下大幅下滑
PostLinkedIn
🌍閱讀原文: The Next Web (TNW)
#benchmarking#evaluation-harness#agi-claimsgpt-6-astraopenaigpt-6-astraarc-prize

💡99.9% 的 AGI 宣稱,在基準測試官方軟體下變成 62.7%。

⚡ 30-Second TL;DR

有什麼變化

OpenAI 以 99.9% 的基準測試分數作為宣告 AGI 時代的依據。

為什麼重要

這項差異可能削弱外界對 AGI 宣稱的信心,也讓獨立重現變得更加重要。AI 團隊或許需要將基準分數視為取決於實作方式的結果,而非衡量模型能力的普遍標準。

下一步行動

在引用該基準測試前,使用 ARC Prize 的官方 harness 重新執行 GPT-6 Astra 或同級模型,並記錄所有評測設定。

誰應關注:Researchers & Academics

關鍵要點

  • OpenAI 以 99.9% 的基準測試分數作為宣告 AGI 時代的依據。
  • 使用該基準測試官方 harness 執行同一模型時,分數降至 62.7%。
  • ARC Prize 公布兩組結果,凸顯評測軟體造成的重大差異。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Next Web (TNW)

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。