來源較早收集於 13m

全新 AI IQ 網站將頂尖 AI 模型納入人類智商量表

閱讀原文: VentureBeat
#benchmarking#llm-evaluation#model-comparison

一種引發爭議的 LLM 效能視覺化新方法,目前正引起 AI 研究社群的激烈討論。

30 秒速覽

有什麼變化

將超過 50 個頂尖大型語言模型映射到標準人類智商常態分佈曲線。

為什麼重要

該專案為企業利害關係人提供了一種簡化的視覺化工具來比較模型效能,儘管研究人員警告這可能會過度簡化 AI 智力「參差不齊」的本質。

下一步行動

造訪 aiiq.org 查看您偏好的模型排名,並評估此方法論是否符合您特定使用案例的需求。

誰應關注:Researchers & Academics

關鍵要點

  • 將超過 50 個頂尖大型語言模型映射到標準人類智商常態分佈曲線。
  • 透過四個推理維度的 12 個基準測試計算綜合智商分數。
  • 使用手動校準的難度曲線,防止因數據污染導致的分數膨脹。
  • 引發關於將複雜 AI 能力簡化為單一數字是否具備實質意義的爭論。

深度解析

背景與延伸:來自公開資料,非原文內容。引用 14 個來源。

增強重點摘要

  • AI IQ 平台由 Stacks 共同創辦人 Ryan Shea 於 2026 年 5 月 12 日/13 日推出,旨在提供比傳統排行榜更直觀的尖端 AI 模型理解方式。
  • 該平台獨特地納入了「情商 (EQ)」分數,該分數源自 EQ-Bench 3 Elo 和 Arena Elo 分數,其排名可能與單純的智商 (IQ) 排名不同。
  • AI IQ 提供互動式視覺化圖表,可追蹤尖端 AI 智商隨時間的變化,並將智慧與成本進行比較,從而提高企業技術人員對複雜 AI 市場的理解度。
  • 其方法將基準測試分為「困難、不可遊戲化」的基準(具有完整智商曲線,上限為 143-158)和「壓縮」基準(適用於較簡單/可遊戲化的測試,上限為 128-140),專門用於減輕數據污染導致的分數膨脹。
  • 該平台評估模型在抽象推理、數學推理、程式設計推理和學術推理這四個認知維度上的表現,並使用 ARC-AGI、FrontierMath、ProofBench、Terminal-Bench 2.0、SWE-bench、人類最後的考試 (Humanity's Last Exam)、CritPt 和 GPQA Diamond 等特定基準。

競品分析

主要目標
AI IQ
將頂尖 LLM 映射到人類智商常態分佈曲線,提供 IQ/EQ 評分
Tracking AI
透過 Mensa Norway IQ 測試評估 AI 模型智商,追蹤聊天機器人偏差
Artificial Analysis Intelligence Index
綜合評估語言模型在推理、知識、數學和程式設計方面的能力
評估指標
AI IQ
綜合智商 (IQ) 和情商 (EQ) 分數
Tracking AI
Mensa Norway IQ 測試分數
Artificial Analysis Intelligence Index
綜合語言模型智慧指數
評估維度
AI IQ
抽象推理、數學推理、程式設計推理、學術推理 (共 4 個維度,12 個基準測試)
Tracking AI
智商 (IQ)
Artificial Analysis Intelligence Index
推理、知識、數學、程式設計、指令遵循、長上下文推理、代理工作流程、知識與幻覺、物理推理、真實世界知識工作
數據污染防範
AI IQ
手動校準難度曲線,對較易或可遊戲化的基準設定壓縮上限
Tracking AI
提及使用離線測試以避免污染
Artificial Analysis Intelligence Index
未明確說明,但強調公平性和實際適用性
視覺化/洞察
AI IQ
智商鐘形曲線、智商隨時間變化、智商與情商比較、智慧與成本圖表
Tracking AI
提供 AI 模型在 Mensa Norway IQ 測試上的排名和分數
Artificial Analysis Intelligence Index
提供語言模型綜合智慧的有用合成,用於比較
定價
AI IQ
null
Tracking AI
null
Artificial Analysis Intelligence Index
null

技術深入

  • 評分系統:AI IQ 透過評估模型在四個認知維度上的表現來分配估計的智商分數。每個維度都由多個基準測試衡量,並將缺失的基準和維度保守地歸因於評分流程中。導出的綜合智商是所有四個維度分數的平均值。
  • 基準測試類型
    • 困難、不可遊戲化的基準:這些是能區分前沿模型的測試,遊戲化程度低,保留完整的智商曲線,上限為 143-158(例如 ARC-AGI-2、ProofBench、人類最後的考試、CritPt)。
    • 壓縮基準:這些是較簡單或較易遊戲化的測試,其錨定曲線被壓縮到較低的上限(128-140),以限制高分在綜合智商中造成的膨脹(例如 ARC-AGI-1、AIME、SWE-bench、GPQA Diamond)。
  • 智商映射:每個原始基準分數透過「手動校準的難度曲線」和分段線性插值映射到一個隱含的智商。
  • 情商 (EQ) 分數計算:將 EQ-Bench 3 Elo 分數和 Arena Elo 分數映射到估計的情商,使用校準的分段線性尺度,然後取兩者的 50/50 加權綜合分數。
  • 數據污染緩解:透過手動校準難度曲線和壓縮可遊戲化基準的上限來防止分數膨脹。
  • 四個認知維度及其基準
    • 抽象推理:ARC-AGI-2 (上限 143),ARC-AGI-1 (壓縮 135)。
    • 數學推理:FrontierMath T4 (上限 155),FrontierMath T1–3 (上限 152),AIME (壓縮 135),ProofBench (上限 158)。
    • 程式設計推理:Terminal-Bench 2.0 (上限 150),SWE-bench (壓縮 128),SciCode (壓縮 140)。
    • 學術推理:人類最後的考試 (Humanity's Last Exam) (上限 158),CritPt (上限 155),GPQA Diamond (壓縮 135)。

前景展望基於引用來源的 AI 分析

儘管存在爭議,但將類人智商/情商指標應用於 AI 將變得更加普遍。
AI IQ 直觀的視覺化和情商的納入滿足了市場對更簡單、更具相關性指標的需求,從而推動了企業技術人員的採用。
關於將人類智慧指標應用於 AI 的有效性和局限性的爭論將會加劇。
研究人員和評論員已經明確表示批評,警告將 AI「鋸齒狀」的能力簡化為單一數字會產生危險的精確錯覺,這種根本性的哲學差異將持續存在。
AI 評估方法將繼續發展,更加注重穩健、抗污染的基準測試。
AI IQ 的手動校準和壓縮上限直接解決了數據污染和分數膨脹的問題,這是當前 AI 基準測試中的一個關鍵挑戰。

時間線

2026-05-12
Ryan Shea 宣布推出 AI IQ 平台,旨在以人類智商量表評估尖端 AI 模型。
2026-05-13
VentureBeat 報導 AI IQ 平台推出,強調其互動式視覺化功能及其引發的爭議。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。