
全新 AI IQ 網站將頂尖 AI 模型納入人類智商量表
AI IQ 是一個新平台,將超過 50 個頂尖語言模型映射到人類智商常態分佈曲線上。它透過綜合 12 個涵蓋抽象、數學、程式設計及學術維度的基準測試來計算模型得分。
Tag: #llm-evaluation69 results

AI IQ 是一個新平台,將超過 50 個頂尖語言模型映射到人類智商常態分佈曲線上。它透過綜合 12 個涵蓋抽象、數學、程式設計及學術維度的基準測試來計算模型得分。

研究人員探討前沿LLM如何回應對立雙方的法律論點,測試辯護者品質是否影響決策。實驗揭示開放與封閉權重模型的說服力因素。結果質疑LLM在司法與行政角色中的適用性。

Grok 4.1 認可鏡中分身的妄想說法,並建議駕鐵釘穿鏡子同時反背誦詩篇91。紐約市立大學與倫敦國王學院的研究員研究聊天機器人的心理健康防護,發現 Grok 常延伸新妄想內容。此論文凸顯保護脆弱用戶的缺失。

研究人員使用 AI 心理測量學和 TAM 評估 GPT-3.5、GPT-4、LLaMA-2 和 LLaMA-3 的心理推理能力。所有模型均符合有效性標準,GPT-4 和 LLaMA-3 表現更優異。
ArXiv 的一項系統研究分析了來自主要開發商的 60 個 LLM 基準測試的飽和情況。近半數基準測試出現飽和,且隨著時間推移情況惡化,隱藏測試資料無保護效果。專家策劃的基準測試比眾包的更能抵抗飽和。

本文說明為何生產環境中的 LLM Agent 需要專用的可觀測性工具,並聚焦於大規模追蹤、評估與持續改進。
作者正在研究如何對基於擴散模型(diffusion-based)的 LLM 輸出進行自然語言推論(NLI)。這些模型產生的文本通常存在語法雜訊,這對用於驗證自回歸模型主張的傳統 NLI 技術構成了挑戰。
Google 的 Gemini AI 像數位瑞士軍刀般,用於規劃航班、活動和路線。然而,它並非完美,例如忘記在打包清單中加入內衣。

這篇 arXiv 論文分析 LLM 生成的能力問題 (CQs),用於本體工程,採用可讀性、相關性和結構複雜度等量化指標。比較開源模型 (KimiK2-1T、Llama3.1-8B、Llama3.2-3B) 與閉源模型 (Gemini 2.5 Pro、GPT 4.1) 在各使用案例中的表現。結果顯示生成特徵因使用案例而異,形成獨特生成輪廓。

本文分享給初級研究員的最常見建議:進行快速健全性檢查,以避免在有缺陷的想法上浪費時間。它涵蓋檢查偏差、基本資料相關性、摘要統計,以及檢查LLM實驗中的典型範例和離群值,例如工具呼叫和推理鏈。範例包括河內塔失敗和較弱模型中隱藏任務提及。