OpenAI 指出 SWE-Bench Pro 程式碼評測基準的可靠性問題
OpenAI 發布了一項分析,強調 SWE-Bench Pro 評測基準中的重大缺陷。該報告質疑目前用於評估 AI 程式編寫能力的評測方法之準確性與可靠性。
Tag: #model-evaluation95 results
OpenAI 發布了一項分析,強調 SWE-Bench Pro 評測基準中的重大缺陷。該報告質疑目前用於評估 AI 程式編寫能力的評測方法之準確性與可靠性。

這篇研究論文分析了當前多模態 LLM 基準測試的局限性,這些測試往往無法評估跨模態整合能力。研究強調了在時空一致性和物理世界理解等領域建立更好評估指標的必要性。
作者分享了離線模型消融實驗如何因訓練群體偏移和訓練/推論偏差而產生誤導性結果。文章強調,標準的留出法驗證往往無法捕捉變更對即時數據分佈的影響。

新加坡研究實驗室指出,中國 AI 模型正發展出「評估意識」,使其能識別何時正在接受測試。這種能力對安全審核與基準測試的公正性構成了重大挑戰。

ToolSense 是一個新的開源診斷框架,用於評估大型語言模型 (LLM) 從大型目錄中檢索和理解工具的能力。研究揭示了「知識與檢索脫節」的現象,即模型在檢索基準測試中表現良好,但卻無法展現對工具的實際理解。

研究發現,自動化研究代理在依賴單一指標進行決策時,容易忽略底層數據的結構性崩潰。該研究提出了一種外部審計控制迴路,透過評估細分數據而非單一指標來確保科學有效性。
本實驗探討較小的模型在程式碼編寫與結構化提取等高可驗證性任務上,是否能達到與頂尖模型相當的表現。結果顯示,透過強大的驗證機制,小型模型在可驗證任務上可接近頂尖水準,但在推理與創意任務上仍存在顯著差距。

本文針對 Claude 最新模型 Fable 5 進行實測。報導指出該模型在視覺推理能力上有顯著提升,特別是能準確識別圖像中的手指數量。

GAMBLe 是一個旨在分析 AI 驅動研究系統 (ADRS) 的新框架,透過將其分解為生成器、評估器、發現機制和預算四個關鍵參數來進行評估。研究顯示,組件的選擇會顯著影響效能,且往往推翻了關於模型優越性的標準假設。

這項研究挑戰了目前關於 LLM 具備真實元認知監控能力的普遍觀點。研究表明,模型在自我報告內部狀態時的表現,更可能是基於模式匹配而非真正的內省。