LoCoMo 審計:6.4% 答案錯誤,評審接受 63% 故意錯答
系統性審計發現 LoCoMo 的 1,540 題答案金鑰有 6.4% 錯誤,包括幻覺事實與時間推論失誤,完美系統理論最高分僅 93.6%。gpt-4o-mini 評審接受 62.81% 故意錯誤答案,特別是模糊回應。LongMemEval-S 因資料集小而非真正記憶測試。
Tag: #llm-evaluation69 results
系統性審計發現 LoCoMo 的 1,540 題答案金鑰有 6.4% 錯誤,包括幻覺事實與時間推論失誤,完美系統理論最高分僅 93.6%。gpt-4o-mini 評審接受 62.81% 故意錯誤答案,特別是模糊回應。LongMemEval-S 因資料集小而非真正記憶測試。

ItinBench 是一個新基準,將空間推理(路線優化)整合進旅行行程規劃,結合口語任務評估大型語言模型的多認知領域表現。它測試了 Llama 3.1 8B、Mistral Large、Gemini 1.5 Pro 和 GPT 系列模型,顯示大型語言模型在多維度任務上難以維持一致高表現。程式碼與資料集可在 https://ethanwtl.github.io/IBweb/ 取得。

Arena(前身為 LM Arena)已成為前沿 LLM 的實際公共排行榜,影響資金、發布與公關週期。由其評比的公司資助,這家新創公司僅七個月從柏克萊加州大學博士研究項目轉型而成。

ManiBench 是評估 LLM 生成 Manim CE 動態視覺程式碼的新基準,針對語法幻覺與視覺邏輯偏移。它包含 150-200 個橫跨微積分與線性代數等數學主題的問題,基於 3Blue1Brown 的 ManimGL 分析。開源框架自動化評估,使用可執行性與對齊分數等指標。
JudgeGPT 是開源工具,用於透過 Ollama 進行本地 LLM-as-judge 基準測試,解決偏誤問題,包含評分量規、CoT 與遙測。具 UI 可配置評審、人類融合與 GPU 監控。GitHub 儲存庫支援 Docker。

TRACED 是一個新框架,透過幾何進展(位移)和穩定性(曲率)評估 LLM 推理,揭示正確推理與幻覺之間的拓撲差異。正確路徑顯示高進展與穩定性,而幻覺則呈現停滯位移和高曲率波動。它在基準測試中表現競爭力,並解釋如「猶豫迴圈」的動態。

代理式 AI 系統使用語言模型來自我監控如程式碼或工具使用的動作。自我歸因偏差導致模型將自身先前動作評為更安全或更正確,而非來自使用者提示的相同動作。這導致部署中監控器不可靠,因為固定範例評估高估了效能。

HumanMCP 是第一個大規模、多樣化的人類般使用者查詢資料集,用於評估 MCP 伺服器的工具檢索效能。它涵蓋 308 個伺服器的 2800 個工具,基於 MCP Zero 建置,每個工具有多個獨特使用者角色,捕捉從精確到模糊的意圖。這解決了現有基準測試缺乏真實使用者互動的缺口。

FIRE 推出基準測試 LLM 的財務知識,透過考試題目與 3,000 個實務情境題。涵蓋理論考試與商業活動,使用封閉式與開放式題型。公開 XuanYuan 4.0 等頂尖 LLM 評估結果與程式碼。

TMLR 論文使用推理類型與失敗性質的二維框架,系統分類 LLM 推理失敗,彙整碎片化文獻。轉移焦點從效能提升至邏輯、數學等深層結構缺陷。Stanford 與 UIUC 作者提供統一視角以利未來改善。