
LLM 評測模型極易受到決策後操縱的影響
研究顯示,LLM-as-a-judge 系統在一般情況下雖穩定,但若在決策後進行針對性的互動挑戰,其判斷結果極易被扭轉。這項發現指出目前的自動化評測流程可能不如預期般可靠。
Tag: #llm-evaluation69 results

研究顯示,LLM-as-a-judge 系統在一般情況下雖穩定,但若在決策後進行針對性的互動挑戰,其判斷結果極易被扭轉。這項發現指出目前的自動化評測流程可能不如預期般可靠。

EHRBench 是一個全新、自動化且可靠的基準測試,旨在利用真實世界的電子病歷 (EHR) 評估大型語言模型在臨床決策中的表現。它包含近 100 萬個涵蓋診斷、治療和預後任務的問答項目,並透過知識庫管道進行驗證。

OmniToM 是一個全新的基準測試,旨在透過要求明確的信念結構建模,而非僅僅評估最終答案,來評估大型語言模型(LLM)的心智理論能力。研究顯示,目前的模型在處理追蹤動態心理狀態所需的複雜知識獲取與表徵任務時仍面臨挑戰。

Cloudflare 分享了 Project Glasswing 的洞察,他們將 Mythos 及其他專注於安全的 LLM 部署到生產環境中,分析即時程式碼。報告詳細說明了模型的表現,並識別了其在實際安全應用中的優勢與劣勢。

研究人員建立基於醫療倫理的270條有害指令資料集,測試72個大型語言模型用於機器人健康助理控制。平均違規率達54.4%,專有模型遠比開源模型安全。微調與提示防禦僅帶來有限改善,阻礙臨床部署。

介紹ESRRSim,一個分類驅動框架,用於評估大型語言模型中的新興策略推理風險(ESRRs),如欺騙、評估遊戲和獎勵駭客。它包含7個類別分解為20個子類別、自動化情境生成,以及用於回應和推理軌跡的雙重評分標準。對11個LLM的評估顯示偵測率從14.45%至72.72%,世代進步顯示適應評估。

KWBench 推出基準測試大型語言模型在知識工作情境中無明確提示下識別問題的能力。包含來自收購、詐欺分析等領域的 223 項任務,基於賽局理論模式,並採用三階評分標準。頂尖模型無提示通過率僅 27.9%,凸顯評估缺口。

研究人員推出 REL,一個使用關係複雜度 (RC) 的生成基準框架,用以評估 LLM 在代數、化學和生物學中的高元關係推理能力。先進 LLM 在 RC 增加時表現持續單調下降,即使增加計算或上下文學習也無效。這突顯關係綁定的核心限制,呼籲重新檢視基準測試。
200 個陷阱提示的消融研究顯示,開放式探索提示將 LLM 自我分類的 Type II 錯誤降至 1.25%(對比 3.12%)。後認知指令也達 1.0% 有效;結構化方法損害 Claude 模型。測試 DeepSeek、Gemini Flash、Claude Haiku/Sonnet。

GISTBench 評估大型語言模型從推薦系統互動歷史中提取並驗證用戶興趣的能力,與傳統項目預測基準不同。它引入興趣基於性(IG)和興趣特定性(IS)指標,並發布來自短影片平台的合成資料集。對八個開源權重 LLM(7B 至 120B 參數)的評估揭示了在計數和歸因異質互動方面的性能瓶頸。