📄較早收集於 21h

KWBench:LLM無提示問題識別基準

KWBench:LLM無提示問題識別基準
PostLinkedIn
📄閱讀原文: ArXiv AI

💡新基準:LLM 無提示專業知識任務失敗 72%—測試您的模型!(24字元)

⚡ 30-Second TL;DR

有什麼變化

推出 223 項編碼賽局理論模式如委託人-代理人衝突的任務。

為什麼重要

揭示 LLM 在提示下表現出色,但複雜專業情境無提示下掙扎,促使改善零樣本推理。推廣模型組合,因路由將涵蓋率幾乎翻倍。基準轉向從執行到問題框架的重點。

下一步行動

從 arXiv 下載 KWBench,並基準測試您的 LLM 在無提示知識工作任務上。

誰應關注:Researchers & Academics

關鍵要點

  • 推出 223 項編碼賽局理論模式如委託人-代理人衝突的任務。
  • 測試從原始輸入無提示類型提示下的問題識別。
  • 最佳模型通過率 27.9%;前 8 模型組合涵蓋 50.7%。
  • 三階評分標準包含強制性失敗模式檢查。
  • 公開發布以推進知識工作 LLM 評估。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • KWBench 的設計核心在於模擬「隱性需求」場景,要求模型在缺乏明確指令(Zero-prompt)的情況下,主動從非結構化的商業數據中提取潛在的合規性風險或策略性漏洞。
  • 該基準測試引入了「強制性失敗模式(Mandatory Failure Modes)」機制,若模型在識別過程中產生幻覺或忽略了關鍵的賽局約束條件,即使最終答案看似合理,也會被直接判定為失敗。
  • 研究顯示,現有主流 LLM 在處理 KWBench 時普遍表現出「過度順從」傾向,即傾向於執行用戶輸入的表面任務,而非主動質疑或識別隱藏在任務背後的邏輯矛盾。

🛠️ 技術深入

  • 任務架構:基於賽局理論(Game Theory)構建,特別關注委託人-代理人(Principal-Agent)衝突模型,要求模型識別資訊不對稱下的道德風險。
  • 評分機制:採用三階評分標準(Tiered Scoring),分別評估:1. 問題識別的準確性;2. 賽局約束的邏輯一致性;3. 針對強制性失敗模式的防禦能力。
  • 數據集組成:包含 223 項真實商業場景任務,涵蓋企業收購盡職調查、金融詐欺檢測、供應鏈合約審計等高複雜度領域。
  • 評估方法:採用無提示(Zero-prompt)輸入模式,直接將原始業務場景數據輸入模型,測試其在無引導下的自主分析能力。

🔮 前景展望AI analysis grounded in cited sources

企業級 LLM 評估標準將從「指令遵循能力」轉向「自主問題識別能力」。
KWBench 的出現標誌著評估重點從單純的回答準確度,轉向模型在複雜商業環境中主動發現隱性風險的決策支援能力。
未來模型訓練將納入賽局理論作為核心邏輯訓練集。
由於現有模型在處理賽局衝突時表現不佳,開發者將被迫在預訓練或微調階段引入更多結構化的賽局邏輯數據以提升模型表現。

時間線

2026-02
KWBench 基準測試框架初步構建完成並進行內部壓力測試。
2026-03
研究團隊完成對 223 項任務的標註與賽局理論邏輯驗證。
2026-04
KWBench 正式發布並公開評估結果,揭示頂尖模型在無提示環境下的識別瓶頸。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI