
GISTBench:LLM 用戶理解基準測試
GISTBench 評估大型語言模型從推薦系統互動歷史中提取並驗證用戶興趣的能力,與傳統項目預測基準不同。它引入興趣基於性(IG)和興趣特定性(IS)指標,並發布來自短影片平台的合成資料集。對八個開源權重 LLM(7B 至 120B 參數)的評估揭示了在計數和歸因異質互動方面的性能瓶頸。
Tag: #benchmark195 results

GISTBench 評估大型語言模型從推薦系統互動歷史中提取並驗證用戶興趣的能力,與傳統項目預測基準不同。它引入興趣基於性(IG)和興趣特定性(IS)指標,並發布來自短影片平台的合成資料集。對八個開源權重 LLM(7B 至 120B 參數)的評估揭示了在計數和歸因異質互動方面的性能瓶頸。

Emergence WebVoyager 是升級版基準測試,解決 WebVoyager 的任務歧義與變異性問題。它透過明確指南標準化評估,達到 95.9% 註解者間一致性。測試顯示 OpenAI Operator 成功率僅 68.6%,遠低於其宣稱的 87%。

ChartDiff 推出首個跨圖表比較摘要的大型基準測試,包含 8,541 個多樣化圖表對,並附有人工驗證的差異摘要。評估顯示通用模型在品質上表現最佳,但專門方法雖 ROUGE 分數較高,卻在人類對齊評估中落後。多系列圖表仍是視覺語言模型的持續挑戰。

ggerganov 的 attn-rot(TurboQuant lite)即將合併進 llama.cpp,為 Qwen3.5 模型提供更低的 KV 量化 KLD 誤差。基準測試顯示 35B、27B 和 122B 變體在 VRAM 和 CPU 上 q4_0 品質提升且速度相當。本地推理速度預期加快。

一大型模型在人類猶豫因素基準上以Elo 1034.2分領先。超越Gemini-3.1-Pro與Claude-Opus-4.6。展現AI在不確定預測任務優勢。
MemAware 基準測試評估 AI 代理在無關鍵字匹配下擷取 900 隱含過去脈絡問題,涵蓋易、中、難三級。RAG 系統搭配 BM25 + 向量搜尋得分易 6.0%、中 3.7%,但難僅 0.7%—不如無記憶。GitHub 提供資料集與開源測試架構。

研究人員將 LLM 自省形式化為對政策與參數的潛在運算,並推出 Introspect-Bench 進行嚴格測試。前沿模型展現特權自預測能力,優於同儕。因果證據顯示自省透過注意力擴散自然出現,無需明確訓練。

AgentComm-Bench 推出基準測試套件,用以評估合作式具身 AI 在延遲、封包遺失及頻寬崩潰等真實網路損害下的表現。它測試三類任務—感知、導航及區域搜尋—橫跨五種通訊策略,揭示導航任務高達 96% 效能下降。該套件提出冗餘訊息編碼以提升穩健性,並已公開發布。

ItinBench 是一個新基準,將空間推理(路線優化)整合進旅行行程規劃,結合口語任務評估大型語言模型的多認知領域表現。它測試了 Llama 3.1 8B、Mistral Large、Gemini 1.5 Pro 和 GPT 系列模型,顯示大型語言模型在多維度任務上難以維持一致高表現。程式碼與資料集可在 https://ethanwtl.github.io/IBweb/ 取得。

LLM代理從稀疏、非識別提示結合公開資料重建真實身份。在Netflix(79.2%成功率)、AOL、InferLink基準及文字文物上評估。即使在良性任務中,推斷連結也會出現,呼籲重新評估隱私風險。