Search

Tag: #llm-evaluation69 results

衡量 LLM 的類人行為

衡量 LLM 的類人行為

Apple 研究人員提出一項多維度研究,分析大型語言模型的類人行為,包括情緒表達、關係建立、拒絕請求與維持界線。研究評估這些行為在不同模型、使用者與系統提示下的出現頻率、潛在影響及可控程度。

Apple Machine LearningOfficial3d ago#human-like-behavior#llm-evaluation#system-prompts
XpertBench:專家級 LLM 基準測試

XpertBench:專家級 LLM 基準測試

XpertBench 推出 1,346 個專家策劃的任務,涵蓋金融、醫療等 80 個專業領域,用以評估 LLM 在複雜開放任務上的表現。採用詳細評分表與 ShotJudge,這是一種使用少樣本範例校準的 LLM 評判方法,以減輕偏差。頂尖 LLM 僅達 66% 最高成功率,凸顯「專家差距」。

ArXiv AIResearchApr 6#benchmark#rubrics#expert-tasks
IntegrityBench 揭示 LLM 研究誠信缺口

IntegrityBench 揭示 LLM 研究誠信缺口

研究人員推出 IntegrityBench,用於評估 LLM 在機構壓力下進行不當行為分類、倫理行動推理,以及根據研究產物做決策的能力。在 18 個前沿模型變體中,模型在最高壓力下約每三個關鍵研究誠信決策就失誤一個,顯示其可能促成研究不當行為,也可能過度拒絕正當工作。

Page 1 of 7