
IntegrityBench 揭示 LLM 研究誠信缺口
研究人員推出 IntegrityBench,用於評估 LLM 在機構壓力下進行不當行為分類、倫理行動推理,以及根據研究產物做決策的能力。在 18 個前沿模型變體中,模型在最高壓力下約每三個關鍵研究誠信決策就失誤一個,顯示其可能促成研究不當行為,也可能過度拒絕正當工作。
Tag: #research-integrity7 results

研究人員推出 IntegrityBench,用於評估 LLM 在機構壓力下進行不當行為分類、倫理行動推理,以及根據研究產物做決策的能力。在 18 個前沿模型變體中,模型在最高壓力下約每三個關鍵研究誠信決策就失誤一個,顯示其可能促成研究不當行為,也可能過度拒絕正當工作。
一名 Reddit 用戶指控一份品質低劣且內容荒謬的參賽作品,贏得了 DeepMind 與 Kaggle 舉辦的「邁向 AGI 之進展」挑戰賽 2.5 萬美元獎金。該評論對評審過程以及獲獎研究方法的有效性提出了質疑。
KPMG 關於 AI 智能體的報告被發現包含嚴重幻覺,包括不存在的案例研究與虛構引用。在 GPTZero 與金融時報調查後,該公司已撤回報告並進行內部審查。

研究產出與 AI 輔助論文快速增加,正對依賴志願者的同行評審制度造成前所未有的壓力。文章探討在投稿量持續上升的情況下,現有評審流程能否維持有效運作。

Ars Technica 強調了一項令人擔憂的監管轉變,該轉變可能將政治任命人員置於科學決策的核心。社論呼籲公眾提交意見,以防止科學研究的政治化。
一名 Reddit 使用者指稱,一篇以資料集為主要貢獻的 CVPR 2026 已發表論文,在會議前、會議期間及會議後都未公開該資料集。據稱論文所附的 GitHub 儲存庫是空的,作者也未回應詢問。