
停止未經嚴格評估自動化同儕審查
此立場論文主張不應使用當前大型語言模型產生論文審查,因存在關鍵缺陷。對 ICLR 2026 審查的實證測試顯示 AI 出現蜂巢心態效應,降低觀點多樣性,並易遭論文改寫操弄。呼籲發展同儕審查自動化的專門科學,而非倉促部署通用 LLM。
Tag: #peer-review57 results

此立場論文主張不應使用當前大型語言模型產生論文審查,因存在關鍵缺陷。對 ICLR 2026 審查的實證測試顯示 AI 出現蜂巢心態效應,降低觀點多樣性,並易遭論文改寫操弄。呼籲發展同儕審查自動化的專門科學,而非倉促部署通用 LLM。

提出雙層認證框架,將AI輔助研究的知識品質評估與人類貢獻評級分離。貢獻分為A類(管道可達)、B類(需人類指導)、C類(人類前沿)。透過基準槽實現自動化作品透明出版,適用現有系統。

用戶測試 Gemini 3 Pro Deepthink 解無解的安全悖論謎題,得到華麗但有瑕疵的解答。Gemma 4 31B 徹底拆解,發現物理違規與假數學。反饋後,Gemini 承認邏輯失效。

研究產出與 AI 輔助論文快速增加,正對依賴志願者的同行評審制度造成前所未有的壓力。文章探討在投稿量持續上升的情況下,現有評審流程能否維持有效運作。
本文指出 LLM 輔助同行評審的常見問題,包括過度關注不太可能造成影響的混淆變數,以及過於抽象的新穎性批評。文章主張,評審應優先處理會實質影響論文結論的風險,並引用具體的先前方法。
研究人員正討論 NeurIPS 2026 審查流程中的不一致性,特別是關於後設審查(metareview)是否必須包含明確的錄取/拒絕建議。許多作者回報收到模糊的反饋,儘管進行了強有力的反駁,仍對論文的審查狀態感到不確定。
作者反映透過 NeurIPS 系統提前提交的回覆(Rebuttal)未能觸發審稿人與領域主席(AC)的通知。此技術疏失導致許多論文在關鍵討論期間處於無人回應的狀態。
本文指出,隨著 AI 會議將同儕審查列為作者的強制義務,審查品質必須提升。作者呼籲應提供具體且有證據支持的意見,而非模糊的批評,並強調低品質的審查已不能再以「志工服務」為藉口。

一名研究人員錯過了 AAAI 投稿中互惠審稿人的提名截止日期,擔心因此遭到拒稿。作者目前已更新投稿資訊並聯繫大會主席,試圖修正此行政疏失。
本文探討了 *ACL 會議錄取標準的模糊性,特別是 ARR 審稿與元審稿(meta-review)如何影響最終決策。文中指出審稿分數與最終結果之間存在落差,例如分數較低的論文可能被錄取,而分數較高的卻被拒絕。