
AI 代理仍寫不出合格的科學論文
一項最新研究發現,即使是先進的 AI 代理,在開放式研究任務上的表現仍遠低於人類科學家。研究指出,這些代理撰寫的論文甚至無法達到頂尖學術會議的基本審查標準。
Tag: #peer-review57 results

一項最新研究發現,即使是先進的 AI 代理,在開放式研究任務上的表現仍遠低於人類科學家。研究指出,這些代理撰寫的論文甚至無法達到頂尖學術會議的基本審查標準。

這篇立場論文指出,僅靠自願遵循的指南無法改善 ML 同儕審查品質。作者提出可執行的程序保障,以及類似貨幣的 OpenReview Points 系統,讓審稿人透過貢獻獲得點數,並兌換會議福利或額外審查資源。

本研究提出了一套嚴謹的基準測試協議,利用多模型 LLM 同儕審查來評估自主 AI 研究系統。研究針對四種框架與商業基準進行評測,揭示了顯著的效能差距,並驗證了自動化評估的可靠性。

本研究評估了如 OpenAIReview 等代理審查系統在評估學術論文方面的有效性。研究發現這些系統能追蹤人類的品質判斷並檢測錯誤,儘管仍有改進空間。

菲爾茲獎得主陶哲軒讚揚Claude Code僅用15分鐘處理論文所有審稿意見。該AI不僅快速完成修訂,還反向找出審稿人的錯誤。
史丹佛研究人員開發基於 LLM 的代理工具,引導審查者提供更具建設性且禮貌的反饋。在 ICLR 2025 的 2 萬份審查意見測試中,24% 被修改,平均增加 80 字,68% 被專家評為更好。未影響評分或錄取率。

GoodPoint 彙整 19K 篇 ICLR 論文資料集,使用作者回應標註審稿意見,並以有效性和作者行動兩個維度定義回饋成效。它提出訓練配方,結合微調與偏好最佳化,使 Qwen3-8B 成功率提升 83.7%,在同尺寸 LLM 中創下 SOTA。專家人評研究證實對作者實用價值更高。

研究人員指出,AI 偵測工具 Pangram 將來自大型實驗室的合法 EMNLP 投稿錯誤標記為 AI 生成。此討論凸顯了在學術出版中使用自動化工具進行誠信檢查,與產生誤報風險之間的矛盾。
探討 NeurIPS 與 CVPR 等大型會議中,關於「最佳論文」、「口頭報告」與「亮點論文」的評選標準與決策流程。
EACL 2027 更新了其 ARR 投稿流程,將作者回應期與作者-審稿人討論期分開。此變更延長了兩個階段的總時間,旨在減輕研究人員在同儕審查過程中的壓力。