影子 API 毀壞 ML 可重現性
arXiv 論文審計模擬 GPT-5/Gemini 的影子 API,已用於 187 篇論文,最熱門服務有 5,966 次引用。揭露 47% 效能差異、安全不可預測及 45% 指紋驗證失敗。威脅研究信任與生產可靠性。
Tag: #reproducibility37 results
arXiv 論文審計模擬 GPT-5/Gemini 的影子 API,已用於 187 篇論文,最熱門服務有 5,966 次引用。揭露 47% 效能差異、安全不可預測及 45% 指紋驗證失敗。威脅研究信任與生產可靠性。
Hugging Face 檢視重現 2,200 篇 ICML 論文所獲得的經驗。這項大規模工作突顯機器學習研究在可重現性方面的實務課題與重要啟示。

SemantiClean 是一個模組化框架,旨在從電子商務數據中提取結構化語義訊號,同時優先考慮可審計性和可重現性。它利用四層架構和抗通膨機制,確保高品質且具備辯護性的行為推論。

本研究論文分析了 77 項關於基於 LLM 的交易代理研究,揭示了目前缺乏標準化評估協議與可重現性的嚴重問題。作者強調,大多數現有的代理交易研究未能充分考慮交易成本、執行時序或穩健的回測標準。

研究人員引入背景溫度(T_bg)來解釋LLM在T=0時因實作非決定性(如批次大小變化與浮點數問題)而產生不同輸出。他們將其形式化為環境擾動的有效溫度,並提出經驗估計協議。在主要LLM提供者的試驗中驗證此概念,以提升再現性。

LLM 代理僅使用論文方法描述和原始資料,即可重現實證社會科學結果,無需存取程式碼或結果。系統提取結構化方法、在隔離環境執行重新實作,並逐单元格比較輸出。在 48 篇論文評估中,不同模型與支架表現差異大,失敗原因來自代理錯誤或論文描述不足。

提出基於人工製品的代理框架,用於醫學影像處理,強調對資料集條件的自適應性及透過出處追蹤實現可重現性。利用人工製品合約進行語義工作流程查詢及模組化配置組裝。在臨床CT及MRI群組上評估,證明確定性可重現性及隱私相容性。
一位研究者今年檢查了 7 項可行的 ML 論文主張,發現 4 項無法重現。其中 2 項在 GitHub 上有未解決問題。這引發對 ML 研究現況的質疑。
WAICA 2026 依托WAIC八年積澱,在上海啟動,姚期智任主席,Richard Sutton為共同主席。引入「AI+大眾+專家」審稿、多媒體投稿及程式碼驗證平台。投稿截止2026年3月31日,錄用率20%。

基於 LLM 的自主 AI 分析師可擴展地重現人類「眾多分析師」研究,在相同資料集上產生多樣結果。它們獨立建構分析流程,顯示效果大小、p 值及假設支持的分散。變異性具結構化,並可透過 LLM 模型及角色調整來導向,由 AI 審核員驗證方法有效性。