
無法重現的 AI 外掛讓 Token 成本翻倍
據稱,一款未具名工具能讓 DeepSeek V4-Pro 看似擊敗 Fable 5,但其他使用者無法重現這項結果。這項優勢可能伴隨 Token 消耗翻倍的代價。
Tag: #reproducibility37 results

據稱,一款未具名工具能讓 DeepSeek V4-Pro 看似擊敗 Fable 5,但其他使用者無法重現這項結果。這項優勢可能伴隨 Token 消耗翻倍的代價。

社群專案 J-Space Cognition Suite 宣稱,在不修改模型權重的情況下,透過推理時 Agent Harness 提升 DeepSeek V4-Pro-0813 的表現。其在多項基準測試中的提升尚未獲得獨立團隊重現,且該專案與 Anthropic 的內部 J-space 可解釋性研究無關。

一項複製研究確認,原始 FLOPs 無法可靠預測 AI 執行時間,因為不同運算的平行化特性並不相同。在新一代硬體上的測試也發現,執行時間存在 α-FLOPs 公式通常低估的跳躍與振盪現象。
OpenClaw 更新發布流程,讓凍結驗證獨立於 main 分支運作。此次變更強制執行凍結驗證契約、在父程序中驗證候選版本識別,並修補發布隔離缺口。

SAI Review 嘗試重現 ICML 2026 的 105 篇 Oral 論文,發現只有 8 篇重現了超過 80% 的可驗證主張。審查揭露程式碼無法執行、檔案缺失、結果不一致、模型下線,以及極高的重現成本等問題。

VERITAS 是一個領域無關的驗證框架,利用 CLI 編碼代理自動化科學研究論文的驗證過程。它能提取論文主張、執行方法論,並提供加權驗證分數以評估研究的有效性。

REDI 是一個開源框架,可將大規模科學數據集自動轉換為 AI 就緒格式。它具備五階段處理流程,並與 SetGo 工具整合,以確保符合 FAIR 原則並實現可重現的研究。

這項研究提出了一種針對 AI Agent 的多維度評估框架,認為準確度飽和並不代表基準測試失去價值。研究引入了 CORE-Bench v1.1 及 OOD 套件,用於衡量效率、可靠性及人機協作表現。
彙整約 1,200 篇 ICLR 2026 接受論文(佔 5,300+ 篇的 22%),附有從投稿中提取的公開程式碼、資料或示範連結。此資源直導 GitHub 儲存庫與官方網站。ICLR 2026 將於 4 月 22 日起在巴西里約熱內盧舉行。

NVIDIA 推出 AI Cluster Runtime,這是一個用於驗證 GPU 基礎設施 Kubernetes 叢集的開源專案。它提供從驅動程式到運算子等完整軟體堆疊的分層、可重現配方。這消除了跨叢集、升級和雲端的重現性問題。