🤖Reddit r/MachineLearning•較早收集於 24m
Papers With Code 新增閉源模型評測支援

💡在統一的排行榜上,輕鬆比較您的開源 AI 模型與最新的閉源基準測試結果。
⚡ 30-Second TL;DR
有什麼變化
排行榜新增對閉源模型基準測試的支援。
為什麼重要
此更新承認了閉源模型在基準測試中的主導地位,同時為開源研究保留了清晰的區隔,提升了 AI 評測的透明度。
下一步行動
前往 paperswithcode.co 並使用設定切換功能,將您的開源模型效能與最新的閉源基準測試進行比較。
誰應關注:Researchers & Academics
關鍵要點
- •排行榜新增對閉源模型基準測試的支援。
- •引入切換開關,可過濾閉源模型以查看純開源模型排行榜。
- •支援提交非 arXiv 來源(如部落格文章)進行模型評測。
- •提供散佈圖與表格來呈現頂尖 AI 模型的效能基準。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Papers With Code 平台是 Hugging Face、Meta AI 和原始創始人合作的「復興」版本,於 2025 年 7 月原網站關閉後重新推出,並利用 AI 代理自動解析論文和生成排行榜 [1, 3, 8, 17]。
- •新增閉源模型評測支援旨在解決開源與閉源模型之間日益擴大的「能力差距」,為研究人員和開發者提供一個中立平台,以全面比較模型性能、成本和客製化能力,從而做出明智的決策 [9, 12, 18]。
- •平台現在支援對 GPT-5.5 和 Anthropic 的 Mythos 5 等尖端閉源模型進行基準測試,這些模型在代理式編碼、網路安全和複雜推理等領域展現出卓越性能,通常在特定基準測試中超越開源替代方案 [4, 11, 20, 24, 33, 38]。
- •新平台採用 AI 代理大規模解析論文並自動生成排行榜,輔以人工驗證以確保數據品質,這代表了其內容策展和更新機制的核心技術轉變 [8, 17]。
- •除了 arXiv 論文,平台現在也接受來自部落格文章和技術報告等非傳統來源的提交,反映了 AI 研究發表生態的演變,其中重要的研究成果可能首先在非學術渠道發布 [6, 17]。
📊 競品分析▸ Show
| 平台名稱 | 主要特點 | 價格 | 基準測試範圍 |
|---|---|---|---|
| Papers With Code (復興版) | 以論文為中心,連結代碼、數據集、方法和基準測試。同時支援開源與閉源模型。接受非 arXiv 來源提交。利用 AI 代理進行內容策展和排行榜生成 [1, 3, 8, 17]。 | 免費使用 | 廣泛的 AI/ML 任務,包括開源與閉源模型的性能基準 [6, 8] |
| Hugging Face Leaderboards | 以模型為中心,提供可重現的評估管道。主要針對託管於 Hugging Face Hub 上的開源模型。近期整合了排行榜功能 [1, 2, 13, 15]。 | 免費使用 | 主要針對大型語言模型 (LLM) 和聊天機器人等開源模型 [13] |
| MLPerf (MLCommons) | 衡量 AI 硬體和軟體性能的黃金標準。提供公平、經過同行評審的基準測試,評估跨計算任務的速度和效率。對硬體測試環境實施標準化規則 [2, 27, 30, 34, 35]。 | 免費使用 | 涵蓋 NLP、電腦視覺、語音識別等廣泛的 AI 子領域的硬體和軟體性能 [30] |
| Artificial Analysis | 專注於 LLM 比較,根據智慧、價格、性能、速度和上下文長度等關鍵指標對模型進行排名。使用獨立評估來生成其「智慧指數」 [11, 18]。 | 部分免費/訂閱制 (針對詳細分析) | 針對 100 多個 LLM 的綜合性能、智慧、速度和成本指標 [11] |
🛠️ 技術深入
- 新版 Papers With Code (paperswithcode.co) 是從零開始構建的,大量使用了 AI 代理來大規模解析論文,並輔以人工驗證以確保數據品質 [8, 17]。
- 平台能夠自動生成排行榜 [17]。
- 支援非 arXiv 來源的外部論文提交 [17]。
- 閉源模型的評估結果會帶有特殊的「closed」標籤 [6]。
- 平台利用「Sign in with HF」和儲存桶來儲存縮圖、論文 PDF 和整體數據備份 [17]。
- 基準測試閉源模型面臨的挑戰包括 API 存取、基於使用量的定價、有限的客製化選項以及數據隱私問題 [9]。雖然具體的技術實施細節未公開,但平台已成功整合這些模型的性能數據 [6, 9]。
🔮 前景展望AI analysis grounded in cited sources
加速閉源模型透明度與競爭
透過提供一個中立的基準測試平台,Papers With Code 將促使閉源模型開發者發布更多性能數據,並可能促使他們改進模型以在公開排行榜上競爭,從而提高 AI 產業的透明度和競爭力 [9, 12, 18]。
促進混合式 AI 部署策略
在單一平台上比較開源和閉源模型的能力,將幫助組織做出更明智的決策,可能導致混合式 AI 架構的採用增加,利用兩種模型類型在不同用例中的優勢 [9, 12]。
改變 AI 研究發表生態
支援非 arXiv 提交(例如部落格文章、技術報告)承認並合法化了替代的發表渠道,可能鼓勵在傳統學術同行評審週期之外更快速地分享研究成果 [6, 17]。
⏳ 時間線
2018-07
Papers With Code 由 Robert Stojnic 和 Ross Taylor 創立 [3, 7]
2019-12
Papers With Code 加入 Facebook AI (後來的 Meta AI) [3, 7]
2020-10
Papers With Code 與 arXiv 整合,在論文頁面新增「Code」標籤 [3, 7]
2021-12
Papers With Code 索引了超過 79,817 篇論文、9,327 個基準測試和 5,628 個數據集 [3]
2025-07
Meta 無預警關閉 Papers With Code 網站,域名重定向至 Hugging Face [1, 3]
2026-05
Hugging Face 的 Niels Rogge 與 Meta AI 及原始創始人合作,重新啟動 Papers With Code (paperswithcode.co) [8, 17]
2026-06
Papers With Code (paperswithcode.co) 新增對閉源模型評測的支援 [6]
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗