📄ArXiv AI•較早收集於 9h
CrowdMath:用於協作數學推理的新數據集

💡新基準測試顯示,儘管 LLM 在簡單的下一個 Token 預測中表現優異,但在協作推理方面仍面臨挑戰。
⚡ 30-Second TL;DR
有什麼變化
包含來自 MIT PRIMES-AoPS 計畫的 164 個經專家標註的進度鏈。
為什麼重要
該數據集揭示了當前大型語言模型在理解協作貢獻的功能意義方面的顯著侷限性,為未來的推理研究提供了一個新的基準。
下一步行動
從 arXiv 連結下載 CrowdMath 數據集,以測試您的模型在多步驟證明過程中識別個人貢獻功能角色的能力。
誰應關注:Researchers & Academics
關鍵要點
- •包含來自 MIT PRIMES-AoPS 計畫的 164 個經專家標註的進度鏈。
- •模型在下一個貼文預測中達到 83-88% 的準確率,但在功能角色分類上表現不佳。
- •突顯了對協作式、多參與者數學推理進行建模的難度。
- •為評估模型如何識別錯誤並合成證明提供了基準測試。
🧠 深度解析
Web-grounded analysis with 10 cited sources.
🔑 增強重點摘要
- •CrowdMath 數據集旨在捕捉開放式問題解決中複雜、迭代的人類協作過程,包括提出部分論點、識別錯誤、修復有缺陷的推理以及逐步綜合增量貢獻以形成證明,這與傳統上評估明確定義問題的基準測試不同。
- •該數據集源自麻省理工學院 PRIMES-AoPS CrowdMath 計劃,該計劃是一個大規模的線上協作研究項目,開放給全球高中生和大學生,並由頂尖研究導師指導,其討論已促成同行評審的出版物。
- •CrowdMath 計劃的靈感來自陶哲軒的 Polymath 項目,旨在促進大規模的協作數學研究,並鼓勵學生在一個友善的環境中進行探索和實驗,減少對犯錯的顧慮。
- •儘管模型在「下一個貼文預測」任務中表現出 83-88% 的準確率,但在「功能角色分類」方面表現不佳,這突顯了對協作式、多參與者數學推理進行建模的固有難度,並暗示了對更複雜模型的需求。
🛠️ 技術深入
- 數據集包含來自麻省理工學院 PRIMES-AoPS CrowdMath 計劃的 164 個專家註釋的「進度鏈」(progress chains)。
- 這些進度鏈記錄了協作開放式問題解決的動態過程,包括參與者提出部分論點、識別先前步驟中的差距或錯誤、修復有缺陷的推理以及逐步綜合增量貢獻以形成證明。
- 數據集用於評估模型在兩個主要任務上的表現:預測下一個貼文(next post prediction)和功能角色分類(functional role classification)。
- 在「下一個貼文預測」任務中,模型達到了 83-88% 的準確率。
- 在「功能角色分類」任務中,模型表現不佳,這表明理解協作討論中不同貢獻的意圖或類型(例如,提出想法、提問、識別錯誤、提供證明步驟)是一個重大挑戰。
- 數據集為評估模型如何識別錯誤並合成證明提供了基準測試。
- 該論文的 arXiv 識別碼為 arXiv:2606.06526。
🔮 前景展望AI analysis grounded in cited sources
CrowdMath 將加速開發能夠更深入理解人類協作推理的 AI 模型。
該數據集獨特地捕捉了迭代、錯誤識別和證明合成的複雜性,這將推動 AI 超越簡單的問答,進入更複雜的互動模式。
基於 CrowdMath 訓練的 AI 系統將顯著提升人類與 AI 在科學研究和開放式問題解決中的協作效率。
透過學習識別錯誤和綜合部分論點,AI 可以成為更有效的合作夥伴,協助人類在複雜領域中導航和解決問題。
該數據集將促進教育技術的創新,特別是在支援協作學習和自動化學生錯誤診斷方面。
能夠理解協作進度、識別錯誤和分類貢獻的 AI,將對智慧導師系統和團體學習平台產生重大價值。
⏳ 時間線
2016-01
麻省理工學院 PRIMES 和 Art of Problem Solving 宣佈啟動「CrowdMath」項目,靈感來自陶哲軒的 Polymath 項目。
2016-02
麻省理工學院招生辦公室發佈關於 CrowdMath 的公告,強調其為高中生提供協作研究的機會。
2016-03
CrowdMath 項目正式啟動,向參與學生發佈開放性數學問題。
2018-05
一份名為《斷棍問題》(The Broken Stick Project)的論文以 P. A. Crowdmath 的名義提交至 arXiv,總結了早期 CrowdMath 項目之一的發現。
2016-2025
麻省理工學院 PRIMES-AoPS CrowdMath 計劃持續運作,在此期間產生了用於 CrowdMath 數據集的協作討論鏈。
2026-05
CrowdMath 數據集論文(arXiv:2606.06526)在 arXiv 上發佈,介紹了該數據集及其對協作數學推理的貢獻。
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
