
mAceReason-Math:高品質多語言數學資料集
Apple 的 mAceReason-Math 提供高品質多語言數學問題,專為可驗證獎勵強化學習 (RLVR) 設計。它解決現有資料集的英語中心偏差,提供適合當前 LLM 的難度。此資料集支援提升預訓練模型的數學與邏輯能力。
Tag: #dataset24 results

Apple 的 mAceReason-Math 提供高品質多語言數學問題,專為可驗證獎勵強化學習 (RLVR) 設計。它解決現有資料集的英語中心偏差,提供適合當前 LLM 的難度。此資料集支援提升預訓練模型的數學與邏輯能力。

HumanMCP 是第一個大規模、多樣化的人類般使用者查詢資料集,用於評估 MCP 伺服器的工具檢索效能。它涵蓋 308 個伺服器的 2800 個工具,基於 MCP Zero 建置,每個工具有多個獨特使用者角色,捕捉從精確到模糊的意圖。這解決了現有基準測試缺乏真實使用者互動的缺口。

研究人員推出CogARC,這是ARC的適應人類子集,包含75個視覺推理任務,由260名參與者測試,準確率約85%。高解析度數據記錄觀看、編輯和嘗試,顯示困難問題上的多樣策略,即使錯誤解決方案也趨於收斂。發現突顯人類在不確定性下的泛化,為AI基準測試提供洞見。

Adaption Labs 發布了一份涵蓋奈及利亞製造業與石油產業的資料集,包含 89 筆機器層級紀錄及領域基礎的思維鏈(CoT)推理層。此資源旨在提升模型在非洲經濟體中處理稀疏數值工業數據的表現。
一個涵蓋 8 種語言的 125k 程式碼資料集已在 Hugging Face 上發布,用於訓練和升級程式碼模型。使用隱藏的 Hunter Alpha 模型免費生成。完整 450k 版本即將推出,並開放合作。

38 天資料集記錄 Gemini 每日股票預測、理由、情緒與信心,涵蓋 10 天展望。時間鎖定,已上傳 Hugging Face 並附互動儀表板與 Colab 筆記本。研究 LLM 在不確定性下的穩定性、敘事漂移與校準。
EduEVAL-DB 推出一個包含 854 個解釋的資料集,對應 ScienceQA 基準的 139 個 K-12 年級問題,包括一位真人教師和六個 LLM 模擬教師角色解釋。它具備教學風險評分表,涵蓋事實正確性、解釋深度、焦點相關性、學生適當性和意識形態偏見,經半自動專家審核標註。初步基準測試比較 Gemini 2.5 Pro 與微調 Llama 3.1 8B 在消費者硬體上的風險偵測效能。

NASA 提供了一個高品質太空影像與影片的公共儲存庫。這些資源大多可免費使用,對於開發者與研究人員來說是極具價值的素材來源。
來自 MachineLearning 子版塊關於 Books3 資料集當前可用性與獲取方式的詢問。該資料集是目前 AI 版權訴訟中的核心爭議點。

鈦媒體入選主流價值語料生態聯盟首批成員,將擔綱科技領域高質量數據集的核心建設方。公司將持續貢獻優質科技語料資源,推動語料質量標準制定,助力構建繁榮、健康、可持續的語料生態。