Search

Tag: #dataset24 results

Multilingual Math Dataset for RLVR

Multilingual Math Dataset for RLVR

Apple's mAceReason-Math provides high-quality multilingual math problems designed for Reinforcement Learning with Verifiable Rewards (RLVR). It addresses the English-centric bias in existing datasets, offering appropriate difficulty for current LLMs. The dataset supports boosting math and logic capabilities in pretrained models.

Apple Machine LearningOfficialMar 13#multilingual#math#dataset
HumanMCP Dataset for Realistic MCP Tool Evaluation

HumanMCP Dataset for Realistic MCP Tool Evaluation

HumanMCP is the first large-scale dataset of diverse, human-like user queries for evaluating MCP servers' tool retrieval performance. It covers 2800 tools across 308 servers, built on MCP Zero, with multiple unique user personas per tool capturing precise to ambiguous intents. This addresses gaps in existing benchmarks lacking realistic user interactions.

ArXiv AIResearchMar 2#dataset#benchmark#tool-retrieval
CogARC Dataset Reveals Human ARC Strategies

CogARC Dataset Reveals Human ARC Strategies

Researchers launched CogARC, a human-adapted ARC subset with 75 visual reasoning tasks tested on 260 participants achieving ~85% accuracy. High-res data captures viewing, edits, and attempts, showing varied strategies on hard problems and convergent solutions even in errors. Findings highlight human generalization under uncertainty for AI benchmarking.

ArXiv AIResearchFeb 27#abstract-reasoning#human-ai#dataset
📰

125k Coding Dataset Released

A new 125k coding dataset across 8 languages has been released on Hugging Face for training and upgrading coding models. Generated for free using the cloaked Hunter Alpha model. Full 450k version coming soon with collaboration open.

Reddit r/LocalLLaMACommunityMar 16#dataset#sft#fine-tuning
38-Day Gemini Forecasting Dataset Released

38-Day Gemini Forecasting Dataset Released

38-day dataset logs Gemini's daily stock forecasts, rationales, sentiment, and confidence over 10-day horizons. Time-locked and published on Hugging Face with interactive dashboard and Colab notebook. Studies LLM stability, narrative drift, and calibration under uncertainty.

Reddit r/MachineLearningCommunityMar 13#dataset#forecasting#llm-stability
EduEVAL-DB Dataset for AI Tutor Evaluation

EduEVAL-DB Dataset for AI Tutor Evaluation

EduEVAL-DB introduces a dataset of 854 explanations for 139 ScienceQA questions across K-12 subjects, with one human-teacher and six LLM-simulated teacher explanations. It features a pedagogical risk rubric covering factual correctness, depth, focus, appropriateness, and bias, annotated via semi-automatic expert review. Preliminary benchmarks compare Gemini 2.5 Pro against fine-tuned Llama 3.1 8B for risk detection on consumer hardware.

Titanium Media Joins Elite Tech Corpus Alliance

Titanium Media Joins Elite Tech Corpus Alliance

Titanium Media has been selected as a founding member of the Mainstream Value Corpus Ecological Alliance. It will lead the core construction of high-quality datasets in the technology domain. The company plans to contribute premium tech corpus resources and advance quality standards for a sustainable corpus ecosystem.

钛媒体MediaMay 9#dataset#corpus#alliance
Page 2 of 3