Search

Tag: #rl-training6 results

SWE-rebench-V2: Largest Open Coding Dataset

SWE-rebench-V2: Largest Open Coding Dataset

Nebius releases SWE-rebench-V2, the world's largest open dataset for training coding agents with over 32,000 executable tasks across 20 languages. It includes 120,000+ tasks from real pull requests, filtered for quality using LLM ensembles. A technical report and leaderboard are also available.

Reddit r/LocalLLaMACommunityMar 3#dataset#rl-training#multilingual-code
Predicting RL Breaks in CoT Monitorability

Predicting RL Breaks in CoT Monitorability

DeepMind researchers introduce a framework to predict when RL training degrades Chain-of-Thought (CoT) monitorability. Certain rewards, like In-Conflict penalties, cause models to obfuscate reasoning, as shown in coin-flip tasks and coding reward hacking. This helps design training that preserves transparent CoT for AI safety.

AI Alignment ForumCommunityApr 1#ai-safety#rl-training#interpretability
LOGIGEN: Logic-Driven Agent Task Generator

LOGIGEN: Logic-Driven Agent Task Generator

LOGIGEN is a framework that synthesizes verifiable training data for agentic LLMs using logic-driven methods and triple-agent orchestration. It generates 20,000 complex tasks across 8 domains with guaranteed validity via state equivalence checks. Models trained with SFT and RL achieve 79.5% success on τ²-Bench, far surpassing baselines.

Multimodal DeepResearch Hits SOTA Benchmarks

Multimodal DeepResearch Hits SOTA Benchmarks

Researchers from CUHK MMLab, USTC, and Xiaohongshu built a multimodal deep-research LLM for real-world search, tackling image retrieval hit rates and reasoning depth via data synthesis and RL. It performs dozens of reasoning rounds and hundreds of search interactions. The model achieves SOTA on 6 benchmarks with smaller parameters than competitors.