
SWE-rebench-V2:最大開放程式碼資料集
Nebius 發布 SWE-rebench-V2,這是全球最大開放資料集,用於訓練程式碼代理,包含超過 32,000 個可執行任務,涵蓋 20 種程式語言。還包括來自真實拉取請求的 120,000+ 任務,使用 LLM 集成過濾品質。同時提供技術報告和排行榜。
Tag: #dataset24 results

Nebius 發布 SWE-rebench-V2,這是全球最大開放資料集,用於訓練程式碼代理,包含超過 32,000 個可執行任務,涵蓋 20 種程式語言。還包括來自真實拉取請求的 120,000+ 任務,使用 LLM 集成過濾品質。同時提供技術報告和排行榜。
一個全新的 EU AI Act 可下載語料庫,包含 933 個結構化法律區塊與 BGE-M3 嵌入,並整合於單一 SQLite 檔案中。該語料庫透過法律條文結構而非隨機字元視窗進行切分,顯著提升了檢索效能。
GitHub 發布了一個基於 CC0-1.0 授權的全新儲存庫層級數據集。該數據集匯集了來自 README、Issue 與 Pull Request 的多語言開發者內容,以支援 AI 研究。
MONET 是一個採用 Apache 2.0 授權的全新數據集,包含 1.049 億對高品質圖文數據。該發布同時提供了用於視覺化、檢索及訓練 T2i 模型的配套工具。

Daimon Infinit 是全球最大規模含觸覺的全模態物理世界數據集,已聯合發布。吸引谷歌及眾多高校參與。

Datamule、Teraflop AI 和 Eventual 在 Hugging Face 發布 590GB SEC EDGAR 資料集,包含 800 萬份申報文件和 430 億個 token。它提供免費存取已解析的財務報告如 10-K 和 10-Q,避開昂貴 API。資料使用 datamule-python 收集,並以 selectolax 和自訂程式庫解析。

GoodPoint 彙整 19K 篇 ICLR 論文資料集,使用作者回應標註審稿意見,並以有效性和作者行動兩個維度定義回饋成效。它提出訓練配方,結合微調與偏好最佳化,使 Qwen3-8B 成功率提升 83.7%,在同尺寸 LLM 中創下 SOTA。專家人評研究證實對作者實用價值更高。
超過 2,000 萬印度法院案件,含結構化中繼資料、引用圖譜 (followed/distinguished/overruled)、Voyage AI 嵌入 + BM25。涵蓋最高法院/高等法院/法庭;適用法律 NLP、GNN、RAG 評估、印度語言模型。API/批量 JSON/Parquet 匯出,公共領域。

Ai2 發布 MolmoWeb,這是 4B 與 8B 規模的開放權重視覺網頁代理,附完整訓練堆疊與 MolmoWebMix 資料集,包含橫跨 1,100 多個網站的 30K 個人類任務軌跡。它僅依賴瀏覽器截圖運作,無需解析 HTML 即可產生推理動作。這為網頁自動化提供可審核的閉源 API 替代方案。

1.4億寶可夢玩家免費貢獻300億高精圖像。該數據集訓練機器人實現厘米級導航精度。凸顯遊戲作為 AI 數據來源。