Search

Tag: #dataset24 results

590GB SEC EDGAR 資料集開源發布

590GB SEC EDGAR 資料集開源發布

Datamule、Teraflop AI 和 Eventual 在 Hugging Face 發布 590GB SEC EDGAR 資料集,包含 800 萬份申報文件和 430 億個 token。它提供免費存取已解析的財務報告如 10-K 和 10-Q,避開昂貴 API。資料使用 datamule-python 收集,並以 selectolax 和自訂程式庫解析。

Reddit r/LocalLLaMACommunityApr 15#dataset#finance#filings
📰

釋出 2,000 萬印度法律案件數據集

超過 2,000 萬印度法院案件,含結構化中繼資料、引用圖譜 (followed/distinguished/overruled)、Voyage AI 嵌入 + BM25。涵蓋最高法院/高等法院/法庭;適用法律 NLP、GNN、RAG 評估、印度語言模型。API/批量 JSON/Parquet 匯出,公共領域。

Reddit r/MachineLearningCommunityApr 14#legal-nlp#dataset#citation-graph
Ai2 發布開放權重 MolmoWeb 視覺網頁代理

Ai2 發布開放權重 MolmoWeb 視覺網頁代理

Ai2 發布 MolmoWeb,這是 4B 與 8B 規模的開放權重視覺網頁代理,附完整訓練堆疊與 MolmoWebMix 資料集,包含橫跨 1,100 多個網站的 30K 個人類任務軌跡。它僅依賴瀏覽器截圖運作,無需解析 HTML 即可產生推理動作。這為網頁自動化提供可審核的閉源 API 替代方案。

VentureBeatMediaMar 24#web-agent#visual-agent#dataset
Page 1 of 3