來源較早收集於 66m

590GB SEC EDGAR 資料集開源發布

閱讀原文: Reddit r/LocalLLaMA
#dataset#finance#filings

免費 430 億 token SEC 資料集解鎖財務 LLM,無需 API 費用(HF 上 590GB)

30 秒速覽

有什麼變化

590GB 資料集:800 萬樣本、430 億 token 來自主要 SEC 申報

為什麼重要

提供免費開源存取大量財務資料用於 AI 訓練,減少對付費服務依賴,並實現財務導向 LLM。促進封閉 AI 生態中企業申報分析的民主化。

下一步行動

從 Hugging Face 載入 SEC-EDGAR 資料集,並試驗在 10-K 申報上微調模型。

誰應關注:Developers & AI Engineers

關鍵要點

  • •590GB 資料集:800 萬樣本、430 億 token 來自主要 SEC 申報
  • •包含原始內容、解析的 HTML/XML 純文字及中繼資料
  • •使用 datamule-python 花費 10 天收集,遵守 EDGAR 速率限制
  • •使用 selectolax、修改版 doc2dict 和 secsgml 程式庫解析

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。