🦙Reddit r/LocalLLaMA•較早收集於 66m
590GB SEC EDGAR 資料集開源發布

💡免費 430 億 token SEC 資料集解鎖財務 LLM,無需 API 費用(HF 上 590GB)
⚡ 30-Second TL;DR
有什麼變化
590GB 資料集:800 萬樣本、430 億 token 來自主要 SEC 申報
為什麼重要
提供免費開源存取大量財務資料用於 AI 訓練,減少對付費服務依賴,並實現財務導向 LLM。促進封閉 AI 生態中企業申報分析的民主化。
下一步行動
從 Hugging Face 載入 SEC-EDGAR 資料集,並試驗在 10-K 申報上微調模型。
誰應關注:Developers & AI Engineers
關鍵要點
- •590GB 資料集:800 萬樣本、430 億 token 來自主要 SEC 申報
- •包含原始內容、解析的 HTML/XML 純文字及中繼資料
- •使用 datamule-python 花費 10 天收集,遵守 EDGAR 速率限制
- •使用 selectolax、修改版 doc2dict 和 secsgml 程式庫解析
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
