#148 · 主分类: 自然语言处理与文本处理

edgar-crawler

business data-mining edgar edgar-crawler finance natural-language-processing nlp python sec web-crawler

唯一能够下载SEC EDGAR财务报告并将特定项目部分的文本数据提取为整洁结构化JSON文件的开源工具包。已在澳大利亚悉尼举办的WWW 2025上展示(https://dl.acm.org/doi/10.1145/3701716.3715289)

项目最后更新:07/18/25

GitHub Stars

542

Forks数量

136

贡献者数量

6

许可证

GPL-3.0

收录理由

做金融NLP研究或构建相关数据集,往往先要跟SEC文件较劲。真正卡住进度的通常不是建模,而是如何从10-K、10-Q和8-K这些报告里拿到干净、结构化的文本。这个工具把整条流水线都包了:从EDGAR拉取任意一组美国上市公司的申报文件,按年份、季度、文件类型筛选,再把每份文档解析成标准JSON,把业务描述、风险因素、管理层讨论与分析、财务报表这些关键章节单独拆出来。输出可以直接喂给语料库、检索流程或微调任务,作者自己也用它生成了HuggingFace上的EDGAR-CORPUS数据集。对于想要可复现、机器可读的财务文本,又不想手动去刮HTML的研究者和量化团队来说,这种结构化抽取能省下大量时间。它定位在数据获取和解析,不是分析平台,下游的分析或建模还得自己来。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目