#126 · 主分类: 自然语言处理与文本处理
pyresparser
一个简单的简历解析器,用于提取简历中的信息
项目最后更新:09/13/23
GitHub Stars
959
Forks数量
442
贡献者数量
3
许可证
GPL-3.0
收录理由
简历格式五花八门,想从中抽出干净的结构化数据往往很费劲。pyresparser 提供了一条直接的路径:它能读取 PDF 和 DOCX 文件,返回一个包含姓名、邮箱、电话、技能、学位、公司以及大致工作年限等关键信息的字典。底层借助 spaCy 和 nltk 做实体识别与文本清洗,抽取过程依赖真正的自然语言处理,而非简单的模式匹配。你可以对单个文件调用 ResumeParser,也可以用命令行工具批量处理整个目录并获取结果。因为是纯 Python 实现,依赖说明清晰,很容易嵌入到现有后端;默认的技能表可以定制,也能添加自定义正则规则来适配特殊需求。需要留意的是,它的定位是提取简历中的常见字段,并非全面的职业规划工具,在大规模使用前最好先拿自己的文档实测一番。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。