#11 · 主分类: 自然语言处理与文本处理
stanza
斯坦福NLP Python库,用于多种人类语言的词元化、句子分割、命名实体识别和句法分析。
项目最后更新:08/29/26
GitHub Stars
7.9K
Forks数量
959
贡献者数量
78
许可证
Other
收录理由
Stanza 是斯坦福 NLP 团队的官方 Python 库,一条 pip 命令就能装好,省去自己拼凑分词器和词性标注器的麻烦。把原始文本丢给它,无论是 60 多种语言中的哪一种,它都能完成分句、分词、词性标注、命名实体识别和依存句法分析。做搜索、信息抽取或语料处理的多语言预处理时,输出格式遵循通用惯例,因为模型基于 Universal Dependencies 等标准化资源训练,结果容易理解和对接。它还封装了 Java 版的 Stanford CoreNLP,方便 Python 代码与已有的 CoreNLP 标注衔接。新增的生物医学和临床英文模型包,把同样的接口带到了对解析和实体识别要求很高的科研论文和临床记录场景,实用价值明显。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。