#185 · 主分类: 自然语言处理与文本处理

Jiayan

ancient-chinese classical-chinese nlp

甲言,专注于古代汉语(古汉语/古文/文言文/文言)处理的NLP工具包,支持文言词库构建、分词、词性标注、断句和标点。

项目最后更新:11/02/21

GitHub Stars

677

Forks数量

76

贡献者数量

2

许可证

MIT

收录理由

市面上多数中文NLP工具都以现代汉语为训练语料,碰到文言文往往力不从心,做古籍研究或文言处理的人很难找到趁手的工具。甲言正是冲着这个缺口来的:它是一套面向古汉语的Python工具包,能从语料中自动构建词库,完成分词、词性标注、断句和加标点。词库构建走无监督路线,靠点互信息和左右邻接熵从原始文本里提取词汇;标注和断句模型基于条件随机场或隐马尔可夫模型,普通笔记本就能跑,不需要GPU。对数字人文项目、古籍语料标注这类场景来说,它相当实用。需要留意的是,它目前只支持简体字,输入繁体文本得先转成简体。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目