#185 · 主分类: 自然语言处理与文本处理
Jiayan
ancient-chinese
classical-chinese
nlp
甲言,专注于古代汉语(古汉语/古文/文言文/文言)处理的NLP工具包,支持文言词库构建、分词、词性标注、断句和标点。
项目最后更新:11/02/21
GitHub Stars
677
Forks数量
76
贡献者数量
2
许可证
MIT
收录理由
市面上多数中文NLP工具都以现代汉语为训练语料,碰到文言文往往力不从心,做古籍研究或文言处理的人很难找到趁手的工具。甲言正是冲着这个缺口来的:它是一套面向古汉语的Python工具包,能从语料中自动构建词库,完成分词、词性标注、断句和加标点。词库构建走无监督路线,靠点互信息和左右邻接熵从原始文本里提取词汇;标注和断句模型基于条件随机场或隐马尔可夫模型,普通笔记本就能跑,不需要GPU。对数字人文项目、古籍语料标注这类场景来说,它相当实用。需要留意的是,它目前只支持简体字,输入繁体文本得先转成简体。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。