#165 · 主分类: 自然语言处理与文本处理
chinese_text_normalization
asr
chinese
kaldi-asr
sparrowhawk
speech-recognition
text-normalization
thrax-gramma
用于语音处理的中文文本规范化
项目最后更新:03/18/23
GitHub Stars
740
Forks数量
151
贡献者数量
5
许可证
MIT
收录理由
中文语音识别和语音合成做到一定阶段,总会撞上原始转写文本与词典、下游系统所期望的干净文本之间的落差。这个项目直接补上这一环,提供一个开箱即用的规范化模块:把数字、日期、分数、金额、百分比、电话号码等转成对应的中文读法,同时支持中英文标点去除。它既能读纯文本,也能读Kaldi归档和TSV文件,因此可以轻松嵌入现有的Kaldi风格处理流程,几乎不需要额外配置。规范化规则基于可编辑的规则表,当你想追查某条语句为何被改写成这样时,规则的可追溯性会很有帮助。如果你想要一个能直接上手的中文文本规范化起点,而不是一个泛泛的NLP工具包,这个项目是相当完整且自洽的参考实现。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。