#165 · 主分类: 自然语言处理与文本处理

chinese_text_normalization

asr chinese kaldi-asr sparrowhawk speech-recognition text-normalization thrax-gramma

用于语音处理的中文文本规范化

项目最后更新:03/18/23

GitHub Stars

740

Forks数量

151

贡献者数量

5

许可证

MIT

收录理由

中文语音识别和语音合成做到一定阶段,总会撞上原始转写文本与词典、下游系统所期望的干净文本之间的落差。这个项目直接补上这一环,提供一个开箱即用的规范化模块:把数字、日期、分数、金额、百分比、电话号码等转成对应的中文读法,同时支持中英文标点去除。它既能读纯文本,也能读Kaldi归档和TSV文件,因此可以轻松嵌入现有的Kaldi风格处理流程,几乎不需要额外配置。规范化规则基于可编辑的规则表,当你想追查某条语句为何被改写成这样时,规则的可追溯性会很有帮助。如果你想要一个能直接上手的中文文本规范化起点,而不是一个泛泛的NLP工具包,这个项目是相当完整且自洽的参考实现。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目