GitHub Stars
808
Forks数量
88
贡献者数量
10
许可证
Apache-2.0
收录理由
MiNLP 是小米内部打磨过的中文处理组件集合,分词、结构化解析等模块已在真实业务流量中验证,并非只跑过公开数据集。其中 MiNLP-Tokenizer 作为中文分词库,以 Python 包形式提供,在 2020 年 11 月开源前已历经生产环境反复调优。仓库里还包含 duckling-fork-chinese,这是对 Facebook Duckling 的 JVM 分支,能把自然语言中的数字、日期、时间等表述转成结构化对象,适合语音助手、日程安排或表单自动填充这类需要抽取实体的场景。对于搭建中文 NLP 流水线的团队,尤其是要解析用户输入中实体的场景,这两个组件可以直接拿来用。不过要注意,词性标注、命名实体识别、依存句法分析等其余模块目前仍处于规划阶段,尚未发布,现阶段实际可用的就是分词器和结构化解析器。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。