#135 · 主分类: 自然语言处理与文本处理
inltk
data-augmentation
deep-learning
indic-languages
nlp
pytorch
sentence-embeddings
sentence-encoding
sentence-similarity
word-embeddings
印度语言自然语言工具包,旨在为应用开发者提供开箱即用的各种NLP任务支持。
项目最后更新:01/20/24
GitHub Stars
837
Forks数量
158
贡献者数量
6
许可证
MIT
收录理由
iNLTK 把印度语言应用里常见的 NLP 任务都收进了一个 Python 包:分词、词与句子的向量表示、相似度计算、文本生成和分类。它自带十四个语言的预训练模型,从印地语、泰米尔语到梵语、泰卢固语,还覆盖了印地语+英语、泰米尔语+英语、马拉雅拉姆语+英语这类混合语码,做印度市场产品的团队不必为每种语言单独拼装模型。混合语码的支持尤其实在,因为印度用户实际打字时经常在印地语、泰米尔语或马拉雅拉姆语里夹英文。底层基于 PyTorch,每种语言都有对应的语言模型,既能应付快速原型,也能放进需要跨多种印度语言保持一致行为的生产流程。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。