#3 · 主分类: 自然语言处理与文本处理

tokenizers

bert gpt language-model natural-language-processing natural-language-understanding nlp transformers

💥 面向研究与生产优化的快速先进分词器

项目最后更新:08/27/26

GitHub Stars

11.0K

Forks数量

1.2K

贡献者数量

150

许可证

Apache-2.0

收录理由

许多训练Transformer模型的人其实早已用过这个库,只是未必察觉——Hugging Face Transformers底层的分词环节正是由它支撑的。它实现了BPE、WordPiece和Unigram三种主流算法,只要指向一个文本文件夹,就能在自有语料上训练出定制词表。Rust编写的内核让训练和分词都快得惊人,服务器CPU上处理1GB文本用不了20秒,规模再大预处理也不会拖后腿。截断、填充、添加特殊符号这些琐碎步骤它都包办了,还带有对齐追踪,随时能把某个token映射回原始句子中的确切片段。对于需要训练与推理时分词完全一致的团队,或是想用Python、Node.js、Rust绑定的开发者,它提供的是一套可靠的基础设施,而不是用完即弃的小工具。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目