#3 · 主分类: 自然语言处理与文本处理
tokenizers
💥 面向研究与生产优化的快速先进分词器
项目最后更新:08/27/26
GitHub Stars
11.0K
Forks数量
1.2K
贡献者数量
150
许可证
Apache-2.0
收录理由
许多训练Transformer模型的人其实早已用过这个库,只是未必察觉——Hugging Face Transformers底层的分词环节正是由它支撑的。它实现了BPE、WordPiece和Unigram三种主流算法,只要指向一个文本文件夹,就能在自有语料上训练出定制词表。Rust编写的内核让训练和分词都快得惊人,服务器CPU上处理1GB文本用不了20秒,规模再大预处理也不会拖后腿。截断、填充、添加特殊符号这些琐碎步骤它都包办了,还带有对齐追踪,随时能把某个token映射回原始句子中的确切片段。对于需要训练与推理时分词完全一致的团队,或是想用Python、Node.js、Rust绑定的开发者,它提供的是一套可靠的基础设施,而不是用完即弃的小工具。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。