#34 · 主分类: 自然语言处理与文本处理

gigatoken

llm nlp tokenization tokenizer

语言模型分词,速度达GB/s

项目最后更新:08/06/26

GitHub Stars

4.1K

Forks数量

219

贡献者数量

1

许可证

MIT

收录理由

分词这一步平时不显眼,可一旦训练循环卡在它上面,整个项目的节奏都会被打乱。Gigatoken 用 Rust 实现,把文本转成 LLM 训练和微调所需的 token ID,同时提供兼容层,让你沿用 HuggingFace Tokenizers 或 tiktoken 的现有代码,不用改动数据处理逻辑就能获得更高吞吐。真正的多 GB/s 性能来自它的原生 API——Rust 直接读取文本文件,并做了激进的并行处理。项目在服务器和笔记本 CPU 上都跑过主流模型的基准测试,提速数据有实际硬件支撑。如果你经常要反复处理大规模语料,无论是准备数据集、预训练还是做蒸馏,省下的时间会非常可观。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目