GitHub Stars
10.7K
Forks数量
1.1K
贡献者数量
10
许可证
MIT
收录理由
minbpe 用精简而清晰的代码实现了字节级 BPE 算法,这正是 GPT、Llama、Mistral 等模型训练分词器时所采用的方法。仓库里包含三个分词器类:一个最基础的版本,一个基于正则表达式、能避免跨类别合并的变体,还有一个完全复刻 tiktoken 输出结果的 GPT-4 包装器。它们都支持训练、编码和解码,开发人员想自己定制分词器,或者想搞明白分词内部机制而不想直接钻进 tiktoken 优化过的复杂源码时,这份代码是很好的起点。由于代码刻意保持小巧,也很适合团队学习 LLM 基础时当教材用。如果项目需要可控、可审查的分词逻辑,把它当作参考实现来改造也相当顺手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。