#107 · 主分类: 深度学习框架

BitNet

artificial-intelligence deep-neural-networks deeplearning gpt4 machine-learning multimodal multimodal-deep-learning

PyTorch实现"BitNet: Scaling 1-bit Transformers for Large Language Models"

项目最后更新:08/28/26

GitHub Stars

1.9K

Forks数量

172

贡献者数量

10

许可证

MIT

收录理由

这个仓库把模型量化推向了极致:权重不再用全精度浮点,而是压缩到大约1比特的精度来存储。作者用PyTorch实现了论文中的BitNet设计,核心是一个叫BitLinear的模块,可以替换Transformer里常用的nn.Linear层,同时还附带了示例脚本、多头分组查询注意力变体,以及一个可以直接实例化的完整BitNetTransformer类。README里也把限制说得很清楚:这些层必须从头训练或微调才能发挥作用,不能直接套用到已经训练好的模型上。所以如果你想亲眼看看低比特语言模型在实际中表现如何,这里是个不错的起点。不过代码里有些部分还在重构,使用时会遇到一些粗糙的地方,需要有点心理准备。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目