GitHub Stars
15.5K
Forks数量
1.8K
贡献者数量
12
许可证
Other
收录理由
ChatGLM2-6B 对想跑双语对话模型、又不想额外添置硬件的团队来说,是个很实在的选项。它只有 6B 参数,延续了初代 ChatGLM-6B 低部署门槛的优点,但在推理和数学等任务上的表现提升明显,这也是二代值得升级的地方。借助 FlashAttention,上下文窗口拉长到 32K,处理长文档时不会很快丢信息;Multi-Query Attention 则同时降低了延迟和显存占用,用 INT4 量化后,6GB 显存的显卡也能撑住较长的多轮对话。仓库里直接给了权重、分词器和推理代码,还附带了 P-Tuning v2 和全参微调脚本,从下载到做出一个定制助手,不用自己东拼西凑多个项目。做中文相关的工作时,拿它当底座很顺手,周边那些加速和界面项目也让生产环境集成省了不少事。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。