#168 · 主分类: 推理与本地部署

chatglm.cpp

chatglm chatglm2 chatglm3 codegeex2-6b glm4 large-language-models nlp

ChatGLM-6B、ChatGLM2-6B、ChatGLM3和GLM4(V)的C++实现

项目最后更新:07/31/24

GitHub Stars

3.0K

Forks数量

326

贡献者数量

14

许可证

MIT

收录理由

ChatGLM.cpp 是一个基于 ggml 的轻量级 C++ 运行时,把 ChatGLM 家族的多个代际模型(从 6B 系列到 GLM-4 和 GLM-4V)都收拢在了一起。它和 llama.cpp 走的是同一条技术路线,主打在笔记本和边缘设备上跑模型:先把 Hugging Face 上的权重转成 int4 或 int8 量化的 GGML 格式,然后利用内存高效的 CPU 推理来运行,如果需要加速也可以调用 NVIDIA 或 Apple Silicon 的 GPU。流式输出、对 P-Tuning v2 和 LoRA 微调检查点的支持,加上 Python 绑定和 API 服务器,让开发者能很自然地把这些模型嵌进自己的应用里,而不必去依赖托管的在线服务。如果你正在评估 GLM 系列的自托管部署方案,或者只是想找一个专门为 GLM 架构调优的 llama.cpp 风格运行时,这个项目提供了一个非常实用的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目