#114 · 主分类: 推理与本地部署

node-llama-cpp

ai bindings catai cmake cmake-js cuda embedding function-calling gguf gpu grammar json-schema llama llama-cpp llm metal nodejs prebuilt-binaries self-hosted vulkan

通过llama.cpp的node.js绑定在本地运行AI模型,并在生成层面对模型输出强制执行JSON模式。

项目最后更新:08/11/26

GitHub Stars

2.2K

Forks数量

215

贡献者数量

14

许可证

MIT

收录理由

这是一个面向 Node.js 的 llama.cpp 绑定,让你能在自己的进程里直接跑 GGUF 模型,而不是去调用托管的 API。它给常见平台都准备了预编译的二进制包,需要的时候也会回退到从源码编译,所以装好包、加载模型就能用,省去不少折腾。真正的亮点在输出控制上:你可以在生成时就强制模型遵循某个 JSON schema 或语法,还能给模型挂上可调用的函数,做 embedding 也没问题,这样一来,模型吐出来的原始内容可以直接当程序输入用,不用靠脆弱的字符串解析。GPU 加速走 Metal、CUDA 或 Vulkan,并且是自动检测的,后端配置基本不用你操心。如果你正在做 JavaScript 应用里的本地或私有化 LLM 功能,这个库是个很实在的集成点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目