GitHub Stars
937
Forks数量
122
贡献者数量
17
许可证
MIT
收录理由
在 Go 生态里,若想在自己的进程内直接跑本地语言模型,而不是去调一个独立的推理服务,这个绑定库提供了一条清晰的路。它把 llama.cpp 封装在高层次上,繁重的计算仍留在 C/C++ 引擎里,因此开发者能避开多数底层 cgo 的麻烦,性能也说得过去。只支持当下的 GGUF 模型格式,加速方面,CPU 上可用 OpenBLAS,NVIDIA GPU 用 CuBLAS,另有 ROCm、OpenCL,苹果芯片上则支持 Metal。这让它很适合那种希望自包含、带着本地模型上线的桌面工具和边缘服务。上游引擎以 git 子模块引入,附带示例覆盖了绑定的构建和模型运行,照着改就能用到自己的代码里。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
langchain
智能体工程平台。
dify
在一个协作工作区中构建Agentic工作流、RAG管道,支持丰富的AI模型和工具。可部署在云、VPC或自托管环境,团队无需重建技术栈即可从原型走向生产。
headroom
压缩工具输出、日志、文件和RAG块,再送入LLM。编码代理减少20% token,JSON减少60-95% token,答案不变。提供库、代理、MCP服务器。
litellm
最快的、最轻量的AI网关。Rust核心,Python SDK。以OpenAI(或原生)格式调用100多种LLM API,具备成本追踪、护栏、负载均衡和日志记录 [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]
llama_index
LlamaIndex 是领先的文档代理和 OCR 平台