#134 · 主分类: 推理与本地部署

paddler

ai llamacpp llm llmops load-balancer

开源的LLM/VLM负载均衡器和服务平台,用于大规模自托管LLM(和VLM)🏓🦙 是llm-d、Docker Model Runner等项目的替代方案,但组件更少,部署更简单,围绕ggml生态系统构建。支持CPU和GPU运行。

项目最后更新:07/19/26

GitHub Stars

1.7K

Forks数量

97

贡献者数量

13

许可证

Apache-2.0

收录理由

自己搭建大模型推理服务,通常要处理一堆互相咬合的组件,光是配置和运维就够头疼。Paddler 把这件事简化到了两个部分:一个负责分发请求的 balancer,以及真正生成 token 和 embedding 的 agent。它内置了 llama.cpp 推理引擎,不需要再单独部署后端;请求缓冲机制让 agent 可以从零个实例开始,在流量到达时自动扩容,而且 agent 可以动态增删,和常见的自动伸缩工具配合得很顺。整个服务就是一个单一二进制文件,CPU 和 GPU 都能跑,还自带 Web 管理面板和监控指标,日常维护很方便。对于想控制成本、又不想把数据交给第三方的小型 DevOps 团队来说,Paddler 提供了一个很实在的选择。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目