#134 · 主分类: 推理与本地部署
paddler
开源的LLM/VLM负载均衡器和服务平台,用于大规模自托管LLM(和VLM)🏓🦙 是llm-d、Docker Model Runner等项目的替代方案,但组件更少,部署更简单,围绕ggml生态系统构建。支持CPU和GPU运行。
项目最后更新:07/19/26
GitHub Stars
1.7K
Forks数量
97
贡献者数量
13
许可证
Apache-2.0
收录理由
自己搭建大模型推理服务,通常要处理一堆互相咬合的组件,光是配置和运维就够头疼。Paddler 把这件事简化到了两个部分:一个负责分发请求的 balancer,以及真正生成 token 和 embedding 的 agent。它内置了 llama.cpp 推理引擎,不需要再单独部署后端;请求缓冲机制让 agent 可以从零个实例开始,在流量到达时自动扩容,而且 agent 可以动态增删,和常见的自动伸缩工具配合得很顺。整个服务就是一个单一二进制文件,CPU 和 GPU 都能跑,还自带 Web 管理面板和监控指标,日常维护很方便。对于想控制成本、又不想把数据交给第三方的小型 DevOps 团队来说,Paddler 提供了一个很实在的选择。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。