#57 · 主分类: 推理与本地部署

gpustack

ascend cuda deepseek distributed-inference genai high-performance-inference inference llama llm llm-inference llm-serving maas mindie openai qwen rocm sglang vllm

用于高性能AI模型服务(vLLM、SGLang)和按需SSH访问GPU实例的GPU集群管理器。

项目最后更新:08/28/26

GitHub Stars

5.6K

Forks数量

631

贡献者数量

55

许可证

Apache-2.0

收录理由

GPUStack 面向需要在多台 GPU 上部署开源模型、却不想逐台手工配置机器的团队。它能把 vLLM、SGLang 这类推理引擎自动配好,适配合适的硬件,并暴露 OpenAI 兼容接口,现有应用无需额外改造即可接入。任务调度横跨本地服务器、Kubernetes 集群与云上 GPU,环境分散或请求突增时也能灵活应对。它还支持按需启动可通过 SSH 访问的 GPU 实例,方便做微调或交互式开发。预置的延迟、吞吐优化方案,加上投机解码与扩展 KV 缓存支持,省去从零调优整套系统的麻烦。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目