#57 · 主分类: 推理与本地部署
gpustack
ascend
cuda
deepseek
distributed-inference
genai
high-performance-inference
inference
llama
llm
llm-inference
llm-serving
maas
mindie
openai
qwen
rocm
sglang
vllm
用于高性能AI模型服务(vLLM、SGLang)和按需SSH访问GPU实例的GPU集群管理器。
项目最后更新:08/28/26
GitHub Stars
5.6K
Forks数量
631
贡献者数量
55
许可证
Apache-2.0
收录理由
GPUStack 面向需要在多台 GPU 上部署开源模型、却不想逐台手工配置机器的团队。它能把 vLLM、SGLang 这类推理引擎自动配好,适配合适的硬件,并暴露 OpenAI 兼容接口,现有应用无需额外改造即可接入。任务调度横跨本地服务器、Kubernetes 集群与云上 GPU,环境分散或请求突增时也能灵活应对。它还支持按需启动可通过 SSH 访问的 GPU 实例,方便做微调或交互式开发。预置的延迟、吞吐优化方案,加上投机解码与扩展 KV 缓存支持,省去从零调优整套系统的麻烦。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。