#8 · 主分类: 推理与本地部署

sglang

attention blackwell cuda deepseek diffusion glm gpt-oss inference llama llm minimax moe qwen qwen-image reinforcement-learning transformer vlm wan

SGLang 是一个用于大型语言模型和多模态模型的高性能服务框架。

项目最后更新:08/29/26

GitHub Stars

32.8K

Forks数量

8.3K

贡献者数量

1.8K

许可证

Apache-2.0

收录理由

SGLang 已经成为许多团队在自有硬件上部署开源语言模型和多模态模型时的默认选择。它把服务栈里那些不起眼却关键的环节都自己扛了下来:请求批处理、KV 缓存管理、结构化输出解码,以及把负载分散到多块 GPU 上。这意味着你可以直接为 DeepSeek、Llama、Qwen 或 GLM 搭起一个兼容 OpenAI 接口的服务端点,不必自己动手拼接底层管道。它的 RadixAttention 前缀缓存和针对特定模型优化的内核,在 NVIDIA 和 AMD 加速器上都能带来实实在在的吞吐提升,项目后来还扩展到了基于扩散模型的图像和视频生成。如果你正在为正式部署挑选运行时,SGLang 是值得第一批上测试台架的引擎之一,尤其是当你想在新模型发布当周就立刻跑起来的时候。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目