#203 · 主分类: 推理与本地部署

qwen-vllm

通义千问VLLM推理部署DEMO

项目最后更新:03/28/24

GitHub Stars

644

Forks数量

92

贡献者数量

2

许可证

Other

收录理由

要把通义千问模型真正跑成一个对外提供服务的HTTP接口,通常得自己从vLLM的异步服务端、客户端和聊天界面这些零散示例里拼凑。这个仓库把这些组装工作替你做了:它展示了vLLM的连续批处理机制在后台线程中运行,通过FastAPI和uvicorn提供HTTP端点,推理结果以流式方式返回给客户端,同时附带了客户端脚本和基于Gradio的聊天界面,支持多轮对话。作者还解释了千问的提示词格式,以及预训练基础版和聊天微调版在输入构造上的差异,这对你决定怎么组织输入很有帮助。虽然这只是一个演示项目,不是经过加固的生产级服务,但作为一份可运行的参考,它能省去你阅读好几份官方示例再自己动手拼接的时间。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目