#183 · 主分类: 推理与本地部署
vllm-cli
一个使用vLLM为LLM提供服务的命令行工具。
项目最后更新:01/25/26
GitHub Stars
506
Forks数量
29
贡献者数量
2
许可证
MIT
收录理由
手动跑 vLLM 往往要在命令行里堆一长串参数,重启服务时还得反复确认 GPU 上到底加载了哪些模型,稍不留神就乱了。这个命令行工具提供两种操作方式:日常使用可以进入菜单驱动的终端界面,实时查看 GPU 占用和系统状态;需要写脚本或做自动化时,也可以直接用简洁的命令行指令。它顺手解决了不少琐碎环节,比如自动发现本机已通过 HuggingFace 或 Ollama 下载的模型,为不同硬件准备现成的配置方案,启动前还会检查 GPU、内存和 CUDA 是否兼容。新加入的实验性功能还能把多个模型集中在一个 API 端点后面,根据请求压力动态唤醒或休眠 GPU。对于在单机或小型 GPU 设备上跑 vLLM 的人来说,这层轻量封装确实让引擎的日常运维省心很多。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。